AI全栈知识01:大模型是什么??从Token到生成
AI全栈知识01:大模型是什么??从Token到生成

写在前面
如果你是一名运维或DevOps工程师,最近可能经常听到"大模型"、“Token”、“Prompt"这些词。老板让你部署一个AI服务,同事在讨论模型推理延迟,JD上写着要求"了解LLM原理”……
但你可能心里嘀咕:大模型到底是怎么工作的?它是怎么"回答问题"的?
这篇文章就用最通俗的方式帮你搞清楚。不讲数学公式,不写代码,先建立正确的认知。
大模型不是"搜索引擎"
很多人第一直觉认为:大模型是在某个"数据库"里查找答案,找到最匹配的返回给你。
这是错的。
大模型的工作方式更像一个**“造句高手”**??它不是在"找答案",而是一个字一个字"写"出来的。

大模型只做一件事:预测下一个字
不管模型有多大、多聪明,它的核心工作就一件事:
给定前面的文字,预测下一个最可能出现的字是什么。
举个生活中的例子
你发微信打字时,输入法会给你"联想推荐":
你输入:"今天天气"
输入法推荐:真好 | 不错 | 怎么样
大模型做的事情,就是一个超级强化版的输入法联想??只不过它不是推荐3个候选词,而是从几万个字里选出概率最高的那一个,然后一个接一个地生成整段回答。
完整的生成过程
你问模型:“什么是K8s?”
模型的工作过程(简化版):
输入:什么是K8s?
预测第1个字:→ "K"(概率最高)
预测第2个字:→ "8"
预测第3个字:→ "s"
预测第4个字:→ "是"
预测第5个字:→ "一"
预测第6个字:→ "个"
预测第7个字:→ "容"
预测第8个字:→ "器"
预测第9个字:→ "编"
预测第10个字:→ "排"
...
直到预测出"结束"信号 → 停止生成
最终输出:“K8s是一个容器编排平台…”

这解释了很多现象
| 现象 | 原因 |
|---|---|
| 同一个问题问两次,回答不完全一样 | 因为是"生成"的,每次预测有随机性 |
| 模型有时候"胡说八道" | 它只是在预测最可能的下一个字,不是在查事实 |
| 回答可以通过"温度"控制创意度 | temperature高→随机性大→更"发散";temperature低→更"确定" |
| 流式输出像"打字"一样一个字一个字出来 | 因为它本来就是一个字一个字生成的 |
什么是Token
模型不是按"字"处理文本的,而是按Token处理的。
Token是什么
Token是模型的"最小处理单元",可以理解为模型眼中的"一个词块"。
中文:大约1个字 = 1-2个token
英文:大约1个单词 = 1-3个token
具体例子:
"你好世界" → ["你", "好", "世界"] → 3个token
"Kubernetes" → ["Kub", "erne", "tes"] → 3个token
"I love AI" → ["I", " love", " AI"] → 3个token
为什么运维需要关心Token
| 场景 | Token的影响 |
|---|---|
| API计费 | 按Token收费(输入token + 输出token) |
| 上下文限制 | 模型有最大Token数限制(如32768),超了就"记不住"前面的内容 |
| 推理速度 | 生成的Token越多,响应时间越长 |
| 显存占用 | 上下文越长(Token越多),占用的GPU显存越多 |
一个实际的API响应
{
"usage": {
"prompt_tokens": 25, ← 你的问题占了25个token
"completion_tokens": 18, ← 模型回答用了18个token
"total_tokens": 43 ← 总共消耗43个token(计费依据)
}
}

训练 vs 推理:运维必须分清的两件事
生活类比
| 训练 | 推理 | |
|---|---|---|
| 类比 | 厨师学做菜(在厨师学校学三年) | 厨师炒菜(每天给客人做饭) |
| 谁做 | 算法团队/大公司(OpenAI、阿里等) | 你(运维部署推理服务) |
| 频率 | 几个月做一次 | 每秒都在做(每个用户请求) |
| 资源 | 巨大(几十张A100跑几周) | 相对小(1张T4就能跑小模型) |
| 产物 | 模型文件(厨师的"手艺") | 回答文本(做好的"菜") |
为什么要分清
因为你的工作是部署和运维推理服务,不是训练模型:
算法团队的事:收集数据 → 训练模型 → 产出模型文件
↓ 给你一个文件
你的事:拿到模型文件 → 部署到GPU服务器 → 对外提供API → 监控和优化

模型大小与GPU的关系
模型的"知识"存储在参数里。参数越多,模型越"聪明",但也越占显存。
参数量 = 模型的"大脑容量"
| 模型 | 参数量 | 通俗理解 | 文件大小 | 需要的GPU |
|---|---|---|---|---|
| Qwen2-1.5B | 15亿个参数 | 小学生 | ~3GB | T4(16GB)轻松跑 |
| Qwen2-7B | 70亿个参数 | 大学生 | ~14GB | T4勉强/A10G(24GB) |
| Llama3-70B | 700亿个参数 | 博士生 | ~140GB | A100×2起步 |
| GPT-4 | 传说万亿+ | 全科专家 | 不公开 | 几百张A100集群 |
为什么模型大了需要更多显存
模型运行时,所有参数都要加载到GPU显存里。就像电脑运行程序要加载到内存一样??程序越大,需要的内存越大。
T4显存16GB的分配:
模型参数占用:~3GB(1.5B模型)
KV Cache(处理请求的临时空间):~9GB
系统开销:~1GB
剩余:~3GB
这就是为什么选GPU时要看显存而不是看"算力"??显存不够,模型根本加载不进去。
Prompt = 你发给模型的完整输入
当你调用AI的API时,发送的内容叫做Prompt。它由三种角色组成:
{
"messages": [
{"role": "system", "content": "你是一个K8s运维专家,回答要简洁专业"},
{"role": "user", "content": "Pod一直Pending怎么排查?"},
{"role": "assistant", "content": "先看Events..."},
{"role": "user", "content": "Events里显示资源不足"}
]
}
| 角色 | 作用 | 谁来写 |
|---|---|---|
| system | 设定AI的"人设"和行为规则 | 开发者(一开始就定好) |
| user | 用户的输入/问题 | 最终用户 |
| assistant | AI之前的回答(用于多轮对话) | 模型之前生成的 |
模型会综合所有这些内容来"预测下一个Token"??所以system的设定确实会影响回答风格。
Transformer:大模型背后的架构
你不需要理解Transformer的数学原理,但需要知道这个名字,因为面试会提。
注意力机制:模型怎么知道"该重点看哪里"
生活类比:
你在嘈杂的食堂里跟朋友聊天:
- 朋友的声音 → 你重点听(注意力高)
- 旁边桌的闲聊 → 你稍微听到(注意力低)
- 远处的背景噪音 → 你基本忽略(注意力接近0)
你的大脑自动"分配注意力"??重要的信息听清楚,不重要的过滤掉。
大模型做的一模一样: 生成每个字时,它会"看"前面所有的字,但不是每个字都同等重要??跟当前要生成的字关系大的就"重点看",关系小的就"忽略"。
具体例子
用户问:“K8s的Service有几种类型”
模型要生成回答的第一个字"四"时:
"K8s" → 有点关系(提供了技术领域背景) → 中等注意力
"的" → 没什么用(语法虚词) → 几乎忽略
"Service" → 很重要!(问的主体) → 高注意力 ←
"有几种" → 一般(引导词) → 低注意力
"类型" → 很重要!(问的是什么) → 高注意力 ←
所以模型"重点参考"了"Service"和"类型"这两个词,生成了"四"??因为Service确实有四种类型。
为什么需要注意力机制
如果没有注意力机制,模型会平等对待每个字??就像你在食堂里同时认真听所有人说话,结果什么都听不清。
有了注意力机制:模型能从一长段文字中精准找到跟当前任务相关的关键信息,忽略无关的部分。
这就是为什么大模型能处理几千甚至几万字的长文本还能"理解"??它不是记住每个字,而是生成每个回答时动态"聚焦"最相关的部分。

面试怎么说
如果被问"你了解Transformer吗",说:
“Transformer的核心是Self-Attention机制,让模型在生成每个Token时能关注到输入中所有位置的信息,通过注意力权重判断哪些内容更重要。比如模型回答K8s相关的问题时,会重点关注’Service’和’类型’这些关键词,而忽略’的’这类虚词。GPT系列用的是Decoder-only架构。”
关键概念总结
| 概念 | 一句话理解 | 运维为什么要知道 |
|---|---|---|
| 大模型(LLM) | 超大的"下一个字预测器" | 知道它的能力和局限 |
| Token | 模型的最小处理单元(≈1个中文字) | API计费、上下文限制、性能优化 |
| 训练 | 教模型学知识(不是你的活) | 知道模型文件怎么来的 |
| 推理 | 让模型回答问题(你的活) | 这就是你要部署和运维的 |
| 参数/权重 | 模型的"知识",存在文件里 | 决定需要多大的GPU |
| Prompt | 发给模型的完整输入 | 影响回答质量 |
| Temperature | 控制回答的随机程度 | 业务需要时调整 |
| Transformer | 大模型的底层架构 | 面试会问 |
延伸思考
| 问题 | 答案 |
|---|---|
| 大模型会"记住"我之前说的话吗? | 不会。每次请求都是独立的,"记忆"是通过把历史对话放在Prompt里实现的 |
| 模型为什么会"幻觉"(胡说八道)? | 因为它只是在预测最可能的下一个字,不是在查事实 |
| 模型能学习新知识吗? | 训练时能学。推理时不能??它只能用训练时学到的"旧知识" |
| 怎么让模型用到最新信息? | RAG(检索增强生成)??先搜最新资料,塞到Prompt里给模型参考。后面会专门讲 |
小结
本篇核心收获:
- 大模型不是"查答案",是一个字一个字"生成"的
- Token是计费和性能的基本单位
- 训练是算法团队的事,推理是你的事
- 模型越大越聪明,但也越占显存
- Prompt里的system/user/assistant各有作用
下一篇预告
AI全栈知识02:Prompt Engineering??让AI听懂你的话
下一篇我们将学习如何写好Prompt:
- 为什么同一个模型有时候回答很好有时候很烂?
- System Prompt怎么设计?
- Few-shot和CoT思维链是什么?
- 运维场景的Prompt实战模板
参考链接
更多推荐

所有评论(0)