AI全栈知识01:大模型是什么??从Token到生成

在这里插入图片描述

写在前面

如果你是一名运维或DevOps工程师,最近可能经常听到"大模型"、“Token”、“Prompt"这些词。老板让你部署一个AI服务,同事在讨论模型推理延迟,JD上写着要求"了解LLM原理”……

但你可能心里嘀咕:大模型到底是怎么工作的?它是怎么"回答问题"的?

这篇文章就用最通俗的方式帮你搞清楚。不讲数学公式,不写代码,先建立正确的认知。


大模型不是"搜索引擎"

很多人第一直觉认为:大模型是在某个"数据库"里查找答案,找到最匹配的返回给你。

这是错的。

大模型的工作方式更像一个**“造句高手”**??它不是在"找答案",而是一个字一个字"写"出来的。

在这里插入图片描述


大模型只做一件事:预测下一个字

不管模型有多大、多聪明,它的核心工作就一件事:

给定前面的文字,预测下一个最可能出现的字是什么。

举个生活中的例子

你发微信打字时,输入法会给你"联想推荐":

你输入:"今天天气"
输入法推荐:真好 | 不错 | 怎么样

大模型做的事情,就是一个超级强化版的输入法联想??只不过它不是推荐3个候选词,而是从几万个字里选出概率最高的那一个,然后一个接一个地生成整段回答。

完整的生成过程

你问模型:“什么是K8s?”

模型的工作过程(简化版):

输入:什么是K8s?
预测第1个字:→ "K"(概率最高)
预测第2个字:→ "8"
预测第3个字:→ "s"
预测第4个字:→ "是"
预测第5个字:→ "一"
预测第6个字:→ "个"
预测第7个字:→ "容"
预测第8个字:→ "器"
预测第9个字:→ "编"
预测第10个字:→ "排"
...
直到预测出"结束"信号 → 停止生成

最终输出:“K8s是一个容器编排平台…”

在这里插入图片描述


这解释了很多现象

现象 原因
同一个问题问两次,回答不完全一样 因为是"生成"的,每次预测有随机性
模型有时候"胡说八道" 它只是在预测最可能的下一个字,不是在查事实
回答可以通过"温度"控制创意度 temperature高→随机性大→更"发散";temperature低→更"确定"
流式输出像"打字"一样一个字一个字出来 因为它本来就是一个字一个字生成的

什么是Token

模型不是按"字"处理文本的,而是按Token处理的。

Token是什么

Token是模型的"最小处理单元",可以理解为模型眼中的"一个词块"。

中文:大约1个字 = 1-2个token
英文:大约1个单词 = 1-3个token

具体例子:
  "你好世界" → ["你", "好", "世界"] → 3个token
  "Kubernetes" → ["Kub", "erne", "tes"] → 3个token
  "I love AI" → ["I", " love", " AI"] → 3个token

为什么运维需要关心Token

场景 Token的影响
API计费 按Token收费(输入token + 输出token)
上下文限制 模型有最大Token数限制(如32768),超了就"记不住"前面的内容
推理速度 生成的Token越多,响应时间越长
显存占用 上下文越长(Token越多),占用的GPU显存越多

一个实际的API响应

{
  "usage": {
    "prompt_tokens": 25,      ← 你的问题占了25个token
    "completion_tokens": 18,   ← 模型回答用了18个token
    "total_tokens": 43         ← 总共消耗43个token(计费依据)
  }
}

在这里插入图片描述


训练 vs 推理:运维必须分清的两件事

生活类比

训练 推理
类比 厨师学做菜(在厨师学校学三年) 厨师炒菜(每天给客人做饭)
谁做 算法团队/大公司(OpenAI、阿里等) (运维部署推理服务)
频率 几个月做一次 每秒都在做(每个用户请求)
资源 巨大(几十张A100跑几周) 相对小(1张T4就能跑小模型)
产物 模型文件(厨师的"手艺") 回答文本(做好的"菜")

为什么要分清

因为你的工作是部署和运维推理服务,不是训练模型:

算法团队的事:收集数据 → 训练模型 → 产出模型文件
      ↓ 给你一个文件
你的事:拿到模型文件 → 部署到GPU服务器 → 对外提供API → 监控和优化

在这里插入图片描述


模型大小与GPU的关系

模型的"知识"存储在参数里。参数越多,模型越"聪明",但也越占显存。

参数量 = 模型的"大脑容量"

模型 参数量 通俗理解 文件大小 需要的GPU
Qwen2-1.5B 15亿个参数 小学生 ~3GB T4(16GB)轻松跑
Qwen2-7B 70亿个参数 大学生 ~14GB T4勉强/A10G(24GB)
Llama3-70B 700亿个参数 博士生 ~140GB A100×2起步
GPT-4 传说万亿+ 全科专家 不公开 几百张A100集群

为什么模型大了需要更多显存

模型运行时,所有参数都要加载到GPU显存里。就像电脑运行程序要加载到内存一样??程序越大,需要的内存越大。

T4显存16GB的分配:
  模型参数占用:~3GB(1.5B模型)
  KV Cache(处理请求的临时空间):~9GB
  系统开销:~1GB
  剩余:~3GB

这就是为什么选GPU时要看显存而不是看"算力"??显存不够,模型根本加载不进去。


Prompt = 你发给模型的完整输入

当你调用AI的API时,发送的内容叫做Prompt。它由三种角色组成:

{
  "messages": [
    {"role": "system", "content": "你是一个K8s运维专家,回答要简洁专业"},
    {"role": "user", "content": "Pod一直Pending怎么排查?"},
    {"role": "assistant", "content": "先看Events..."},
    {"role": "user", "content": "Events里显示资源不足"}
  ]
}
角色 作用 谁来写
system 设定AI的"人设"和行为规则 开发者(一开始就定好)
user 用户的输入/问题 最终用户
assistant AI之前的回答(用于多轮对话) 模型之前生成的

模型会综合所有这些内容来"预测下一个Token"??所以system的设定确实会影响回答风格。


Transformer:大模型背后的架构

你不需要理解Transformer的数学原理,但需要知道这个名字,因为面试会提。

注意力机制:模型怎么知道"该重点看哪里"

生活类比:

你在嘈杂的食堂里跟朋友聊天:

  • 朋友的声音 → 你重点听(注意力高)
  • 旁边桌的闲聊 → 你稍微听到(注意力低)
  • 远处的背景噪音 → 你基本忽略(注意力接近0)

你的大脑自动"分配注意力"??重要的信息听清楚,不重要的过滤掉。

大模型做的一模一样: 生成每个字时,它会"看"前面所有的字,但不是每个字都同等重要??跟当前要生成的字关系大的就"重点看",关系小的就"忽略"。

具体例子

用户问:“K8sService有几种类型

模型要生成回答的第一个字"四"时:

"K8s"     → 有点关系(提供了技术领域背景)  → 中等注意力
"的"      → 没什么用(语法虚词)            → 几乎忽略
"Service" → 很重要!(问的主体)            → 高注意力 ←
"有几种"  → 一般(引导词)                  → 低注意力
"类型"    → 很重要!(问的是什么)          → 高注意力 ←

所以模型"重点参考"了"Service"和"类型"这两个词,生成了"四"??因为Service确实有四种类型。

为什么需要注意力机制

如果没有注意力机制,模型会平等对待每个字??就像你在食堂里同时认真听所有人说话,结果什么都听不清。

有了注意力机制:模型能从一长段文字中精准找到跟当前任务相关的关键信息,忽略无关的部分。

这就是为什么大模型能处理几千甚至几万字的长文本还能"理解"??它不是记住每个字,而是生成每个回答时动态"聚焦"最相关的部分。

在这里插入图片描述

面试怎么说

如果被问"你了解Transformer吗",说:

“Transformer的核心是Self-Attention机制,让模型在生成每个Token时能关注到输入中所有位置的信息,通过注意力权重判断哪些内容更重要。比如模型回答K8s相关的问题时,会重点关注’Service’和’类型’这些关键词,而忽略’的’这类虚词。GPT系列用的是Decoder-only架构。”


关键概念总结

概念 一句话理解 运维为什么要知道
大模型(LLM) 超大的"下一个字预测器" 知道它的能力和局限
Token 模型的最小处理单元(≈1个中文字) API计费、上下文限制、性能优化
训练 教模型学知识(不是你的活) 知道模型文件怎么来的
推理 让模型回答问题(你的活) 这就是你要部署和运维的
参数/权重 模型的"知识",存在文件里 决定需要多大的GPU
Prompt 发给模型的完整输入 影响回答质量
Temperature 控制回答的随机程度 业务需要时调整
Transformer 大模型的底层架构 面试会问

延伸思考

问题 答案
大模型会"记住"我之前说的话吗? 不会。每次请求都是独立的,"记忆"是通过把历史对话放在Prompt里实现的
模型为什么会"幻觉"(胡说八道)? 因为它只是在预测最可能的下一个字,不是在查事实
模型能学习新知识吗? 训练时能学。推理时不能??它只能用训练时学到的"旧知识"
怎么让模型用到最新信息? RAG(检索增强生成)??先搜最新资料,塞到Prompt里给模型参考。后面会专门讲

小结

本篇核心收获:

  1. 大模型不是"查答案",是一个字一个字"生成"的
  2. Token是计费和性能的基本单位
  3. 训练是算法团队的事,推理是你的事
  4. 模型越大越聪明,但也越占显存
  5. Prompt里的system/user/assistant各有作用

下一篇预告

AI全栈知识02:Prompt Engineering??让AI听懂你的话

下一篇我们将学习如何写好Prompt:

  • 为什么同一个模型有时候回答很好有时候很烂?
  • System Prompt怎么设计?
  • Few-shot和CoT思维链是什么?
  • 运维场景的Prompt实战模板

参考链接

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐