大家好,我是微信公众号技述馆。
在 AI 圈,“堆参数” 曾是公认的致胜法则。GPT-3 用 1750 亿参数惊艳世界,Grok-3 以 1.2 万亿参数刷新认知,Scaling Law(规模定律)仿佛一张通往通用智能的船票 —— 只要数据、算力、参数足够多,模型能力就能无限增长。

但当模型规模冲向千亿、万亿级时,研究者们发现了一个残酷现实:参数翻倍,能力却只增长了微不足道的一点点,Scaling Law 的边际效益正在急速递减。就像给一块已经吃饱的海绵浇水,再多水分也无法被吸收。

于是业界的目光开始从 “预训练” 转向 “后训练”。DeepSeek R1 用 RLVR 把推理能力拉满,Google Gemini 更是靠精细化后训练稳居第一梯队。如今,“梭哈后训练” 已成共识 ——​**真正决定大模型上限的,不是预训练时堆了多少数据,而是后训练时如何 “精雕细琢”**​。

作为普通开发者或 AI 爱好者,该如何理解后训练?又该掌握哪些核心方法?今天我们就用一篇文章,把大模型后训练的逻辑讲清楚。

为什么预训练模型 “不好用”?

先从一个简单问题说起:当你问 “美国的首都是什么” 时,为什么有些模型会先输出问号,再絮絮叨叨解释,而有些模型能直接给出 “华盛顿特区” 的答案?

这背后正是 “预训练模型” 与 “指令微调模型” 的核心区别。

预训练模型的目标很单纯:​预测下一个 token​。它在海量互联网文本上学习,比如看到 “美国的首都是”,就会根据训练数据里的常见搭配,先补出 “什么?”,再接着生成 “美国的首都是华盛顿特区”—— 本质上是在 “续写句子”,而非 “回答问题”。

而经过后训练的指令微调模型,目标变成了​理解并满足用户意图​。它通过高质量的 “指令 - 回答” 数据学习,知道用户问 “首都是什么” 时,需要的是直接、准确的答案,而非机械的文本续写。

这种差异,决定了预训练模型只能作为 “基础模型”,而真正能落地到对话、推理、代码生成等场景的,必须经过后训练的 “改造”。

更关键的是,后训练用的数据量远小于预训练(通常只有 1 万 - 10 万个样本),但质量极高 —— 每一条数据都经过筛选,甚至由人类专家或顶级模型撰写。如果说预训练是 “广撒网” 吸收知识,那后训练就是 “精施肥” 优化能力,性价比远超单纯堆参数。

后训练的核心两步:从 SFT 到 RL,缺一不可

后训练不是单一技术,而是一套 “组合拳”。目前主流的流程,都离不开 “监督微调(SFT)” 和 “强化学习(RL)” 两个核心阶段,就像先给模型 “打基础”,再帮它 “提能力”。

第一步:SFT(监督微调)—— 给模型立 “行为准则”

SFT 的本质,是用 “标准答案” 教模型如何响应指令。比如我们收集 10 万个 “用户提问 - 理想回答” 对(比如 “如何煮米饭” 对应 “1. 洗米 2. 加水 3. 加热”),然后用这些数据微调预训练模型,让它学会 “用户要什么,就给什么”。

这一步的关键,不是数据量多,而是​数据质量高​。预训练时,少量噪声数据可以被海量优质数据 “稀释”,但 SFT 数据只要有 1% 的错误,就可能让模型学会坏毛病 —— 比如数学题的错误解法、逻辑链的漏洞,甚至是不礼貌的语气。

举个例子:如果 SFT 数据里有一道数学题,正确答案是 “2+3=5”,但标注错误写成了 “6”,模型就可能把这个错误记下来,后续遇到类似题目都算错。因此,SFT 数据必须经过严格的 “质量管控”:

  • 正确性:数学题要重新计算,代码要实际运行,事实性问题要查权威来源;
  • 一致性:所有回答的语气、格式要统一(比如都用 “1.2.3.” 分点,不用 “首先 / 其次”);
  • 完整性:不能只给 “半句话” 答案(比如问 “如何写简历”,不能只说 “要写经历”,还要讲清具体模块)。

很多开源模型效果不好,问题往往出在 SFT 数据上 —— 要么数据来源杂乱,要么没做去重去噪。反过来,像 GPT-3.5、Gemini 这些模型,之所以对话流畅,核心就是 SFT 阶段打下了扎实的 “行为准则”。

第二步:RL(强化学习)—— 让模型 “越用越好”

SFT 能让模型 “合格”,但要让模型 “优秀”,还得靠 RL。毕竟 SFT 教的是 “标准答案”,而真实场景中,用户需求千变万化 —— 比如有人喜欢简洁回答,有人需要详细解释,有人问的问题没有唯一答案(比如 “推荐一本小说”)。

RL 的核心逻辑,是给模型 “反馈”:做得好就奖励,做得不好就惩罚,让模型在不断试错中优化行为。目前主流的 RL 方法,各有侧重,适用于不同场景:

方法 核心逻辑 适用场景 优势与挑战
RLHF 用人类偏好训练 “奖励模型” 日常对话、安全对齐 效果稳定,但人工标注成本高
RLAIF 用 AI(比如大模型)给反馈 大规模对齐、风格微调 成本低易扩展,但可能有 AI 偏见
RLVR 用 “可验证结果” 当奖励(如代码运行成功、数学题算对) 数学推理、代码生成 精度高无噪声,但适用场景有限

比如 DeepSeek R1 之所以在数学推理上表现突出,就是用了 RLVR:模型解完一道数学题后,系统会自动检查答案是否正确,正确就给高奖励,错误就给低奖励,久而久之,模型就学会了更严谨的推理逻辑。

而 OpenAI 的 GPT-4,更可能融合了多种 RL 方法:日常对话用 RLHF 保证自然,代码生成用 RLVR 确保正确,敏感话题用 RLAIF 强化安全 —— 这也是顶级模型 “面面俱到” 的秘诀。

后训练的 “隐形门槛”:评估比训练更重要

很多人以为,后训练只要把 SFT 和 RL 流程跑通就行,但实际上,​**评估才是决定后训练效果的 “隐形门槛”**​。就像学生考试,不仅要学知识,还要通过考试发现薄弱点,才能针对性提升。

后训练的评估,不能只看 “准确率” 这种简单指标,而要从多个维度入手,常见的评估方式有两种:

1. 自动评估:快速筛错

自动评估适合快速检验模型的 “硬能力”,比如:

  • 知识类问题:用 MMLU 数据集(涵盖 57 个学科)测模型的知识广度;
  • 指令跟随:用 IFEval 数据集测模型是否能准确理解复杂指令;
  • 代码能力:让模型写代码,然后自动运行测试用例,看通过率;
  • 数学能力:自动检查解题步骤和答案是否正确。

这种方式的好处是快、便宜,能在短时间内发现模型的明显问题(比如 “某个学科知识薄弱”“代码总报错”),但缺点是无法评估 “软能力”—— 比如回答是否礼貌、创意是否足够、逻辑是否严谨。

2. 人工评估:终极把关

当模型通过自动评估后,还需要人工评估来 “把关”。尤其是开放式任务(比如写文案、做总结、法律咨询),必须靠人类判断模型输出的质量。

但人工评估不是 “随便找个人打分”,而是有讲究的。比如评估医疗领域的模型,必须找医生来写提问、判答案,否则可能漏判专业错误;而评估日常聊天模型,就需要找普通用户来打分,才能反映真实使用体验。

Google 在训练 Gemini 时,就特别强调 “人工评估的反馈循环”:先让模型生成回答,再让人类标注者打分,把打分结果反馈到训练中,不断优化模型 —— 这也是 Gemini 能在多场景下保持高质量的关键。

写给普通人的后训练启示:不用 堆资源,也能做优化

看到这里,可能有人会说:“后训练听起来很复杂,是不是只有大公司才能做?”

其实不然。对于普通开发者或小团队,不需要千亿参数的模型,也能通过后训练提升模型效果。比如:

  • 如果你需要一个 “客服模型”,可以用开源的 DeepSeek 蒸馏版本(70 亿参数),收集自己行业的 “常见问题 - 回答” 对做 SFT,再用少量用户反馈做 RL,就能得到一个适配性极强的模型;
  • 如果你需要一个 “代码助手”,可以用 DeepSeek-Coder 做基础,收集团队常用的代码片段做 SFT,再用 RLVR(自动运行测试用例)优化,成本低且效果好。

核心思路是:​聚焦特定场景,用高质量小数据做后训练,比用海量通用数据更有效​。毕竟,大公司追求 “通用智能”,而普通人更需要 “解决具体问题的智能”。

最后:大模型的未来,在 “精” 不在 “大”

从 “堆参数” 到 “梭后训练”,大模型的发展逻辑已经变了。过去,我们靠规模取胜;未来,我们靠精细度取胜。

后训练的本质,是让模型从 “知道很多知识” 变成 “会用知识解决问题”,从 “能生成文本” 变成 “能生成高质量文本”。它不需要无限的算力和数据,而是需要对场景的理解、对数据的敬畏、对评估的严谨。

对于想入局 AI 的人来说,与其纠结 “用多大的模型”,不如先搞懂 “如何做好后训练”—— 毕竟,能解决实际问题的模型,才是好模型。

你觉得后训练还有哪些值得关注的技术?欢迎在评论区交流 ~

#大模型技术 #大模型训练 #大模型后训练

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐