预训练、微调、指令微调、RLHF 到底有什么区别?

写给 AI 入门学习者和程序员的训练流程地图:从「学会续写」到「学会做任务」,再到「更符合人类偏好」,看清大模型能力是怎样一层层被塑造出来的。

From base model to aligned assistant预训练微调指令微调RLHF学语言规律补领域能力学会听指令贴近人类偏好核心区别不在名字,而在训练目标、数据形态和期望行为不同。预训练打地基,微调定方向,指令微调教交互,RLHF 做偏好对齐。

很多人第一次看大模型训练流程,会被一串相似名词绕晕:预训练、微调、指令微调、监督微调、RLHF、对齐。它们确实都在「训练模型」,但训练目的完全不同。最简单的理解是:预训练让模型有基础能力,微调让模型更擅长某类任务,指令微调让模型知道人类想让它怎么回答,RLHF 则进一步让回答更符合人类偏好。

1

先给结论:它们改的是模型的不同层面

如果把大模型想象成一个刚读完海量资料的学生,预训练相当于长期自学,建立语言、知识和推理的基础;微调相当于针对某门课程专项训练;指令微调相当于学习「看到题目后应该按什么格式作答」;RLHF相当于老师不断比较答案,告诉它哪种回答更受人类欢迎。

所以它们不是四个互相替代的术语,而是经常出现在不同阶段、解决不同问题的方法。一个聊天型大模型通常会先经历大规模预训练,再经过指令微调和偏好对齐;某些行业模型还会在此基础上做领域微调。

阶段 主要目标 常见数据 直观结果
预训练 学习语言规律和通用知识 网页、书籍、代码、论文等大规模文本 得到基础模型
微调 强化某个领域或任务能力 领域语料、标注样本、任务数据 模型更适合特定场景
指令微调 学会按人类指令完成任务 指令、问题、理想回答 更像可交互助手
RLHF 让输出更符合人类偏好 人类偏好排序、比较样本 更有帮助、更稳妥、更符合预期

2

预训练:让模型先学会「续写世界」

预训练是大模型能力的地基。训练时,模型通常会看到一段文本,然后学习预测下一个 token。比如输入「北京是中国的」,模型要让「首都」这类合理续写的概率更高。

这个目标看起来简单,但当数据规模足够大、模型足够大时,模型为了更好地预测下一个 token,会被迫学习语法、事实、常识、代码模式、写作风格,甚至一些推理结构。它并不是被逐条灌输规则,而是在海量文本分布中学习「什么内容通常会接在什么内容后面」。

一句话理解

预训练的目标不是直接教模型当助手,而是让它通过预测下一个 token,学到尽可能广泛的语言和知识表示。

预训练后的模型常被称为 base model。它可能很会续写,但未必会稳定地听从指令,也未必知道要拒绝不合适的请求。

3

微调:让模型更擅长某个方向

微调是在已有模型基础上继续训练。它不像预训练那样从头用海量通用数据打地基,而是用更小、更有目标的数据,把模型往某个方向推一把。

例如,你希望模型更懂法律文书、医学问答、客服话术、代码补全或公司内部文档,就可以准备相应领域的数据继续训练。微调的重点是「迁移已有能力」,不是重新造一个模型。它利用预训练阶段已经学到的语言能力和知识结构,再补上目标场景需要的模式。

领域微调

让模型熟悉某个行业的词汇、格式和常见问题。

任务微调

让模型更擅长分类、抽取、摘要、问答等具体任务。

微调不等于把所有新知识都塞进模型。对于频繁变化的私有知识,检索增强生成 RAG 往往比训练参数更合适。

4

指令微调:让模型学会「人类这样问,你要这样答」

指令微调通常也叫 SFT,也就是 Supervised Fine-Tuning,监督微调。它确实属于微调的一种,但它的目标更具体:让模型学会按照人类指令完成任务。

预训练模型可能会续写一段问答,也可能继续模仿网页文本;但用户真正需要的是「我问你一个问题,你给我一个有用回答」。指令微调用大量「指令-回答」样本告诉模型:看到翻译请求就翻译,看到总结请求就总结,看到代码问题就解释或改代码,看到多轮对话就保持上下文。

Instruction Tuning用户指令请总结这段文字理想回答提炼要点、结构清楚、不过度发挥SFT 的重点是示范:给模型看大量「该怎么回答」的样子。

日常说的「ChatGPT 式对话能力」,很大一部分来自指令微调,而不是仅靠预训练自然出现。

5

RLHF:不是再教知识,而是调回答偏好

RLHF 的全称是 Reinforcement Learning from Human Feedback,即「基于人类反馈的强化学习」。它的核心不是让模型背更多知识,而是让模型在多个可能回答中,更倾向于选择人类认为更好的那一种。

典型做法是:先让模型对同一个问题生成多个回答,再让人类标注者比较哪些回答更好。然后训练一个奖励模型去预测人类偏好,最后用强化学习方法优化语言模型,使它更容易生成高奖励的回答。

RLHF:用偏好信号调整输出倾向多个回答人类排序奖励模型优化更有帮助、更诚实、更安全、更符合对话预期现实系统也可能使用 DPO 等偏好优化方法,但目标仍是让输出贴近偏好。

RLHF 更像「调性和边界」训练:少胡说、少冒犯、少答非所问,多给清晰、有帮助、可执行的回答。

6

最容易混淆的三个点

第一,微调不等于指令微调。 指令微调是微调的一种,但不是所有微调都是指令微调。你用行业语料继续训练,可能是领域微调;你用大量「请解释、请总结、请改写」样本训练,才更接近指令微调。

第二,RLHF 不等于人工给每个回答打分后直接存起来。 人类反馈会被转化为训练信号,影响模型以后生成回答的倾向。它不是简单的答案库,也不是每次回答前都请人类审核。

第三,预训练模型不等于聊天机器人。 base model 可能有很强的语言能力,但它未必稳定遵循指令。真正好用的助手体验,通常还需要指令微调、偏好对齐、安全策略和产品层面的系统设计。

判断一个训练阶段,最有效的问题是:它用什么数据?优化什么目标?希望模型行为发生什么变化?

7

用一道面试题把它们串起来

如果面试官问:「预训练、SFT、RLHF 有什么区别?」可以这样答:

一个清晰回答

预训练用海量通用文本训练模型预测下一个 token,目标是获得基础语言和知识能力;SFT 用人工构造或筛选的指令-回答数据继续监督训练,目标是让模型学会按人类指令完成任务;RLHF 用人类偏好比较训练奖励信号,再优化模型输出倾向,目标是让回答更有帮助、更安全、更符合人类预期。

如果要加上微调,可以补一句:微调是一个更泛的概念,指在已有模型基础上继续训练,以适配某个领域、任务或交互形式;SFT 是其中面向指令遵循的一类重要微调。

8

从产品视角看:它们分别解决什么问题?

技术名词背后,对应的是不同产品问题。预训练解决「模型有没有基础能力」;微调解决「它懂不懂我的场景」;指令微调解决「它会不会按用户要求办事」;RLHF 解决「它的回答是不是符合人类偏好和使用边界」。

你遇到的问题 更可能相关的手段 原因
模型完全不懂语言、代码或常识 预训练 基础能力不足,需要地基级训练
模型不熟悉行业术语和固定格式 领域微调或 RAG 需要补充场景知识或稳定引用资料
模型总是续写,不像在回答问题 指令微调 需要学习任务指令和回答格式
模型能回答,但语气、边界、偏好不稳定 RLHF 或偏好优化 需要把输出倾向调得更符合人类期待

实际项目里不要一听「效果不好」就先微调。很多问题可能来自提示词、检索、数据质量、评估集或产品流程,而不是模型参数本身。

最后记住这 8 句话

1. 预训练是大模型的地基,核心目标通常是预测下一个 token。

2. 预训练让模型获得通用语言、知识和模式能力,但不保证它会像助手一样回答。

3. 微调是在已有模型基础上继续训练,让模型更适合某个领域或任务。

4. 指令微调是微调的一种,重点是教模型按人类指令完成任务。

5. SFT 依赖「指令-回答」示范数据,本质是监督学习。

6. RLHF 利用人类偏好信号,让模型更倾向于生成被人类认为更好的回答。

7. RLHF 主要调输出偏好和边界,不是给模型重新预训练一遍知识。

8. 看到训练名词时,先问数据是什么、目标是什么、希望行为怎样变化。

普通人如何抓住AI大模型的风口?

领取方式在文末

2026年入行AI大模型的黄金窗口!!!

AI产业正迎来前所未有的爆发式增长。 从DeepSeek以百万年薪重金招募顶尖研究员,到百度、阿里、腾讯等头部企业加速推进AI Agent商业化布局,再到国家层面持续出台政策,大力扶持数字经济与AI人才培育体系,多重信号清晰指向一个共识:AI的“黄金十年”已全面开启

在产业浪潮的强劲推动下,AI人才争夺战日趋白热化。技术迭代与场景落地双轮驱动,催生海量高价值岗位。放眼未来,AI领域的职业发展前景广阔无垠,正涌现出大量高潜机遇,堪称一片值得深耕的**“人才蓝海”**。

脉脉数据显示📊:
2026年1-2月,AI岗位数量同比增长约12倍,增速远超新经济行业整体增幅;AI岗位在全部新经济岗位中的占比也从2025年同期的2.29%跃升至26.23%,几乎占据新经济招聘市场的四分之一。

与此同时,AI新发岗位平均月薪高达60738元,较新经济行业整体平均月薪48189元高出约26%。

这一切都说明一件事:2026年,正是入行AI大模型的黄金窗口❗️❗️

在这里插入图片描述

最佳学习路线

只要你真心想学习AI大模型技术,这份精心整理的学习资料我愿意无偿分享给你,但是想学技术去乱搞的人别来找我!

在当前这个人工智能高速发展的时代,AI大模型正在深刻改变各行各业。我国对高水平AI人才的需求也日益增长,真正懂技术、能落地的人才依旧紧缺。我也希望通过这份资料,能够帮助更多有志于AI领域的朋友入门并深入学习。

真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发

【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
在这里插入图片描述

大模型全套学习资料展示

自我们与MoPaaS魔泊云合作以来,我们不断打磨课程体系与技术内容,在细节上精益求精,同时在技术层面也新增了许多前沿且实用的内容,力求为大家带来更系统、更实战、更落地的大模型学习体验。

图片

希望这份系统、实用的大模型学习路径,能够帮助你从零入门,进阶到实战,真正掌握AI时代的核心技能!

01 教学内容

在这里插入图片描述

  • 从零到精通完整闭环:【基础理论 →RAG开发 → Agent设计 → 模型微调与私有化部署调→热门技术】5大模块,内容比传统教材更贴近企业实战!

  • 大量真实项目案例: 带你亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事‌!

02适学人群

应届毕业生‌: 无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。

零基础转型‌: 非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界‌。

业务赋能突破瓶颈: 传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型‌。

image.png

vx扫描下方二维码即可
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
在这里插入图片描述

本教程比较珍贵,仅限大家自行学习,不要传播!更严禁商用!

03 入门到进阶学习路线图

大模型学习路线图,整体分为5个大的阶段:
图片

04 视频和书籍PDF合集

图片

从0到掌握主流大模型技术视频教程(涵盖模型训练、微调、RAG、LangChain、Agent开发等实战方向)

图片

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路(不吹牛,真有用)
图片

05 行业报告+白皮书合集

收集70+报告与白皮书,了解行业最新动态!
图片

06 90+份面试题/经验

AI大模型岗位面试经验总结(谁学技术不是为了赚$呢,找个好的岗位很重要)图片
在这里插入图片描述

07 deepseek部署包+技巧大全

在这里插入图片描述

由于篇幅有限

只展示部分资料

并且还在持续更新中…

人工智能大潮已来,不加入就可能被淘汰。如果你是技术人,尤其是互联网从业者,现在就开始学习AI大模型技术,真的是给你的人生一个重要建议!

真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发

【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
在这里插入图片描述

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐