大模型蒸馏:白盒蒸馏 vs 黑盒蒸馏

开篇:蒸馏到底是什么?

大模型虽强,但太贵了——每天调 API 烧掉几万块,私有化部署 8 张 A100 起步。知识蒸馏(Knowledge Distillation)就是解决这一切的神器:用小模型模仿大模型的行为,能力接近老师,成本降到百分之一。

蒸馏的核心思想由 Hinton 在 2015 年提出:大型复杂模型(教师)所蕴含的"暗知识"(dark knowledge),可以通过软化后的输出概率分布传递给小型模型(学生)。

为什么企业需要蒸馏?三大核心好处

蒸馏带给企业的价值,浓缩为三个维度——成本、性能、安全

维度 云端大模型 API 蒸馏后本地小模型 降本/提升幅度
成本 — 日 10 万次调用月费 50 万+ 硬件折旧 + 电费 ≈ 1000~1500 元 约 500 倍
性能 — 首 token 延迟 500ms ~ 3s 50ms ~ 200ms 10~30 倍加速
性能 — 生成速度 20~50 tokens/s 50~150 tokens/s 2~5 倍吞吐
安全 — 数据流向 每次请求外发至厂商云端 全程内网闭环 零外发
安全 — 合规满足 金融/医疗/政务场景受限 等保/密评天然合规 监管无忧
  • 成本:API 是"按量烧钱",蒸馏是"一次投入、无限推理",调用量越大降本越夸张,日均百万次调用可降本 5000 倍
  • 性能:7B 小模型单张 RTX 4090 即可毫秒级响应,实时客服场景用户等待超过 2 秒就流失的问题彻底解决。
  • 安全:金融、医疗、政务数据全程不出域,无外发报文,隐性合规风险趋近于零。

一句话:百分之一的成本,毫秒级的性能,数据不出域的安全边界

但蒸馏也分门派。按对教师模型的访问权限,分为两大流派:白盒蒸馏(White-Box KD)黑盒蒸馏(Black-Box KD)。90% 以上的企业落地走的都是黑盒这条路,但真正懂原理的架构师,必须把两层都吃透。

学生模型 Student

教师模型 Teacher

软标签 KL 散度

Hint 蒸馏 MSE

注意力迁移

白盒:完整访问全部信息

完整权重

Logits 概率分布

中间层 Hidden States

Attention 注意力矩阵

独立初始化权重

学习输出分布

对齐中间特征

复刻注意力

上图展示了蒸馏的完整知识迁移全景。白盒能拿到全部三层信息,黑盒只能拿到最终文本。


一、白盒蒸馏(White-Box KD)

1.1 什么是白盒蒸馏?

前提条件:你能完整获取教师模型的权重、logits(输出概率分布)、Transformer 中间隐藏层特征、Attention 注意力矩阵。

简单说:老师坐在你旁边做题,你不仅能看到最终答案,还能:

  • 看草稿纸:每一步的演算思路(中间层 hidden states)
  • 看眼神焦点:做题时重点盯着哪几句话(Attention 权重)
  • 看内心打分:对每个候选答案分别有几分把握(Logits 概率分布)

白盒蒸馏要求你把教师模型完整加载到自己的服务器里,每一步计算结果随便读取——不只是调 API 拿回答。

1.2 适用的两种情况

白盒蒸馏通常只适用于:

  1. 自家大模型向下蒸馏自家小模型:比如 Meta 用 LLaMA-70B 蒸馏出 LLaMA-7B
  2. 开源模型之间蒸馏:比如 DeepSeek-R1 → DeepSeek-R1-Distill-Qwen

Claude、GPT-4o 等闭源商业 API 完全无法使用白盒方案,因为你拿不到权重。

1.3 白盒蒸馏的三层信息

一个 Transformer 大模型的完整链路是:

输入 Embedding → 多层 Transformer Block(每层 = 多头 Attention + 前馈网络)→ 最终 Logits 输出层

白盒蒸馏可以在这条链路的三个位置提取知识:

输出层

N 层 Transformer Block 堆叠

输入层

MSE 约束

━━━━ 第二层蒸馏:Hint 中间特征蒸馏 ━━━━

对齐师生每层 Block 输出的 Hidden States
强制思考路径同源

第 N 层 Block

Multi-Head Self-Attention
━━━━ 第三层蒸馏:Attention 注意力蒸馏

Feed-Forward Network

第 1 层 Block

Multi-Head Self-Attention
━━━━ 第三层蒸馏:Attention 注意力蒸馏

Feed-Forward Network

Input Embedding
词嵌入层

第 2 层 Block

...

Logits 输出层
━━━━ 第一层蒸馏:Logits 软标签蒸馏

Decode 解码生成文字

三层蒸馏精准对应 Transformer 链路的三段:Attention 蒸馏在每层 Block 前半段、Hint 蒸馏覆盖全部 Block 输出、Logits 蒸馏在末端输出层。


第一层:Logits 软标签蒸馏(输出层)

这是最经典的 KD 方案,位于模型的最末端

模型走完所有 Transformer 层后,最后一个全连接层输出一组 Logits 分数。正常推理时直接挑分数最高的词输出,但蒸馏时不开"直接选最高分"模式,而是引入温度系数 T(一般取值 2~5),把概率差距拉平缓:

原始:A 词 95 分、B 词 4 分、C 词 1 分
加温 T=2 后:A 70、B 22、C 8 分

这组平缓后的概率就是软标签(Soft Label)

为什么这是个天才设计? 假设情感分类任务中,教师对于"这部电影还不错"的输出是:正面 0.9、中性 0.08、负面 0.02。学生只学硬标签(正面)会丢掉关键信息——"中性"和"正面"之间那条模糊的边界。恰恰是这 8% 和 2%,构成了 Hinton 所说的暗知识:类别之间的相似性关系。

关键:学生不光知道该选 A,还能明白 B 和 A 比较接近、而 C 几乎不可能。这种相似度关系在边缘案例上表现尤其好。

温度 T 拉平分布

暗知识:B 与 A 的相似度 > C 与 A

软标签(T=3)

A: 58%

B: 27%

C: 15%

原始 Logits(T=1)

A: 95%

B: 4%

C: 1%

学生学到类别关系

温度 T 的作用:从"只看第一名"变成"看到每个选项的把握程度"。8% 和 2% 的差异,就是暗知识。


第二层:Hint 中间特征蒸馏(隐藏层)

位于 Embedding 之后、Logits 之前,属于模型的中段

大模型是一层一层叠加计算的,每层输出一组隐藏向量(hidden states),代表模型读完文本后那一层的"抽象理解"。Hint 蒸馏的目标是:强制学生每一层的输出向量,和教师同层向量尽量一模一样,用 MSE 均方误差约束两者差距。

举例:输入"下雨天出门"——

  • 教师第一层提取:天气 = 下雨、动作 = 出门
  • 教师第二层推理:下雨 → 需要雨具,出门 → 携带物品

Hint 蒸馏就让学生第一层必须复刻"天气 + 出行"特征,第二层复刻"雨具 + 防滑"逻辑——强迫思考路径对齐,不是只学结果

如果你用过 Qwen-7B,它有 32 层 Transformer Block。Hint 蒸馏意味着你要对这 32 层的每一层输出都做对齐,让学生内部的信号流和教师同源。


第三层:Attention 注意力蒸馏(注意力层内部)

Attention 注意力矩阵位于每个 Transformer Block 的前半段——不是独立层级,而是每层内置的子模块。

注意力矩阵代表:模型读一句话时,哪个词和哪个词关联性最强。在机器翻译中,教师翻译"I love you"时,"love"会高度关注"爱"这个目标词。

蒸馏这个矩阵,就是让学生复刻教师的"阅读习惯"——看同样的地方、关联同样的词句。

继续上面的例子:输入"下雨天记得带伞出门",模型计算得出"下雨"高度绑定"伞",“带"绑定"伞”。这组绑定权重,就是注意力蒸馏的目标。


1.4 白盒蒸馏的优缺点

维度 评价
信息密度 最大,三层信息同时榨取
蒸馏效果 最强,特定任务上可几乎无差别逼近教师
前提条件 必须有教师完整权重,闭源模型不可用
显存开销 极大,需同时加载师生两个模型。7B 学生 + 70B 教师进行 Hint 蒸馏,至少 4×A100 80GB

一句话总结白盒:效果天花板,但门槛也是天花板。


二、黑盒蒸馏(Black-Box KD)

2.1 什么是黑盒蒸馏?

前提条件:没有任何模型内部权限,只能通过 API 输入 Prompt,获取教师返回的文本回答。

这是目前网传"蒸馏 Claude / GPT"的唯一技术路径。业内也称作 Response Distillation(响应蒸馏)

你只能拿到什么?

  • ❌ 没有 Logits(看不到教师对每个 token 的打分)
  • ❌ 没有中间层(看不到教师的思考过程)
  • ❌ 没有权重(不能本地跑教师模型)
  • ✅ 只有输入 Prompt → 输出文本 的问答对

2.2 黑盒蒸馏的技术路线

因为只有问答对,黑盒蒸馏的唯一技术路径就是:构建"问题 + 教师标准答案"数据集 → 指令微调(SFT)学生模型

也就是:把教师当做一个高级标注员,批量生成高质量训练数据,然后让学生直接"背诵"这套问答模式。

黑盒:仅拿到文本输出

业务种子 Prompt
从历史数据提取

调用教师 API
Claude / GPT-4o

收集问答对
JSONL 数据集

数据清洗与质检
过滤幻觉/套话/错误

SFT 指令微调
LoRA / QLoRA

剪枝 + 量化
GPTQ INT4

vLLM 本地部署
私有化推理服务

黑盒蒸馏的完整流水线:从种子 Prompt 到本地部署,全程不接触教师模型内部。

2.3 三种蒸馏范式

在实际工程中,可以通过设计不同的 Prompt 模板,诱导教师输出不同层次的信号:

① 普通响应蒸馏

系统提示词:“请直接给出标准完整回答,不要额外解释。”

适用于:工单分类、知识库简答、文案生成等不需要推理过程的任务。学生直接学习输入→输出的映射。

② CoT 蒸馏(Chain-of-Thought)

系统提示词:“请先分步写出思考推导过程,最后给出最终结论。用’思考:'和’答案:'分隔。”

适用于:故障排查、数据计算、多条件审批判断等需要推理的任务。强制学生学会分步思考,而不是一步跳到结论——这在小模型上尤其重要,因为小模型更容易"一步错全错"。

③ 偏好蒸馏

系统提示词:“针对该问题写出 2 版回答,分别标注为’版本 A’和’版本 B’。然后指出哪个版本更严谨规范,并简要说明理由。”

适用于:需要对齐人类偏好、企业话术规范的场景。让学生不仅学会"怎么做",还学会"什么才算好"。

2.4 黑盒蒸馏的技术挑战

挑战 说明
信息损失 只能学教师输出文本,无法感知教师对不同 token 的置信度差异
数据噪声 教师可能产生幻觉、重复、不完整回答,需要大量清洗
API 成本与限速 受 RPM/TPM 限制,大批量数据收集效率低
合规风险 跨厂商批量 API 蒸馏可能违反服务条款(详见下文)

2.5 黑盒蒸馏的优缺点

维度 评价
门槛 极低,有 API Key 就能干
成本 主要是 API 调用费 + 一张消费级显卡(4090 即可)
效果 足够用,特定场景可达教师 85%~95% 水平
信息量 最少,只能学最终文本
合规 有踩红线风险,需谨慎

三、白盒 vs 黑盒:一张表彻底分清

维度 白盒蒸馏 黑盒蒸馏
教师访问方式 本地加载完整权重 仅 API 调用
可获取信息 Logits + Hidden States + Attention 仅文本输出
核心算法 KL 散度 + MSE + Attention Transfer 指令微调(SFT)
适用模型 开源模型(Qwen、Llama、DeepSeek) 任何有 API 的模型(Claude、GPT、Gemini)
硬件门槛 极高(多卡 A100) 极低(单张 RTX 4090)
蒸馏效果 最好 良好
行业占比 ~5%(学术界 + 大厂自研) ~95%(绝大多数企业)
合规风险 无(自有/开源模型) 有(跨厂商 API 蒸馏可能违约)

是,本地可加载

否,只能调 API

否(开源模型)

能拿到教师模型
完整权重吗?

教师模型是
闭源商业 API?

白盒蒸馏
三层信息全量迁移
效果天花板

黑盒蒸馏
API → 数据集 → SFT
行业 95% 的选择

合规路径:
1. 自有模型蒸馏
2. 开源模型间蒸馏
3. 签数据使用协议

一张决策图定路线:手里有没有权重,决定了你能走哪条路。


四、为什么 95% 的企业都用黑盒蒸馏?

答案很现实:最强的模型(Claude Opus、GPT-4o)全是闭源的,你根本拿不到权重。

但这不意味着黑盒是妥协。恰恰相反,对绝大多数业务场景,黑盒蒸馏已经完全够用。一个企业的客服机器人不需要具备 Claude 的通用智能——它只需要在 500 个高频问题上表现稳定。用 Claude 生成这 500 个问题的标准答案做成数据集,喂给一个 Qwen-7B,效果就能达到可用线。

工程经典组合链路

阶段三:压缩部署

阶段二:蒸馏训练

阶段一:数据生产

业务种子库
500~5000 条

调用强模型 API
批量生成答案

数据清洗
去幻觉/去冗余

LoRA/QLoRA
SFT 微调学生

剪枝 SparseGPT
50% 稀疏化

量化 GPTQ
FP16 → INT4

vLLM 推理服务
单卡 4090 上线

这套链路的降本效应惊人:日均 10 万次 API 调用,月费五六十万;换成蒸馏后的本地 7B 模型,月度固定开销仅千元级别,降本约 500 倍


五、合规红线:你必须知道的事

2026 年 2 月,Anthropic 公开指控 DeepSeek、月之暗面、MiniMax 通过 2.4 万个欺诈账号,累计发起 1600 万次 API 调用,批量采集输出数据用于蒸馏。

2026 年 6 月,通义千问团队也被点名——6 周内使用 2.5 万个测试账号,累计 2880 万轮对话交互被抓取。

核心结论:跨厂商黑盒蒸馏已经不再是"行业潜规则",而是可追溯、可追责的商业违约行为

安全姿势

自家自研大模型

开源模型

闭源商业 API

是,已签协议

否,未签协议

需要蒸馏能力

教师模型是谁的?

方案一:自家蒸馏自家
零风险,效果最好

方案二:开源模型间蒸馏
遵守开源协议即可

是否签数据
使用协议?

方案三:合法合规蒸馏
控制规模,法务审核

禁止蒸馏
违反 ToS,可被追责
DeepSeek/月之暗面前车之鉴

安全部署上线

  1. 自家蒸馏自家:用自研大模型蒸馏自研小模型(用 Qwen-72B 蒸馏 Qwen-7B),零风险
  2. 开源模型间蒸馏:如 DeepSeek-R1 → DeepSeek-R1-Distill-Qwen,完全合规
  3. 只用自有数据微调:不复制任何第三方模型的行为,用自己的业务数据训练,零风险
  4. 签协议:如果要蒸馏 Claude/GPT,先让法务审一遍服务条款,并与厂商签专门的数据使用协议

六、总结

知识蒸馏不是玄学,而是每个 AI 工程团队的必备技能。两条路径各有适用场景:

  • 你有开源大模型的完整权限?→ 走白盒,三层信息一起蒸馏,效果拉到天花板。
  • 你只能调闭源 API?→ 走黑盒,老老实实用 SFT,效果足够好,但注意合规。

无论走哪条路,本质都是同一个逻辑:找一个好老师,让他出题写答案,然后让学生反复练,直到学生在这个领域无限接近老师的水平。

而蒸馏最性感的地方在于——学生推理一次的成本,只有老师的百分之一,甚至千分之一。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐