蒸馏攻击是什么,以及它为什么重要

先把概念搞清楚。蒸馏(distillation)在 AI 领域本来是个合法的技术名词——用大模型的输出来训练小模型,让小模型在特定任务上逼近大模型的表现。这个方法 Hinton 在 2015 年就提出来了,本身是公开论文里都能查到的技术。

问题出在"未经授权"这三个字上。Anthropic 的报告指控的是:有人通过精心设计的 prompt,诱导 Claude 输出它的内部思维链(chain of thought),然后把这些思维链收集起来当训练数据,去训练自家模型。

这和正常 API 调用的区别在于目的——你调 API 是为了用结果,蒸馏是为了拿过程。

攻击路径拆解

根据 TechCrunch 披露的报告内容,可以还原出蒸馏攻击的业务路径:

第一步:突破思维链保护
Anthropic 对外展示的是"摘要化思维"块,不直接暴露内部推理过程。攻击者通过伪装 prompt(如翻译请求)诱导模型输出原始思维链。说白了就是 prompt 层面的越狱(jailbreak)。

第二步:批量收集
阿里那波 1.51 亿次交互分布在 3500 个账号上,说明攻击者有账号池管理和任务调度系统。峰值每天 300 万次,按 Claude Opus 的推理速度估算,这需要持续的并发调用和自动化编排。

第三步:数据清洗与微调
收集到的思维链经过清洗后用于监督微调(SFT),让目标模型学习 Claude 的推理模式。这一步在技术上不复杂,门槛在于数据量和质量。

第四步:能力转移
微调后的模型在特定能力(Agent 工具调用、代码生成、逻辑推理)上逼近 Claude 水平,但训练成本远低于从零训练。

防御成本在哪里

Anthropic 面临的防御成本可以从几个层面算:

  • 检测成本: 从 2 亿次交互中识别出蒸馏模式,需要实时流量分析和异常行为检测系统。3500 个账号共用一个 prompt 这个特征,说明检测逻辑是可行的,但需要在海量正常调用中做到低延迟识别。
  • 对抗成本: 攻击者会不断变换 prompt 模式。Anthropic 说发现了五个独立活动,意味着攻击方在持续迭代手法。
  • 信任成本: 如果 Anthropic 要在 API 层面限制思维链输出频率或内容,正常用户的产品体验会受影响。安全和可用性之间的平衡很难拿。

给用 API 做产品的团队的提醒

我不是在给被点名的公司辩护,也不是在替 Anthropic 摇旗。对做 AI 产品的团队来说,这份报告有几个值得注意的点:

  1. 调用记录可能成为合规风险点。 如果你的产品重度依赖某家海外模型的 API,你的调用模式和频率可能被对方标记。尤其如果你的调用模式看起来像"批量提取推理过程",即使你只是在做正常的大规模推理任务。
  2. API 使用条款里关于"禁止用于训练"的条款需要认真读。 大部分主流模型 API 的 ToS 都禁止用输出来训练竞争模型,但执行层面各家标准不同。
  3. 蒸馏攻击的曝光可能加速出口管制收紧。 NSA 和 FBI 此前已有类似指控动作。如果政策层面把蒸馏定性为知识产权窃取,所有使用海外模型 API 的国内团队都可能面临更严格的审查。

这篇的分析基于 TechCrunch 报道和 Anthropic 公开报告摘要。被指控方的回应尚未全面发布,具体数字和定性以各方后续公开声明为准。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐