原文
https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf

一、模型基本信息

gpt-oss-120b 和 gpt-oss-20b 两款开源推理模型,均基于 Apache 2.0 许可证及 OpenAI 的 gpt-oss 使用政策发布。这两款纯文本模型兼容 Responses API,专为智能代理工作流设计,具备强大的指令遵循能力、工具使用能力(如网页搜索和 Python 代码执行)和推理能力,支持自定义、完整的思维链(CoT)输出及结构化输出。

二、模型架构与训练细节

(一)架构设计

两款模型均为自回归混合专家(MoE) transformer 模型,基于 GPT-2 和 GPT-3 架构构建。具体参数如下:
在这里插入图片描述

组件 gpt-oss-120b gpt-oss-20b
总参数 116.8B 20.9B
每前向传播活跃参数 5.1B 3.6B
层数 36 24
MoE 专家数量 128 个 32 个
注意力头配置 64 个查询头,8 个键值头(GQA) 64 个查询头,8 个键值头(GQA)
上下文长度 128k 128k

(二)量化与训练

• 采用 MXFP4 格式对 MoE 权重进行量化(4.25 bits / 参数),使 120b 模型可在单张 80GB GPU 运行,20b 模型可在 16GB 内存系统运行。

• 训练数据为纯文本数据集,包含数万亿 tokens,聚焦 STEM、编程和通用知识,并通过 CBRN 预训练过滤器过滤有害内容,知识截止日期为 2024 年 6 月。

• 使用 NVIDIA H100 GPU 和 PyTorch 框架训练,120b 模型消耗 210 万 H100 小时,20b 模型消耗约为其 1/10。

(三)后训练优化

• 采用类似 OpenAI o3 的 CoT 强化学习技术,提升推理和工具使用能力。

• 支持低、中、高三种推理级别,通过系统提示词配置,推理级别越高,平均 CoT 长度越长。

• 支持浏览工具、Python 工具及自定义开发者函数调用,可在思维链中交错工具调用与中间结果。

三、性能评估结果

(一)核心能力表现

在推理、编码和工具使用基准测试中,gpt-oss-120b 超越 OpenAI o3-mini,接近 o4-mini 性能;20b 模型虽规模小 6 倍,但仍具竞争力。具体表现包括:

• 数学能力突出,20b 模型在 AIME 任务中平均使用超 20k CoT tokens / 问题。

• 健康领域表现优异,120b 模型在 HealthBench 上接近 OpenAI o3,显著优于 GPT-4o、o1 等模型。

• 多语言能力较强,120b 在 14 种语言的 MMMLU 评估中平均准确率达 81.3%,接近 o4-mini。

在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

(二)测试时间缩放特性

模型表现出平滑的测试时间缩放特性,推理级别提升(低→中→高)伴随 CoT 长度增加,准确率呈对数线性增长,但响应延迟和成本也相应增加。

在这里插入图片描述

四、安全评估与风险

(一)安全性能表现

• 禁止内容防护:在标准评估中与 o4-mini 相当,在更具挑战性的生产基准测试中多数类别表现更优。

• 越狱防护:在 StrongReject 评估中与 o4-mini 性能接近。

• 指令层级遵循:在系统消息提取、提示注入劫持等任务中略逊于 o4-mini,但开发者可通过微调增强防护。

• 幻觉率:在 SimpleQA 和 PersonQA 中准确率低于 o4-mini,幻觉率较高,建议对 CoT 内容进行过滤后再展示给用户。

(二)潜在风险评估

• 经过对抗性微调测试,确认 120b 模型在生物化学、网络安全领域未达到 “高能力” 阈值。

• 与现有开源模型(如 Qwen 3 Thinking、Kimi K2)相比,未显著推进开源基础模型的生物安全能力前沿。

五、Preparedness 框架评估

对生物化学、网络安全和 AI 自我改进三大跟踪类别进行评估,结果显示:

• 生物化学领域:在长文本生物风险问题、病毒学故障排除等任务中表现出一定能力,但未超过专家基线。

• 网络安全领域:在大学级 CTF 挑战中通过率 39%,专业级达 25%,未达高能力阈值。

• AI 自我改进:在 SWE-bench Verified、OpenAI PRs 等任务中表现不及 o3 和 o4-mini。

六、总结

GPT-OSS 模型在开源生态中展现出强大的推理、编码和工具使用能力,尤其在健康领域实现了性能 - 成本的帕累托改进。尽管存在指令层级遵循较弱、幻觉率较高等问题,但通过开发者微调可进一步增强安全性。安全评估确认其未引入显著新增风险,为开源社区提供了高性能且可控的基础模型选择。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐