Claude Opus 5 :更强的 Agent,还是更高的 Token 账单?
我个人觉得:Claude Opus 5 是一次面向真实生产任务的升级,价值不在"回答更像人",在于它开始更稳定地把复杂任务做完。
一、Opus 5 的核心变化
Anthropic 将其定位为 Agentic coding 和企业级工作推荐模型,价格输入 5 美元、输出 25 美元/百万 Token,与 Opus 4.8 持平,约为 Fable 5 的一半。

核心变化:长上下文、主动拆解和持续自检。opus5支持 1M Token 上下文、128K 最大输出,并默认启用 adaptive thinking。
模型把更多预算用在规划、调用工具和验证结果上,复杂任务更稳,简单任务也可能更慢、更贵。
二、能力数据:官方结果领先,证据边界也要看清
| 测试维度 | 官方披露结果 | 产品价值 |
|---|---|---|
| Frontier-Bench v0.1 | 超过其他模型,表现高于 Opus 4.8 | 复杂编码和知识工作 |
| CursorBench 3.2 | max effort 下与 Fable 5 峰值差距约 0.5%,单任务成本约一半 | Agent coding 性价比 |
| ARC-AGI 3 | 约为次优模型 3 倍 | 陌生问题拆解 |
| OSWorld 2.0 | 以约三分之一成本超过 Fable 5 最佳成绩 | Computer Use 和桌面操作 |
| AutomationBench | 通过率约为次优模型 1.5 倍 | 企业流程自动化 |
这些数字来自 Anthropic 内部测试。Opus 5 在同档推理任务中的 Token 消耗约为 Opus 4.8 的 60%,但复杂 Agent 任务会因检索和自测拉高总成本。
三、和前代、竞品相比,差异在哪里?
Opus 4.8 更像高质量代码助手,Opus 5 更像能自己推进工作的项目成员。Fable 5 仍是能力上限,适合少量高价值任务;Opus 5 则把接近 Fable 的能力放进更低价格档。它也有明显边界:在网络安全和生物研究任务上仍落后于 Mythos 5,且推理模式、effort 档位会影响结果。
| 对比维度 | Opus 5 | Opus 4.8 | Fable 5 |
|---|---|---|---|
| 核心定位 | Agentic coding 和企业级工作推荐模型 | 高质量代码助手,等待指令执行 | Anthropic 能力上限模型 |
| 适用任务 | 复杂编码、跨文件重构、长文档分析 | 代码生成、单步问答、中等复杂度编码 | 高难度推理、前沿研究 |
| 成本特点 | 输入 5 美元、输出 25 美元/百万 Token;推理 Token 消耗约为 Opus 4.8 的 60% | 输入 5 美元、输出 25 美元/百万 Token | 输入 10 美元、输出 50 美元/百万 Token,约为 Opus 5 的 两倍 |
| 输出稳定性 | 默认 adaptive thinking,复杂任务更稳 | 质量稳定,缺乏主动拆解机制 | 峰值最高,但与 Opus 5 差距仅约 0.5% |
| 工具调用倾向 | 主动检查需求、调用工具,更频繁 | 等待指令,调用相对被动 | 能力强,但成本较高 |
四、实测场景:看它能不能交付
我用订单服务重构任务做验收:库存并发扣减、超时重试、日志补全和单元测试,分别让三个模型跑三轮。
result = run_agent(model, task, effort="high")
metrics = {
"first_pass": run_tests(result.code),
"rework_turns": result.turns,
"input_tokens": result.usage.input_tokens,
"output_tokens": result.usage.output_tokens,
"tool_calls": result.tool_calls,
"latency_ms": result.latency_ms,
}
assert result.stop_reason not in ["refusal", "max_tokens"]
实测结果显示:Opus 5 首轮通过率 3/4,仅需 1 轮返工即全部通过;Opus 4.8 首轮 1/4,需 3 轮返工;Fable 5 首轮全过。但 Opus 5 总成本仅 0.38 美元,约为 Fable 5(0.93 美元)的 40%,总耗时 71.8s 也接近 Fable 5 的 68.2s。对于多数复杂编码任务,Opus 5 是性价比更优的选择。
Anthropic 官方案例也印证了这一点:Opus 5 能根据机器零件图重建 FreeCAD 模型,还能为新交易所自行搭建测试工具验证行情接口。它的价值在于连续执行和自我验收。
五、适合谁,成本怎么核验?
复杂编码、跨文件重构、长文档分析、企业流程自动化和高返工成本项目,适合优先试 Opus 5。日常问答和轻量补全,Sonnet 5 更划算。实际使用时,effort、输出长度和失败重试都会改变账单,建议把同一任务放到不同渠道跑几轮再对比。

Opus 5 值不值得迁移,取决于每次成功交付少返工了多少,而不只取决于每百万 Token 便宜多少。
更多推荐




所有评论(0)