我个人觉得:Claude Opus 5 是一次面向真实生产任务的升级,价值不在"回答更像人",在于它开始更稳定地把复杂任务做完。

一、Opus 5 的核心变化

Anthropic 将其定位为 Agentic coding 和企业级工作推荐模型,价格输入 5 美元、输出 25 美元/百万 Token,与 Opus 4.8 持平,约为 Fable 5 的一半。

核心变化:长上下文、主动拆解和持续自检。opus5支持 1M Token 上下文、128K 最大输出,并默认启用 adaptive thinking。

模型把更多预算用在规划、调用工具和验证结果上,复杂任务更稳,简单任务也可能更慢、更贵。

二、能力数据:官方结果领先,证据边界也要看清

测试维度 官方披露结果 产品价值
Frontier-Bench v0.1 超过其他模型,表现高于 Opus 4.8 复杂编码和知识工作
CursorBench 3.2 max effort 下与 Fable 5 峰值差距约 0.5%,单任务成本约一半 Agent coding 性价比
ARC-AGI 3 约为次优模型 3 倍 陌生问题拆解
OSWorld 2.0 以约三分之一成本超过 Fable 5 最佳成绩 Computer Use 和桌面操作
AutomationBench 通过率约为次优模型 1.5 倍 企业流程自动化

这些数字来自 Anthropic 内部测试。Opus 5 在同档推理任务中的 Token 消耗约为 Opus 4.8 的 60%,但复杂 Agent 任务会因检索和自测拉高总成本。

三、和前代、竞品相比,差异在哪里?

Opus 4.8 更像高质量代码助手,Opus 5 更像能自己推进工作的项目成员。Fable 5 仍是能力上限,适合少量高价值任务;Opus 5 则把接近 Fable 的能力放进更低价格档。它也有明显边界:在网络安全和生物研究任务上仍落后于 Mythos 5,且推理模式、effort 档位会影响结果。

对比维度 Opus 5 Opus 4.8 Fable 5
核心定位 Agentic coding 和企业级工作推荐模型 高质量代码助手,等待指令执行 Anthropic 能力上限模型
适用任务 复杂编码、跨文件重构、长文档分析 代码生成、单步问答、中等复杂度编码 高难度推理、前沿研究
成本特点 输入 5 美元、输出 25 美元/百万 Token;推理 Token 消耗约为 Opus 4.8 的 60% 输入 5 美元、输出 25 美元/百万 Token 输入 10 美元、输出 50 美元/百万 Token,约为 Opus 5 的 两倍
输出稳定性 默认 adaptive thinking,复杂任务更稳 质量稳定,缺乏主动拆解机制 峰值最高,但与 Opus 5 差距仅约 0.5%
工具调用倾向 主动检查需求、调用工具,更频繁 等待指令,调用相对被动 能力强,但成本较高

四、实测场景:看它能不能交付

我用订单服务重构任务做验收:库存并发扣减、超时重试、日志补全和单元测试,分别让三个模型跑三轮。

result = run_agent(model, task, effort="high")
metrics = {
    "first_pass": run_tests(result.code),
    "rework_turns": result.turns,
    "input_tokens": result.usage.input_tokens,
    "output_tokens": result.usage.output_tokens,
    "tool_calls": result.tool_calls,
    "latency_ms": result.latency_ms,
}
assert result.stop_reason not in ["refusal", "max_tokens"]

实测结果显示:Opus 5 首轮通过率 3/4,仅需 1 轮返工即全部通过;Opus 4.8 首轮 1/4,需 3 轮返工;Fable 5 首轮全过。但 Opus 5 总成本仅 0.38 美元,约为 Fable 5(0.93 美元)的 40%,总耗时 71.8s 也接近 Fable 5 的 68.2s。对于多数复杂编码任务,Opus 5 是性价比更优的选择。

Anthropic 官方案例也印证了这一点:Opus 5 能根据机器零件图重建 FreeCAD 模型,还能为新交易所自行搭建测试工具验证行情接口。它的价值在于连续执行和自我验收。

五、适合谁,成本怎么核验?

复杂编码、跨文件重构、长文档分析、企业流程自动化和高返工成本项目,适合优先试 Opus 5。日常问答和轻量补全,Sonnet 5 更划算。实际使用时,effort、输出长度和失败重试都会改变账单,建议把同一任务放到不同渠道跑几轮再对比。

Opus 5 值不值得迁移,取决于每次成功交付少返工了多少,而不只取决于每百万 Token 便宜多少。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐