Claude Opus 5 发布:性能逼近自家旗舰 Fable 5,价格砍半
7 月 25 日凌晨,Anthropic 发布新一代旗舰大模型 Claude Opus 5。该模型在编程、复杂推理、知识工作等多项基准测试中实现 SOTA,性能极为接近自家更贵的 Fable 5,但单任务成本仅为其一半——在保持与 Opus 4.8 相同定价的前提下,完成了一次大幅跃升。
7 月 25 日凌晨,Anthropic 发布新一代旗舰大模型 Claude Opus 5。该模型在编程、复杂推理、知识工作等多项基准测试中实现 SOTA,性能极为接近自家更贵的 Fable 5,但单任务成本仅为其一半——在保持与 Opus 4.8 相同定价的前提下,完成了一次大幅跃升。
用户对 Claude 最集中的吐槽是"贵"。Opus 5 的发布直接回应了这一点:在维持与 Opus 4.8 相同定价的前提下,实现了性能的大幅跃升,并在多项基准中逼近甚至超越更贵的 Fable 5。
性能天花板,CursorBench 3.2 Max Effort 峰值基准。
相同测试下峰值仅差 0.5%,但单任务成本仅 一半。
注:ARC-AGI 3 与 Zapier AutomationBench 的倍数均以"相同单任务成本"为基准对比;OSWorld 2.0 为"任意给定成本下"对比。倍数为官方披露,未见第三方复测。
在计算机操作基准 OSWorld 2.0 中,Opus 5 在任意给定成本下均优于其他所有模型,仅需略高于三分之一的成本即可超过 Fable 5 的最佳成绩。即使最低努力设置下,Opus 5 通过的任务数也超过了其他任何模型。
注:柱形为示意性表达,非分数绝对值;"3× 第二"指 Opus 5 得分为第二名模型 3 倍;"-0.5%"指 Opus 5 距 Fable 5 峰值差距。数据为官方披露。
Opus 5 在自我校验与审慎迭代方面能力提升显著,能持续优化直至任务成功。其核心变化在于写代码前更爱"动脑子"——在规划阶段就能捕获自己的逻辑缺陷。
JetBrains IDE AI 负责人 Denis Shiryaev 评价:Opus 5 最令其印象深刻的是判别力与决策力,在写下代码前会更深入地思考,这是解题能力的一次重要跨越。
此外,Opus 5 引入了两个测试期功能:对话中途更换工具提示词缓存不失效,以及API 自动降级处理(遇到安全分类器标记的请求时避免直接拒绝,默认退回 Opus 4.8)。
本文核心数据均来自 Anthropic 官方发布与单方披露,包括 Frontier-Bench、CursorBench、ARC-AGI 3 等基准的对比结果,未见第三方独立复测。其中"性能为 Opus 4.8 两倍""成本仅 Fable 5 一半"等结论,建议读者结合官方技术报告与独立评测综合判断。
此外,Anthropic 在安全篇幅中承认 Opus 5 在漏洞利用方面仍大幅落后于 Mythos 5——这一坦诚与其在编程、推理领域的强势宣传形成对照,是阅读时应留意的平衡信号。
旗舰模型不再只拼参数天花板,而是把"同等性能下更便宜"作为核心卖点——海外大模型厂商的竞争维度,正从"谁更强"转向"谁更值",这是中国开源与闭源模型持续施压的直接结果。
Opus 5 已成为 Claude Max 新默认模型,也是 Claude Pro 中性能最强的模型;开发者可在 API 中调用 claude-opus-5。
claude.ai → 选 Opus 5