🔥 新模型 · 旗舰发布

Claude Opus 5 发布:性能逼近自家旗舰 Fable 5,价格砍半

7 月 25 日凌晨,Anthropic 发布新一代旗舰大模型 Claude Opus 5。该模型在编程、复杂推理、知识工作等多项基准测试中实现 SOTA,性能极为接近自家更贵的 Fable 5,但单任务成本仅为其一半——在保持与 Opus 4.8 相同定价的前提下,完成了一次大幅跃升。

来源:公开报道 2026-07-25 全文约 4 分钟读完
#Anthropic #Claude Opus 5 #大模型 #SOTA #性价比
2 倍 Frontier-Bench 性能较 Opus 4.8 提升幅度
1/2 单任务成本,对标 Fable 5 峰值
2.3 非对齐行为得分,近期模型最低

⚡ 30 秒速览

  • 性能定位:在 CursorBench 3.2 Max Effort 模式下,距 Fable 5 峰值仅差 0.5%,但成本仅一半。
  • 编程 SOTA:Frontier-Bench v0.1 性能为 Opus 4.8 两倍以上,且降低单任务成本。
  • 推理跃升:ARC-AGI 3 得分是第二名模型的 3 倍;Zapier AutomationBench 通过率约 1.5 倍。
  • 科研突破:有机化学任务内部基准比 Opus 4.8 高 10.2 个百分点,蛋白质任务高 7.7 个百分点。
  • 安全定位:非对齐行为得分 2.3,为 Anthropic 迄今对齐程度最高模型;漏洞利用仍落后于 Mythos 5。
  • 定价策略:输入 5 美元 / 输出 25 美元(每百万 Token),与 Opus 4.8 持平;Fast mode 2.5 倍速、2 倍价。

01性能逼近旗舰,成本砍半 Opus 5 vs Fable 5

用户对 Claude 最集中的吐槽是"贵"。Opus 5 的发布直接回应了这一点:在维持与 Opus 4.8 相同定价的前提下,实现了性能的大幅跃升,并在多项基准中逼近甚至超越更贵的 Fable 5。

Fable 5(旗舰)

性能天花板,CursorBench 3.2 Max Effort 峰值基准。

Opus 5(新发)

相同测试下峰值仅差 0.5%,但单任务成本仅 一半

ARC-AGI 3 得分倍数
1.5×Zapier 通过率倍数
1/3OSWorld 成本即超 Fable 5
2.5×Fast mode 速度倍数

注:ARC-AGI 3 与 Zapier AutomationBench 的倍数均以"相同单任务成本"为基准对比;OSWorld 2.0 为"任意给定成本下"对比。倍数为官方披露,未见第三方复测。

在计算机操作基准 OSWorld 2.0 中,Opus 5 在任意给定成本下均优于其他所有模型,仅需略高于三分之一的成本即可超过 Fable 5 的最佳成绩。即使最低努力设置下,Opus 5 通过的任务数也超过了其他任何模型。

02编程与推理:多项 SOTA 核心能力跃升

🥇 Opus 5Frontier-Bench v0.1
SOTA
Fable 5CursorBench 3.2 Max Effort
峰值
Opus 5CursorBench 3.2 Max Effort
-0.5%
Opus 5OSWorld 2.0(任意成本)
SOTA
Opus 5ARC-AGI 3
3× 第二

注:柱形为示意性表达,非分数绝对值;"3× 第二"指 Opus 5 得分为第二名模型 3 倍;"-0.5%"指 Opus 5 距 Fable 5 峰值差距。数据为官方披露。

03它到底强在哪?三个硬核案例

🔧 自主构建视觉管线:从图纸到 3D 模型竞争模型 0/5 成功

  • Frontier-Bench 任务:收到机械零件图纸,要求在 FreeCAD 中重建 3D 模型,但未提供直接查看图纸的接口
  • Opus 5 自行编写了一套计算机视觉处理管线,从原始像素中提取几何特征,完成完整重建,多次重复实验均成功
相同设置下,其他竞争模型尝试 5 次无一成功。

🐛 根治深层 Bug:不止于表面修复根因分析

  • 面对一款热门开源包管理器的真实 Bug,Opus 5 找到根本原因,并修复了社区补丁遗漏的边缘情况
  • 竞争模型仅修复表面症状便报告问题已解决。

🧪 自建测试套件:没有数据源就自己造主动性

  • 某交易公司工程师用 Opus 5 在单次会话中为新交易所构建市场数据接入源——旧模型完全无法完成
  • 因当时没有可用于验证的实时数据源,Opus 5 自己构建了一套测试套件,检查代码是否准确解析交易所数据。
Lovable 联创 Fabian Hedin:「Opus 家族自 4.5 以来最大的一次飞跃」

04为什么能做到?思考在前,行动在后

Opus 5 在自我校验与审慎迭代方面能力提升显著,能持续优化直至任务成功。其核心变化在于写代码前更爱"动脑子"——在规划阶段就能捕获自己的逻辑缺陷。

接收意图深度规划自我校验迭代执行验证交付

JetBrains IDE AI 负责人 Denis Shiryaev 评价:Opus 5 最令其印象深刻的是判别力与决策力,在写下代码前会更深入地思考,这是解题能力的一次重要跨越

此外,Opus 5 引入了两个测试期功能:对话中途更换工具提示词缓存不失效,以及API 自动降级处理(遇到安全分类器标记的请求时避免直接拒绝,默认退回 Opus 4.8)。

编辑视角

本文核心数据均来自 Anthropic 官方发布与单方披露,包括 Frontier-Bench、CursorBench、ARC-AGI 3 等基准的对比结果,未见第三方独立复测。其中"性能为 Opus 4.8 两倍""成本仅 Fable 5 一半"等结论,建议读者结合官方技术报告与独立评测综合判断。

此外,Anthropic 在安全篇幅中承认 Opus 5 在漏洞利用方面仍大幅落后于 Mythos 5——这一坦诚与其在编程、推理领域的强势宣传形成对照,是阅读时应留意的平衡信号。

旗舰模型不再只拼参数天花板,而是把"同等性能下更便宜"作为核心卖点——海外大模型厂商的竞争维度,正从"谁更强"转向"谁更值",这是中国开源与闭源模型持续施压的直接结果。

现在就能用

Opus 5 已成为 Claude Max 新默认模型,也是 Claude Pro 中性能最强的模型;开发者可在 API 中调用 claude-opus-5

claude.ai → 选 Opus 5