🚀 模型 · 发布速递

Anthropic 发布 Claude Opus 5:半价追平自家中最强模型,编程与知识工作全面登顶

7 月 24 日,Anthropic 推出 Claude Opus 5。这款新模型以约 Fable 5 一半的单任务成本,在编程与知识工作两大类基准上拿下多项 SOTA,并在自动化任务、计算机操控等智能体评测中刷新纪录——同时是该公司迄今对齐分数最高的模型。

来源:官方发布 2026-07-24 全文约 4 分钟读完
#ClaudeOpus5 #Anthropic #大模型发布 #智能体评测
50% 相对 Fable 5 的单任务成本
3× ARC-AGI 3 上领先次优模型的倍数
2.3 对齐审计失准分,系列最低

⚡ 30 秒速览

  • 新在哪:Opus 5 在 Frontier-Bench v0.1、CursorBench 3.2、GDPval-AA v2 等编程/知识工作评测上拿下 SOTA;在 ARC-AGI 3 上得分是次优模型的 3 倍。
  • 性价比:CursorBench 上以 max effort 运行,性能与 Fable 5 巅峰分差不足 0.5 个百分点,但单任务成本仅一半;OSWorld 2.0 上超越 Fable 5 最佳成绩时,成本仅约三分之一。
  • 更对齐:官方自动化行为审计给出 2.3 分失准分(系列最低),欺骗行为率与被诱导误用率均优于 Opus 4.8、Sonnet 5 与 Fable 5。
  • 边界在哪:在生物研究与进攻性网络安全等高风险双用途能力上不推进前沿,仍落后于 Mythos 5;漏洞发现能力接近 Mythos 5,漏洞利用能力仍有明显差距。
  • 怎么用:今日起成为 Claude Max 默认模型,也是 Claude Pro 上最强模型。

01编程与智能体评测 Opus 5 在多项基准上刷新 SOTA

🥇 Claude Opus 5Anthropic · 新发布
SOTA
Claude Fable 5Anthropic · 前代旗舰
次优
Claude Opus 4.8Anthropic · 前代同档
被替代
Mythos 5第三方 · 网络安全专项
专项领先

注:本榜为概念示意,按官方披露的相对位置排列,非具体分数排名。Opus 5 在 Frontier-Bench v0.1、CursorBench 3.2、ARC-AGI 3、AutomationBench、OSWorld 2.0、GDPval-AA v2、HLE、DeepSearchQA 等多项评测上取得 SOTA 或接近 SOTA;在网络安全攻防专项上仍落后于 Mythos 5。

02半价追平旗舰 性价比是这次发布的核心叙事

Opus 5 与自家前代旗舰 Fable 5 的关系,可以一句话概括:接近 Fable 5 的智能水平,但单任务成本约为一半。官方同时披露了 effort(努力度)档位机制——客户可在「更智能」与「更省 token、更快、更便宜」之间调节。

前代旗舰 Fable 5

性能天花板,但单任务成本高;在 CursorBench 上保持巅峰分。

新发布 Opus 5

CursorBench max effort 下与 Fable 5 巅峰分差不足 0.5 个百分点;OSWorld 2.0 上超越 Fable 5 最佳成绩时,成本仅约三分之一。

ARC-AGI 3 领先倍数
1.5×AutomationBench 通过率
Frontier-Bench 性能提升
0.5×相对 Fable 5 单任务成本

注:3× 指 ARC-AGI 3 上得分约为次优模型的 3 倍;1.5× 指 AutomationBench 通过率约为次优模型同成本下的 1.5 倍;2× 指 Frontier-Bench v0.1 上性能较 Opus 4.8 翻倍且单任务成本更低;0.5× 指相对 Fable 5 的单任务成本。所有倍率均引自官方发布,未见第三方独立复测。

03它到底会做什么?三个早期测试中的硬核案例

🔧 盲图重建:自己写计算机视觉管线独家完成

  • Frontier-Bench 任务:给一张机器零件图纸,要求写出代码重建为 3D FreeCAD 模型——但故意不给模型任何直接查看原图的途径
  • Opus 5 的反应:自己写了一套计算机视觉管线,从原始像素中提取几何信息,然后重建出完整零件。多次重复均成功。
  • 对照:同设置下的竞争模型,五次尝试均未解决
关键能力:在没有现成工具时,自主搭建中间工具链完成任务。

🐛 根因排查:找到社区补丁漏掉的边界情况超越人类补丁

  • 任务:一个流行开源包管理器的真实 bug。
  • Opus 5:找到根因,并修复了社区补丁漏掉的边界情况
  • 对照:竞争模型只修了表面症状,未触及底层原因,然后报告 bug 已解决。
关键能力:不止于「让测试通过」,而是定位真正的故障源。

📈 交易系统:一小时内搭完新交易所行情接入前代无法完成

  • 某交易公司工程师用 Opus 5 在单次会话内为一家新交易所搭建了完整的市场数据接入。
  • 找不到实时行情源做校验时,Opus 5 自己搭了测试框架来验证代码是否正确解析了交易所数据格式。
  • 对照:前代模型在工程师给出详细计划的情况下完全无法完成该任务。
关键能力:在缺少外部验证条件时,自主构造验证手段。

04不只是跑分高,实际工作流也在变

🧪

像科学家一样交叉验证

基因组学分析场景中,Opus 5 会主动选择正确的统计检验来排除混杂因素,并用独立方法交叉核对自己的结果,在长链多步分析中保持不跑偏。

🛡️

像前端工程师一样自测

在交付前端代码前,Opus 5 会自己在桌面端和手机端宽度打开页面,发现了一个被折叠隐藏的产品项和一个超出屏幕的结账按钮,并在交付前修好。

⚖️

法律红笔:首轮即领先

首轮合同红线标注得分几乎是 Opus 4.8 的两倍;在 NDA 上以更少轮次、更短时间到达红线,准确率持平或更好。

💬

敢对工程师说不

在一次架构重构中,Opus 5 对工程师提出的设计方案提出异议,在工程师坚持时没有妥协,而是精准定位到单一设计问题,并提出保留原方案优点、修正缺陷的折中方案。

05对齐与安全 官方称迄今最对齐,但高风险能力不推进

部署前自动化行为审计显示,Opus 5 是 Anthropic 迄今对齐分数最高的模型:遵守 Claude's Constitution 的程度优于 Opus 4.8、Sonnet 5 与 Fable 5;欺骗行为率最低;被诱导误用的难度最高;也是迄今最不易做出不可逆鲁莽动作的模型。

2.3失准总分(越低越好)
0网络安全专项训练
欺骗行为率
被诱导误用难度

注:2.3 分为官方自动化行为审计总分,数值越低表示对齐程度越高;Opus 5 在生物研究与进攻性网络安全上仍落后于 Mythos 5;官方明确表示未用网络任务训练该模型,其网络安全能力的提升是通用能力提升的副产物。

在双用途高风险能力上,官方明确:Opus 5 不推进前沿。在与私营部门及政府合作伙伴共同进行的严格评测中,该模型在生物研究与进攻性网络安全上仍落后于 Mythos 5。值得注意的是,Opus 5 在发现网络安全漏洞方面接近 Mythos 5,但在利用这些漏洞(即将漏洞转化为实质性网络攻击)方面仍明显落后。

通用能力提升网络安全发现能力提升但利用能力仍受限
编辑视角

本文几乎所有评测数据与案例均来自企业官方发布,包括性能倍率、对齐分数与客户证言。其中 Frontier-Bench、CursorBench、ARC-AGI 3 等评测的第三方独立复测结果尚未公开;客户证言来自 Cursor、Zapier、Box、Lovable、JetBrains 等合作伙伴,存在商业关联。读者宜将这些数据视作厂商自报的上限声明,而非已获独立验证的行业共识。

一个值得关注的支线:Anthropic 这次把「半价追平自家最强模型」作为核心叙事,而非单纯强调性能突破——这意味着前沿模型阵营内部正在出现分层定价:旗舰模型维持性能天花板,次旗舰以一半成本覆盖 95% 的场景。这种产品结构在云计算和芯片行业早已成熟,现在正式进入大模型市场。

前沿大模型的市场竞争,正从「谁更聪明」转向「同等聪明下谁更便宜、更可控」——这是行业走向工程化成熟期的信号。

现在就能用

Claude Opus 5 今日起成为 Claude Max 默认模型,也是 Claude Pro 上最强模型。

claude.ai → Max / Pro 用户立即可用