Anthropic 发布 Claude Opus 5:半价追平自家中最强模型,编程与知识工作全面登顶
7 月 24 日,Anthropic 推出 Claude Opus 5。这款新模型以约 Fable 5 一半的单任务成本,在编程与知识工作两大类基准上拿下多项 SOTA,并在自动化任务、计算机操控等智能体评测中刷新纪录——同时是该公司迄今对齐分数最高的模型。
7 月 24 日,Anthropic 推出 Claude Opus 5。这款新模型以约 Fable 5 一半的单任务成本,在编程与知识工作两大类基准上拿下多项 SOTA,并在自动化任务、计算机操控等智能体评测中刷新纪录——同时是该公司迄今对齐分数最高的模型。
注:本榜为概念示意,按官方披露的相对位置排列,非具体分数排名。Opus 5 在 Frontier-Bench v0.1、CursorBench 3.2、ARC-AGI 3、AutomationBench、OSWorld 2.0、GDPval-AA v2、HLE、DeepSearchQA 等多项评测上取得 SOTA 或接近 SOTA;在网络安全攻防专项上仍落后于 Mythos 5。
Opus 5 与自家前代旗舰 Fable 5 的关系,可以一句话概括:接近 Fable 5 的智能水平,但单任务成本约为一半。官方同时披露了 effort(努力度)档位机制——客户可在「更智能」与「更省 token、更快、更便宜」之间调节。
性能天花板,但单任务成本高;在 CursorBench 上保持巅峰分。
CursorBench max effort 下与 Fable 5 巅峰分差不足 0.5 个百分点;OSWorld 2.0 上超越 Fable 5 最佳成绩时,成本仅约三分之一。
注:3× 指 ARC-AGI 3 上得分约为次优模型的 3 倍;1.5× 指 AutomationBench 通过率约为次优模型同成本下的 1.5 倍;2× 指 Frontier-Bench v0.1 上性能较 Opus 4.8 翻倍且单任务成本更低;0.5× 指相对 Fable 5 的单任务成本。所有倍率均引自官方发布,未见第三方独立复测。
基因组学分析场景中,Opus 5 会主动选择正确的统计检验来排除混杂因素,并用独立方法交叉核对自己的结果,在长链多步分析中保持不跑偏。
在交付前端代码前,Opus 5 会自己在桌面端和手机端宽度打开页面,发现了一个被折叠隐藏的产品项和一个超出屏幕的结账按钮,并在交付前修好。
首轮合同红线标注得分几乎是 Opus 4.8 的两倍;在 NDA 上以更少轮次、更短时间到达红线,准确率持平或更好。
在一次架构重构中,Opus 5 对工程师提出的设计方案提出异议,在工程师坚持时没有妥协,而是精准定位到单一设计问题,并提出保留原方案优点、修正缺陷的折中方案。
部署前自动化行为审计显示,Opus 5 是 Anthropic 迄今对齐分数最高的模型:遵守 Claude's Constitution 的程度优于 Opus 4.8、Sonnet 5 与 Fable 5;欺骗行为率最低;被诱导误用的难度最高;也是迄今最不易做出不可逆鲁莽动作的模型。
注:2.3 分为官方自动化行为审计总分,数值越低表示对齐程度越高;Opus 5 在生物研究与进攻性网络安全上仍落后于 Mythos 5;官方明确表示未用网络任务训练该模型,其网络安全能力的提升是通用能力提升的副产物。
在双用途高风险能力上,官方明确:Opus 5 不推进前沿。在与私营部门及政府合作伙伴共同进行的严格评测中,该模型在生物研究与进攻性网络安全上仍落后于 Mythos 5。值得注意的是,Opus 5 在发现网络安全漏洞方面接近 Mythos 5,但在利用这些漏洞(即将漏洞转化为实质性网络攻击)方面仍明显落后。
本文几乎所有评测数据与案例均来自企业官方发布,包括性能倍率、对齐分数与客户证言。其中 Frontier-Bench、CursorBench、ARC-AGI 3 等评测的第三方独立复测结果尚未公开;客户证言来自 Cursor、Zapier、Box、Lovable、JetBrains 等合作伙伴,存在商业关联。读者宜将这些数据视作厂商自报的上限声明,而非已获独立验证的行业共识。
一个值得关注的支线:Anthropic 这次把「半价追平自家最强模型」作为核心叙事,而非单纯强调性能突破——这意味着前沿模型阵营内部正在出现分层定价:旗舰模型维持性能天花板,次旗舰以一半成本覆盖 95% 的场景。这种产品结构在云计算和芯片行业早已成熟,现在正式进入大模型市场。
Claude Opus 5 今日起成为 Claude Max 默认模型,也是 Claude Pro 上最强模型。
claude.ai → Max / Pro 用户立即可用