Opus 5 半价反超 Fable 5 登顶硬核榜,Anthropic 同步砍掉八成系统提示词
7 月 25 日凌晨,Anthropic 正式发布 Claude Opus 5。在硬核编程基准 Frontier-Bench v0.1 上,它以 43.3% 反超 Fable 5 的 33.7%,价格仅为后者一半;同日,Anthropic 把 Claude Code 的系统提示词删掉超 80%,编码评测成绩却纹丝不动。
7 月 25 日凌晨,Anthropic 正式发布 Claude Opus 5。在硬核编程基准 Frontier-Bench v0.1 上,它以 43.3% 反超 Fable 5 的 33.7%,价格仅为后者一半;同日,Anthropic 把 Claude Code 的系统提示词删掉超 80%,编码评测成绩却纹丝不动。
注:柱形自 15 分起缩放,非零起点;分差以标注分数为准。Opus 5 较 Fable 5 领先 9.6 个百分点,较上一代 Opus 4.8 翻倍有余。
在另一项专测"模型没见过的新问题"的 ARC-AGI-3 上,差距更为悬殊:
Opus 5 在 ARC-AGI-3 的得分较上一代翻近 20 倍,是 GPT-5.6 Sol 的近四倍。
Opus 5 发布同日,Anthropic 工程师 Thariq 发文披露:Claude Code 的系统提示词被删掉超 80%,编码评测成绩零下降。这 80% 的删减,正是专门针对 Opus 5、Fable 5 这代模型做的。
背后逻辑只有一句:过去靠规则硬堵的地方,现在可以放手交给模型自己判断。
"默认不写注释"——早期模型判断力不够,怕注释又多又乱,只能定死这条规则;用户想要详细注释时反而帮了倒忙。
"贴合周围代码的风格,匹配注释密度、命名和习惯"——判断权交还给了模型。
同样的逻辑也用在工具设计与上下文管理上:
Todo 工具只留"待处理/进行中/已完成"几个状态,模型自己判断怎么用;不常用说明拆成技能文件按需调用;Claude 自己判断哪些信息值得记,直接存成记忆。
规则、例子、记忆,本来都是给判断力不够的模型搭的脚手架。现在脚手架被一根根拆掉——因为模型自己就能接得住。
本篇核心跑分与"反超"结论主要来自 Anthropic 官方通告与企业通稿,部分网友实测为单方披露、未见第三方复测;FrontierCode 榜单还曾出现把得分更低的 Opus 标成获胜者的 bug(已修正)。读者宜把"半价干翻"视作厂商定调的性价比叙事,而非独立测评结论。
但有一处信号独立于跑分争议:Anthropic 敢在同一代模型上砍掉 80% 系统提示词而成绩不降,说明行业正从"用规则补模型判断力"转向"让模型自己接住判断"——脚手架的拆除,比跑分本身更能说明这一代模型的真实进步。
当厂商开始拆掉自己搭的脚手架,意味着模型能力正从"被规则托住"跨入"自己站稳"——这才是这一代发布真正值得标记的拐点。
Opus 5 已上线 Claude 官方产品线,配备 Fast 模式(两倍价格换 2.5 倍速度);Claude Code 同步更新精简版系统提示词。
anthropic.com/news/claude-opus-5 → 官方发布