🔥 模型 · 发布速递

Opus 5 半价反超 Fable 5 登顶硬核榜,Anthropic 同步砍掉八成系统提示词

7 月 25 日凌晨,Anthropic 正式发布 Claude Opus 5。在硬核编程基准 Frontier-Bench v0.1 上,它以 43.3% 反超 Fable 5 的 33.7%,价格仅为后者一半;同日,Anthropic 把 Claude Code 的系统提示词删掉超 80%,编码评测成绩却纹丝不动。

来源:公开报道 2026-07-25 全文约 4 分钟读完
#Anthropic #Claude Opus 5 #代码生成 #上下文工程
43.3% Frontier-Bench v0.1 · 领先 Fable 5 近 10 个百分点
1/2 价格 · 每百万 token 输入 $5 / 输出 $25
80% Claude Code 系统提示词被删减 · 成绩未降

⚡ 30 秒速览

  • 赢了多少:Frontier-Bench 43.3% vs Fable 5 的 33.7%;ARC-AGI-3 拿 30.2%,是 GPT-5.6 Sol(7.8%)的近四倍。
  • 价格策略:与上一代 Opus 4.8 持平,是 Fable 5 的一半;Fast 模式两倍价格换 2.5 倍速度。
  • 提示词瘦身:Anthropic 把 Claude Code 系统提示词删超 80%,编码评测成绩零下降——判断力追上来了,脚手架可以拆了。
  • 网友炸场:5 倍 Max 订额度度的 27% 搭出可玩 Rocket League 克隆版;3 道破坏场景题花 $0.508 全做对,Fable 5 花近两倍钱却翻车。
  • 安全松绑:预计触发拦截的频率比 Fable 5 降约 85%;IMO 2026 竞赛满分且未用外部工具。

01硬核榜 Top 5 Opus 5 在编程与推理上反超

🥇 Claude Opus 5Anthropic
43.3
Fable 5对照模型
33.7
Opus 4.8Anthropic · 上一代
21.1

注:柱形自 15 分起缩放,非零起点;分差以标注分数为准。Opus 5 较 Fable 5 领先 9.6 个百分点,较上一代 Opus 4.8 翻倍有余。

在另一项专测"模型没见过的新问题"的 ARC-AGI-3 上,差距更为悬殊:

30.2% Opus 5
7.8% GPT-5.6 Sol
~1.5% Opus 4.8(估算)

Opus 5 在 ARC-AGI-3 的得分较上一代翻近 20 倍,是 GPT-5.6 Sol 的近四倍。

02它到底强在哪?三个让网友炸场的实测

🎮 用 27% 算力搭出可玩的 Rocket League 克隆网友实测

  • 博主 am.will 原以为 Opus 5 只是"便宜版 Fable",测完直接改口说"大错特错"
  • 仅用 5 倍 Max 订阅额度的 27%,就搭出他见过最好的 Rocket League 克隆版,游戏能玩,代码开源在评论区。
博主 OmedTheVibeCoder 测完竞技场对决后评价:"不是接近,是完全甩开了它。"并补充说自己"差点从椅子上摔下来"。

💥 三道破坏场景题:花一半钱,全做对成本对比

  • 题目:龙卷风卷起整片场地、重锤砸楼、卡车压塌桁架桥。
  • Opus 5:花 $0.508 全部做对。
  • Fable 5:花费近两倍,龙卷风卷不起地面物体,楼在锤子碰到前自己塌了,桥炸成一堆木棍。
  • GPT-5.6:最便宜($0.14),但锤子压根没碰到楼。
来源:atomic.chat 横向对比测试。

✈️ 波音 747 重建:多写 4 倍代码,多了一道自检硬核自检

  • Fable 5:42 分钟、4 文件、约 1000 行代码,跑 17 轮渲染、查 54 张截图,验证方式只靠肉眼看
  • Opus 5:71 分钟、20 模块、约 4000 行代码,25 套镜头预设,多写了一个测量脚本
  • 验证方式:从渲染画面提取正射轮廓,算出翼展、轴距、前缘扫掠角等 14 项指标,逐项核对波音 747-400 公开数据公差。
  • 前 43 分钟只渲染素模确认轮廓过关,才上涂装;6 个视角拼成联系表一次看完。
博主 Victor M 结论:Fable 5 交货快约 40%,但用着同样的 747-400 真实数据,却从没拿建好的模型反过来量过这些数据对不对。

03为什么提示词能砍 80%?判断力追上来了

Opus 5 发布同日,Anthropic 工程师 Thariq 发文披露:Claude Code 的系统提示词被删掉超 80%,编码评测成绩零下降。这 80% 的删减,正是专门针对 Opus 5、Fable 5 这代模型做的。

背后逻辑只有一句:过去靠规则硬堵的地方,现在可以放手交给模型自己判断。

旧规则

"默认不写注释"——早期模型判断力不够,怕注释又多又乱,只能定死这条规则;用户想要详细注释时反而帮了倒忙。

新规则

"贴合周围代码的风格,匹配注释密度、命名和习惯"——判断权交还给了模型。

同样的逻辑也用在工具设计与上下文管理上:

例子教学接口极简渐进式披露自主记忆

Todo 工具只留"待处理/进行中/已完成"几个状态,模型自己判断怎么用;不常用说明拆成技能文件按需调用;Claude 自己判断哪些信息值得记,直接存成记忆。

规则、例子、记忆,本来都是给判断力不够的模型搭的脚手架。现在脚手架被一根根拆掉——因为模型自己就能接得住。

编辑视角

本篇核心跑分与"反超"结论主要来自 Anthropic 官方通告与企业通稿,部分网友实测为单方披露、未见第三方复测;FrontierCode 榜单还曾出现把得分更低的 Opus 标成获胜者的 bug(已修正)。读者宜把"半价干翻"视作厂商定调的性价比叙事,而非独立测评结论。

但有一处信号独立于跑分争议:Anthropic 敢在同一代模型上砍掉 80% 系统提示词而成绩不降,说明行业正从"用规则补模型判断力"转向"让模型自己接住判断"——脚手架的拆除,比跑分本身更能说明这一代模型的真实进步。

当厂商开始拆掉自己搭的脚手架,意味着模型能力正从"被规则托住"跨入"自己站稳"——这才是这一代发布真正值得标记的拐点。

现在就能用

Opus 5 已上线 Claude 官方产品线,配备 Fast 模式(两倍价格换 2.5 倍速度);Claude Code 同步更新精简版系统提示词。

anthropic.com/news/claude-opus-5 → 官方发布