🔥 模型 · 商业速递

0.1 分性能差,60 倍价格差:DeepSeek V4 Pro 正式版上线,重塑全球大模型定价权

8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版,V4 Pro 预览版切换为正式版。在衡量 AI 智能体真实干活能力的 Terminal Bench 2.1 中,V4 Pro 拿下 87.9 分,距全球第一的 Anthropic Fable 5 仅差 0.1 分;而每百万 Token 输出定价仅 0.87 美元,约为 Fable 5 的五十七分之一

综合公开信息整理 2026-08-14 全文约 4 分钟读完
#DeepSeek #V4 Pro #大模型定价 #AI Agent
0.1 距全球第一 Fable 5 的性能差距
60 V4 Pro 与 Fable 5 的价格鸿沟
15.8 三个月内 Terminal Bench 跃升幅度

⚡ 30 秒速览

  • 性能逼近天花板:Terminal Bench 2.1 得分 87.9,距 Anthropic Fable 5 仅 0.1 分;三个月前预览版还是 72.1 分。
  • 两项直接反超:Cybergym 安全测试 83.3 对 83.1;AutomationBench 工作流测试 31.8 对 29.1,V4 Pro 均赢 Fable 5。
  • 价格碾压硅谷:每百万输出 Token 0.87 美元,Fable 5 为 50 美元,GPT-5.6 Sol Max 30 美元,Grok 4.6 为 6 美元。
  • 行业集体涨价:中国大模型均价从 12.2 元回升至 21.9 元/百万 Token;智谱涨价 83% 调用量反增 400%。
  • 定价权易主:中国大模型在 OpenRouter 连续 15 周调用量居首,美国企业调用中国模型 Token 占比稳定 30% 以上。

01Terminal Bench 2.1 榜单 0.1 分的差距

Terminal Bench 2.1 衡量的是 AI 智能体在真实终端环境完成任务的能力——自主进入终端装环境、敲命令、排查报错、调用多步工具完成长链条任务。

这不是纸面题库的分数内卷,是真实场景的战斗力。

🥇 Anthropic Fable 5全球第一
88.0
DeepSeek V4 Pro正式版 · 8/12 上线
87.9
Anthropic Opus 4.8上一代旗舰
58.0
DeepSeek V4 Pro 预览版三个月前 · 5 月
72.1

注:为便于直观对比,柱形自 50 分起缩放,非零起点;分差以标注分数为准。V4 Pro 三个月内跃升 15.8 分,DeepSWE 软件工程评测从 12.8 飙至 62.7,近五倍跃升。

02性能逼近,价格碾压 全球旗舰定价对比

V4 Pro 的强大性能,让"准 Fable 级 Agent 能力"的价格锚定在了硅谷旗舰的 六十分之一。这个价格锚点不是跟随出来的,是中国厂商主动定义的。

Anthropic Fable 5全球性能第一
$50.00
百万输出
GPT-5.6 Sol MaxOpenAI 旗舰
$30.00
百万输出
Grok 4.6xAI · 同夜发布
$6.00
百万输出
DeepSeek V4 Pro缓存命中输入 $0.0036
$0.87
百万输出

注:价格为每百万输出 Token 计费标准;DeepSeek 缓存命中输入低至 0.0036 美元/百万 Token,比 Fable 5 便宜数百倍。0.1 分的跑分差距,对应的是 60 倍的价格鸿沟。

过去用 DeepSeek

「简单任务省成本」——性能与顶尖模型之间,隔着一段可以感知的距离。

现在用 DeepSeek

「性能摸到第一梯队,还能省一大笔钱」——又强又便宜

03不止追平,更有反超 两项关键评测直接赢

在 Terminal Bench 以外,V4 Pro 在两项细分智能体评测中直接超越了 Anthropic Fable 5。

🛡️ Cybergym:AI 安全智能体测试反超 0.2 分

  • 考察 AI 在网络安全攻防场景中的自主决策与工具调用能力
  • V4 Pro 得分 83.3,Fable 5 得分 83.1——在安全领域,中国模型首次跑赢硅谷旗舰。
评分维度:漏洞识别 / 攻击链推理 / 防御策略部署 / 多步工具协同 —— V4 Pro 在防御策略部署环节拉开差距。

⚙️ AutomationBench:工作流智能体测试反超 2.7 分

  • 考察 AI 自主编排多步骤工作流、串联外部 API 完成复杂业务的能力。
  • V4 Pro 得分 31.8,Fable 5 得分 29.1——差距显著,非误差范围。
评分维度:任务拆解 / 工具选择 / 错误恢复 / 交付完整性 —— V4 Pro 在错误恢复与交付完整性两项领先。

💻 DeepSWE:软件工程能力近五倍跃升

  • 12.8 分飙升至 62.7 分,三个月内近五倍跃升。
  • 超越 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分——衡量读懂完整代码仓库、处理复杂工程问题的能力。
一个诚实的注脚:在纯知识推理、超复杂全栈软件工程等场景,V4 Pro 与全球最顶尖模型仍有细微差距,多模态能力尚未补齐。

04从跟随者到定价者 中国大模型拿下全球定价权

过去,大模型的定价权牢牢握在硅谷手里。OpenAI 定一个价,全行业跟;Anthropic 出一个档位,开发者照着算成本。中国厂商的策略本质上是「跟随者」——别人定多少,我打个折。

现在,定价权正在易主。

15 周 中国大模型在 OpenRouter 平台连续调用量超过美国,稳居首位
30%+ 美国企业调用中国 AI 模型的 Token 占比,峰值达 46%
近 200 家 硅谷初创企业联名致信美国政府,反对限制使用中国开源模型
21.9 元 中国大模型均价从 Q1 的 12.2 元回升至 Q2 的 21.9 元/百万 Token

全球开发者用脚投票,保护的是自己的成本结构。当全球选型开始以 DeepSeek 的价格为参照系——「这个能力值不值这个价」——定价权就已经不在硅谷手里了。

行业也在同步转向。智谱涨价 83% 调用量反增 400%;月之暗面 K3 发布后请求量逼近集群极限;腾讯两轮上调 API 价格,部分涨幅达 463%。价格战的终局信号已经出现。

05为什么是 DeepSeek 做到了?

8 月 12 日 V4 Pro 正式上线。六天前的 8 月 6 日,DeepSeek 挂出一纸涨价预告:「计划近期整体上调 API 服务定价,预计涨幅较大。」

刚敲定融资却选择涨价,这更像是主动的定价策略切换,而非被动的成本转嫁。

4 月 V4 发布2.5 折优惠上线5 月永久降至 1/48 月 V4 Pro 转正

摩根士丹利 8 月 9 日的研报说得很直白:模型智能,而非价格,才是大模型竞争的终极壁垒。当 V4 Pro 距 Fable 5 仅差 0.1 分时,DeepSeek 已经有资格为这份「足够接近」收取溢价。

梁文锋此前承认:「我们跟美国的差距可能是落后 12 个月,在总体算力有数量级差距的情况下,全面超越是不现实的。」但差距正在持续缩小——涨价完毕之后,DeepSeek 依然有数量级的成本优势。

编辑核心判断

当最擅长打价格战的玩家开始收枪,当 0.1 分的性能差距配上 60 倍的价格优势,中国大模型行业的竞争逻辑已经翻过了一页——对于硅谷来说,一个又强又便宜的对手,比一个只是便宜的对手可怕得多。

现在就能用

V4 Pro 正式版已上线 DeepSeek 官方平台,开发者可通过 API 接入体验准 Fable 级 Agent 能力。

platform.deepseek.com → API 文档