0.1 分性能差,60 倍价格差:DeepSeek V4 Pro 正式版上线,重塑全球大模型定价权
8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版,V4 Pro 预览版切换为正式版。在衡量 AI 智能体真实干活能力的 Terminal Bench 2.1 中,V4 Pro 拿下 87.9 分,距全球第一的 Anthropic Fable 5 仅差 0.1 分;而每百万 Token 输出定价仅 0.87 美元,约为 Fable 5 的五十七分之一。
8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版,V4 Pro 预览版切换为正式版。在衡量 AI 智能体真实干活能力的 Terminal Bench 2.1 中,V4 Pro 拿下 87.9 分,距全球第一的 Anthropic Fable 5 仅差 0.1 分;而每百万 Token 输出定价仅 0.87 美元,约为 Fable 5 的五十七分之一。
Terminal Bench 2.1 衡量的是 AI 智能体在真实终端环境完成任务的能力——自主进入终端装环境、敲命令、排查报错、调用多步工具完成长链条任务。
这不是纸面题库的分数内卷,是真实场景的战斗力。
注:为便于直观对比,柱形自 50 分起缩放,非零起点;分差以标注分数为准。V4 Pro 三个月内跃升 15.8 分,DeepSWE 软件工程评测从 12.8 飙至 62.7,近五倍跃升。
V4 Pro 的强大性能,让"准 Fable 级 Agent 能力"的价格锚定在了硅谷旗舰的 六十分之一。这个价格锚点不是跟随出来的,是中国厂商主动定义的。
注:价格为每百万输出 Token 计费标准;DeepSeek 缓存命中输入低至 0.0036 美元/百万 Token,比 Fable 5 便宜数百倍。0.1 分的跑分差距,对应的是 60 倍的价格鸿沟。
「简单任务省成本」——性能与顶尖模型之间,隔着一段可以感知的距离。
「性能摸到第一梯队,还能省一大笔钱」——又强又便宜。
在 Terminal Bench 以外,V4 Pro 在两项细分智能体评测中直接超越了 Anthropic Fable 5。
过去,大模型的定价权牢牢握在硅谷手里。OpenAI 定一个价,全行业跟;Anthropic 出一个档位,开发者照着算成本。中国厂商的策略本质上是「跟随者」——别人定多少,我打个折。
现在,定价权正在易主。
全球开发者用脚投票,保护的是自己的成本结构。当全球选型开始以 DeepSeek 的价格为参照系——「这个能力值不值这个价」——定价权就已经不在硅谷手里了。
行业也在同步转向。智谱涨价 83% 调用量反增 400%;月之暗面 K3 发布后请求量逼近集群极限;腾讯两轮上调 API 价格,部分涨幅达 463%。价格战的终局信号已经出现。
8 月 12 日 V4 Pro 正式上线。六天前的 8 月 6 日,DeepSeek 挂出一纸涨价预告:「计划近期整体上调 API 服务定价,预计涨幅较大。」
刚敲定融资却选择涨价,这更像是主动的定价策略切换,而非被动的成本转嫁。
摩根士丹利 8 月 9 日的研报说得很直白:模型智能,而非价格,才是大模型竞争的终极壁垒。当 V4 Pro 距 Fable 5 仅差 0.1 分时,DeepSeek 已经有资格为这份「足够接近」收取溢价。
梁文锋此前承认:「我们跟美国的差距可能是落后 12 个月,在总体算力有数量级差距的情况下,全面超越是不现实的。」但差距正在持续缩小——涨价完毕之后,DeepSeek 依然有数量级的成本优势。
当最擅长打价格战的玩家开始收枪,当 0.1 分的性能差距配上 60 倍的价格优势,中国大模型行业的竞争逻辑已经翻过了一页——对于硅谷来说,一个又强又便宜的对手,比一个只是便宜的对手可怕得多。
V4 Pro 正式版已上线 DeepSeek 官方平台,开发者可通过 API 接入体验准 Fable 级 Agent 能力。
platform.deepseek.com → API 文档