🧠 模型 · 发布速递

DeepSeek V4 Pro 正式版深夜上线:111 天打磨,Agent 能力暴涨 50 分

8 月 13 日凌晨,DeepSeek 官网悄悄刷新 API 文档——deepseek-v4-pro 的 fingerprint 变为 fp_v4pro_20260812,正式版就此上线。没有任何预告,距离预览版发布已过 111 天,Agent 评测飙升近 50 分,API 价格暂时未动。

来源:综合公开信息整理 2026-08-13 全文约 4 分钟读完
#DeepSeek #V4 Pro #AI Agent #API
111 天 预览版 → 正式版,零预告更新
+49.9 DeepSWE 得分涨幅(12.8 → 62.7)
¥3 / M 输入 token 单价,暂未涨价

⚡ 30 秒速览

  • 发生了什么:8 月 13 日凌晨 API 文档悄然更新,fingerprint 变为 fp_v4pro_20260812,V4 Pro 正式版上线,零预告零倒计时。
  • 涨在哪:DeepSWE 从 12.8 飙到 62.7,Cybergym 52.7 → 83.3,DSBench-Hard 翻倍至 67.2——清一色是长链路 Agent 场景。
  • 实测表现:Boids 模拟 761 行一次通过;番茄钟主动补全白噪音与统计图表;寻路可视化关掉 thinking 后 54 秒交付。
  • 一个坑:thinking 模式在代码生成时可能吃掉 80%+ 输出配额导致截断,复杂编码需要关掉或拉高 max_tokens。
  • 诚实定位:HLE、NL2Repo 仍落后 Claude Opus 4.8 与 Fable 5;但 ¥3/百万 token 的价格只有 Fable 5 的约 1/10。
  • 下一张牌:DeepSeek Harness 极简模式「即将发布」,模型与 Agent 框架可能打包推出。

01一场没有预告的发布

8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是 deepseek-v4-pro,但 fingerprint 已经变成 fp_v4pro_20260812——没有预告,没有倒计时,连更新日志都没来得及写好。

距离 4 月 24 日预览版上线,整整 111 天。

04-24预览版上线deepseek-v4-pro 首次亮相,Agent 是明显短板
07-31V4 Flash 正式版先行同样的后训练路线先跑通了一遍
08-06涨价预告悬顶「计划近期整体上调 API 定价,预计涨幅较大」
08-13V4 Pro 正式版上线凌晨悄悄刷新,fingerprint 更新为 fp_v4pro_20260812

这 111 天并不平静——Kimi K3 高调发布抢走开源头条,V4 Flash 正式版先行一步落地,涨价预告又悬在所有开发者头顶。所有人都在等同一个答案:Pro 的正式版,到底什么时候来?

答案是一个周三的深夜。

先看硬参数——架构和预览版完全一致。变的是后训练,而且变化大到像换了个模型。

总参数1.6T
激活参数49B
上下文1M
最大输出384K

规格与预览版完全相同:MoE 结构、1.6T 总参数 / 49B 激活。这轮升级的增量全部来自面向 Agent 场景的后训练。

02Agent 基准全线暴涨

最夸张的数字,来自 Agent 相关评测。从预览版到正式版,几个代表性基准的得分几乎是「跳涨」:

DeepSWEDeepSeek 自研软件工程基准+49.9
Cybergym网络安全 Agent 基准+30.6
Terminal Bench终端操作基准+15.8
DSBench-Hard数据科学任务 · 得分约翻倍≈2×

柱形按各基准正式版得分(最高 87.9)归一化,灰条为预览版、蓝条为正式版,仅用于比较同一基准的前后变化;不同基准之间不可横向对比。*DSBench-Hard 预览值按「翻了一倍多」表述推算。

这些测试项有一个共同点——它们都涉及长链路的代码修改、环境操作和工具调用

恰好是预览版最容易翻车的地方。

从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准远超 Pro 预览版」的程度,Pro 版只是补上了同一课。

03真实任务:三次实测

跑分好看只是门票。真正有意义的是拿真实任务去试——这个模型在「一次性生成完整可运行代码」这件事上,到底到了什么水平?

🐦 Boids 群体行为模拟 761 行 · 一次通过

  • 任务:Canvas 上 200 个三角形 boid,分离 / 对齐 / 凝聚三参数可调,彩色轨迹,点击生成捕食者,glassmorphism 风格控制面板。
  • 结果:约 170 秒生成 761 行完整 HTML。物理模拟、实时渲染、UI 设计一次跑通,拖动滑块可实时改变群体行为。
实测结论:综合型任务一次运行通过,零人工修正。

🍅 模糊需求番茄钟 1223 行 · 自主补全

  • 任务:只给一句方向——「好看、能计时、能记录、有白噪音、中文界面、要有质感」,其余让模型自行决定。
  • 结果:除 25/5 分钟计时外,自行加入任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成了几种白噪音。
实测结论:对模糊需求的「产品化补全」能力,比预览版明显更强。

🧭 寻路算法可视化 关 thinking 后 54 秒

  • 任务:BFS / DFS / A* 三种算法的逐步动画、可交互网格画墙、迷宫自动生成——代码量最大。
  • 开着 thinking 模式:16384 token 配额中 13394 花在「思考」上,留给代码的不足 3000 token,HTML 写到一半直接截断。
  • 关闭 thinking 重跑:54 秒输出完整 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。
编辑注:这是正式版的一个真实特征,不是 bug——复杂代码生成场景下推理 token 可能占到输出的 80% 以上,开发者需要主动关掉 thinking 或大幅拉高 max_tokens 兜底。

三次实测下来,这个模型的能力边界已经很清楚:长链路代码任务的一次性完整交付大幅改善,但 thinking 模式需要开发者学会「按场景开关」。

04一张不是「全面碾压」的成绩单

坦率地说,V4 Pro 0813 并不是没有短板。它还没坐上的头把交椅,和它真正的杀伤力,同样清晰:

⚠ 还没追上的位置

  • HLE(无工具)42.7,落后 Claude Opus 4.8 的 49.8 与 Fable 5 的 53.3。
  • NL2Repo 61.5,落后 Opus 4.8 的 69.7。
  • 与 Kimi K3 的部分测试存在轻微差距。

⚡ 价格定律的杀伤力

  • 每百万 token 输入 ¥3、输出 ¥6,与预览版持平。
  • 约为 Fable 5 的 1/10Kimi K3 的 1/3
  • 8 月 6 日预告的 API 涨价,目前尚未执行。
「比我强的没我便宜,比我便宜的没我强。」

在 Agent 能力从「几乎不可用」暴涨到「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。窗口期能撑多久不好说——想按老价格上车的,得趁早。

05大鲸鱼的下一个动作

V4 Pro 不是这轮更新的全部。V4 Flash 正式版更新日志里藏着一行小字——评测使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架。

模型还没发完,框架已经在路上了。

模型大脑Agent 框架工具调用替人干活

结合刚注册的「DeepSeek Harness 团队」公众号和此前的招聘信息,DeepSeek 显然在准备把模型和 Agent 运行框架打包推出

如果说过去的竞争还停留在「谁的模型更聪明」,Harness 的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。V4 Pro 补齐了大脑这一环,接下来就看那个「即将发布」还要等多久。
编辑核心判断

模型竞争正在换赛道:从「谁的模型更聪明」升级为「谁能把大脑、手脚和工具箱组装成真正替人干活的系统」。V4 Pro 补齐了大脑,DeepSeek Harness 已经注册官方账号——下一场仗,比的是整机装配能力,而不是单一零件。

现在就能用

进入 DeepSeek 开放平台即可调用,模型名仍为 deepseek-v4-pro,当前指纹版本 fp_v4pro_20260812。此前预告的 API 涨价尚未执行,需要长期调用的团队建议尽早评估成本。