🧠 模型 · 发布速递
DeepSeek V4 Pro 正式版深夜上线:111 天打磨,Agent 能力暴涨 50 分
8 月 13 日凌晨,DeepSeek 官网悄悄刷新 API 文档——deepseek-v4-pro 的 fingerprint 变为 fp_v4pro_20260812,正式版就此上线。没有任何预告,距离预览版发布已过 111 天,Agent 评测飙升近 50 分,API 价格暂时未动。
来源:综合公开信息整理•
2026-08-13•
全文约 4 分钟读完
#DeepSeek
#V4 Pro
#AI Agent
#API
111 天
预览版 → 正式版,零预告更新
+49.9
DeepSWE 得分涨幅(12.8 → 62.7)
¥3 / M
输入 token 单价,暂未涨价
⚡ 30 秒速览
- 发生了什么:8 月 13 日凌晨 API 文档悄然更新,fingerprint 变为 fp_v4pro_20260812,V4 Pro 正式版上线,零预告零倒计时。
- 涨在哪:DeepSWE 从 12.8 飙到 62.7,Cybergym 52.7 → 83.3,DSBench-Hard 翻倍至 67.2——清一色是长链路 Agent 场景。
- 实测表现:Boids 模拟 761 行一次通过;番茄钟主动补全白噪音与统计图表;寻路可视化关掉 thinking 后 54 秒交付。
- 一个坑:thinking 模式在代码生成时可能吃掉 80%+ 输出配额导致截断,复杂编码需要关掉或拉高 max_tokens。
- 诚实定位:HLE、NL2Repo 仍落后 Claude Opus 4.8 与 Fable 5;但 ¥3/百万 token 的价格只有 Fable 5 的约 1/10。
- 下一张牌:DeepSeek Harness 极简模式「即将发布」,模型与 Agent 框架可能打包推出。
01一场没有预告的发布
8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是 deepseek-v4-pro,但 fingerprint 已经变成 fp_v4pro_20260812——没有预告,没有倒计时,连更新日志都没来得及写好。
距离 4 月 24 日预览版上线,整整 111 天。
04-24预览版上线deepseek-v4-pro 首次亮相,Agent 是明显短板
07-31V4 Flash 正式版先行同样的后训练路线先跑通了一遍
08-06涨价预告悬顶「计划近期整体上调 API 定价,预计涨幅较大」
08-13V4 Pro 正式版上线凌晨悄悄刷新,fingerprint 更新为 fp_v4pro_20260812
这 111 天并不平静——Kimi K3 高调发布抢走开源头条,V4 Flash 正式版先行一步落地,涨价预告又悬在所有开发者头顶。所有人都在等同一个答案:Pro 的正式版,到底什么时候来?
答案是一个周三的深夜。
先看硬参数——架构和预览版完全一致。变的是后训练,而且变化大到像换了个模型。
总参数1.6T
激活参数49B
上下文1M
最大输出384K
规格与预览版完全相同:MoE 结构、1.6T 总参数 / 49B 激活。这轮升级的增量全部来自面向 Agent 场景的后训练。
02Agent 基准全线暴涨
最夸张的数字,来自 Agent 相关评测。从预览版到正式版,几个代表性基准的得分几乎是「跳涨」:
DeepSWEDeepSeek 自研软件工程基准+49.9
Cybergym网络安全 Agent 基准+30.6
Terminal Bench终端操作基准+15.8
DSBench-Hard数据科学任务 · 得分约翻倍≈2×
柱形按各基准正式版得分(最高 87.9)归一化,灰条为预览版、蓝条为正式版,仅用于比较同一基准的前后变化;不同基准之间不可横向对比。*DSBench-Hard 预览值按「翻了一倍多」表述推算。
这些测试项有一个共同点——它们都涉及长链路的代码修改、环境操作和工具调用。
恰好是预览版最容易翻车的地方。
从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准远超 Pro 预览版」的程度,Pro 版只是补上了同一课。
03真实任务:三次实测
跑分好看只是门票。真正有意义的是拿真实任务去试——这个模型在「一次性生成完整可运行代码」这件事上,到底到了什么水平?
🐦 Boids 群体行为模拟 761 行 · 一次通过
- 任务:Canvas 上 200 个三角形 boid,分离 / 对齐 / 凝聚三参数可调,彩色轨迹,点击生成捕食者,glassmorphism 风格控制面板。
- 结果:约 170 秒生成 761 行完整 HTML。物理模拟、实时渲染、UI 设计一次跑通,拖动滑块可实时改变群体行为。
实测结论:综合型任务一次运行通过,零人工修正。
🍅 模糊需求番茄钟 1223 行 · 自主补全
- 任务:只给一句方向——「好看、能计时、能记录、有白噪音、中文界面、要有质感」,其余让模型自行决定。
- 结果:除 25/5 分钟计时外,自行加入任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成了几种白噪音。
实测结论:对模糊需求的「产品化补全」能力,比预览版明显更强。
🧭 寻路算法可视化 关 thinking 后 54 秒
- 任务:BFS / DFS / A* 三种算法的逐步动画、可交互网格画墙、迷宫自动生成——代码量最大。
- 开着 thinking 模式:16384 token 配额中 13394 花在「思考」上,留给代码的不足 3000 token,HTML 写到一半直接截断。
- 关闭 thinking 重跑:54 秒输出完整 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。
编辑注:这是正式版的一个真实特征,不是 bug——复杂代码生成场景下推理 token 可能占到输出的 80% 以上,开发者需要主动关掉 thinking 或大幅拉高 max_tokens 兜底。
三次实测下来,这个模型的能力边界已经很清楚:长链路代码任务的一次性完整交付大幅改善,但 thinking 模式需要开发者学会「按场景开关」。
04一张不是「全面碾压」的成绩单
坦率地说,V4 Pro 0813 并不是没有短板。它还没坐上的头把交椅,和它真正的杀伤力,同样清晰:
⚠ 还没追上的位置
- HLE(无工具)42.7,落后 Claude Opus 4.8 的 49.8 与 Fable 5 的 53.3。
- NL2Repo 61.5,落后 Opus 4.8 的 69.7。
- 与 Kimi K3 的部分测试存在轻微差距。
⚡ 价格定律的杀伤力
- 每百万 token 输入 ¥3、输出 ¥6,与预览版持平。
- 约为 Fable 5 的 1/10、Kimi K3 的 1/3。
- 8 月 6 日预告的 API 涨价,目前尚未执行。
「比我强的没我便宜,比我便宜的没我强。」
在 Agent 能力从「几乎不可用」暴涨到「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。窗口期能撑多久不好说——想按老价格上车的,得趁早。
05大鲸鱼的下一个动作
V4 Pro 不是这轮更新的全部。V4 Flash 正式版更新日志里藏着一行小字——评测使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架。
模型还没发完,框架已经在路上了。
模型大脑→Agent 框架→工具调用→替人干活
结合刚注册的「DeepSeek Harness 团队」公众号和此前的招聘信息,DeepSeek 显然在准备把模型和 Agent 运行框架打包推出。
如果说过去的竞争还停留在「谁的模型更聪明」,Harness 的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。V4 Pro 补齐了大脑这一环,接下来就看那个「即将发布」还要等多久。
编辑核心判断
模型竞争正在换赛道:从「谁的模型更聪明」升级为「谁能把大脑、手脚和工具箱组装成真正替人干活的系统」。V4 Pro 补齐了大脑,DeepSeek Harness 已经注册官方账号——下一场仗,比的是整机装配能力,而不是单一零件。
▶现在就能用
进入 DeepSeek 开放平台即可调用,模型名仍为 deepseek-v4-pro,当前指纹版本 fp_v4pro_20260812。此前预告的 API 涨价尚未执行,需要长期调用的团队建议尽早评估成本。