⚡ 模型发布 · 深度实测

DeepSeek V4-Pro 正式版悄然上线:官方称工程能力提升 4.9 倍,实测 3D 浮岛 0 bug 交付

8月12日晚,DeepSeek V4-Pro 正式版(版本号 0813)出现在 API 文档里。没有发布会,没有官宣推文。官方给出的核心数字是:软件工程智能体得分 DeepSWE 从 12.8 涨到 62.7,约 4.9 倍。我们用社区最新一代复杂测试手法实测 7 项任务——结论:升级过硬,但有两处低级失误,暂时无法解释。

来源:综合公开信息 2026-08-13 全文约 4 分钟读完
#DeepSeek V4-Pro #正式版 #AI Agent #基准评测
4.9× DeepSWE:12.8 → 62.7(官方口径)
0 bug 压轴 3D 浮岛网站首轮运行
3× 输出 token 定价涨幅(2元 → 6元)

⚡ 30 秒速览

  • 悄悄转正:4 月发布的 Preview 在 8 月 12 日变成正式版,版本号 0813,无发布会,API 文档直接上线。
  • 官方宣称:DeepSWE 从 12.8 提到 62.7,约 4.9 倍;Terminal Bench、Cybergym、NL2Repo 等九项基准全线大涨。
  • 社区质疑:有对比认为 0813 仍略逊于 Luna MX,约一半基准落后 Kimi K3;官方未发布完整报告。
  • 实测亮点:60 种风格 Bento 墙一次通过;3D 浮岛作品集 1.5 小时交付,首轮 0 bug;记账本三轮迭代全部自修。
  • 低级失误:鹈鹕自行车 SVG 翻车、动画月亮绘制错误;同款失误也出现在 Kimi K3 上,暂无规律。
  • 涨价预告:输出 token 从 2 元涨到 6 元,官方称“近期整体上调,预计涨幅较大”。

01发生了什么 正式版悄悄转正

8月12日晚,DeepSeek V4-Pro 正式版悄然出现在 API 文档里。没有发布会,也没有官宣推文。4月24日发布的 Preview 状态,在三个多月后正式“转正”,命名直白:用日期标注为 0813

这次转正,参数上做了几件实打实的事。

旧叙事:更会答题

强调知识问答、代码生成等单点能力。

新叙事:更会把一件事干完

强调像工程师一样持续干活,交付可验证结果。

1M上下文长度
384K输出上限
双模式thinking / non-thinking
双协议OpenAI / Anthropic 兼容

注:双协议兼容意味着 Claude Code 这类 Agent 框架可以直接换 base_url 接入,这是后面实测能“接入真实 Agent 环境”的前提。

02为什么可信 官方数字与第三方质疑

官方给出的九项 Agent 与代码基准全线大涨。我们节选四项,按提升量排序:

DeepSWE软件工程 · 12.8 → 62.7
+49.9
Cybergym网络安全 · 52.7 → 83.3
+30.6
NL2Repo自然语言转仓库 · 38.5 → 61.5
+23.0
Terminal Bench 2.1终端操作 · 72.1 → 87.9
+15.8

注:条长按各基准提升量相对比例绘制,不代表不同基准难度相同。Preview 基线数值由官方口径推算,具体以官方发布为准。

但社区存在质疑声。有开发者对比后认为 0813 仍略逊于 Luna MX,也有人指出它约一半基准还落后 Kimi K3。官方至今没有发布完整的 benchmark 报告。

这就是我们做这次实测的原因——不转述官方数字,自己跑。

03它能做什么 七项实测,四亮一翻车

动手前必须交代背景:圈里的测试手法正在换代。Karpathy 入职 Anthropic 后发长推建议告别“鹈鹕骑自行车”这类旧题,转向《指环王》这种需要“读懂文学、搭出一个世界”的复杂任务。我们的 7 道题全部避开基础能力,按难度递进。

🏝️ 3D 浮岛作品集网站 首轮 0 bug

  • 与 GPT-5.6、Kimi K3、V4-Flash-0731 完全相同的 Prompt:滚动驱动相机、四章节叙事、物件交互、Bloom 后处理、移动端降级。
  • 用时 1.5 小时,最后半小时一直在自测项目能否启动,确认无误才交付。
  • 转场、运镜、交互、移动端适配全部在线;唯一缺点是初始界面过曝。
✍️ 历史对比:GPT-5.6 功能完整度最高,但点击物件时背景虚化;Kimi K3 观感完成度此前最佳;V4-Flash 运镜偏弱。0813 补齐了全部短板。

🎴 60 种风格 Bento 卡片墙 一次通过

  • 每张卡片必须用该风格最典型的视觉语言,不能只换配色。
  • 60 种风格全部实现,不规则拼贴被严格执行,风格差异非常明显。
  • 玻璃拟态与粗野主义这类“没有共同点”的风格都被抓准,说明设计语料积累是实打实的。
✍️ 没有敷衍的“换色卡”,vibe coding 项目不用再担心风格单调。

🧙 指环王霍比屯:111 岁生日宴会 零漂浮零穿模

  • 只给小说开头段落,要求用 Three.js 搭建可运行的 3D 世界。
  • 洞屋、宴会长桌、宾客、烟火要素齐全,没有漂浮、没有穿模。
  • 运镜从俯瞰霍比屯推近到比尔博,之后单调左右晃动;单场景与 Opus 5 不相上下。
✍️ 注意:单场景、单段落样本有限,不代表整体能力相当;后续会补完整段落对比。

📒 记账本全栈应用:三轮迭代 全程自修

  • 从零搭全栈应用,连续三轮迭代:记账核心功能、月度分类统计、预算提醒。
  • 每轮都改多份文件、补测试、跑测试,跑不过就自己修,直到通过才进入下一轮。
  • 全程未让人介入纠错;唯一小插曲是每新建一个文件都申请一次权限。
✍️ 这是官方 DeepSWE 叙事最直接的落地样本:能连续干完一件事,并交付可运行结果。

🐦 翻车记录:鹈鹕骑自行车 & 月亮 暂时无解

  • 鹈鹕脚踩在踏板上,但踏板不在自行车上;车架结构不科学,天上的云是反向的。
  • 把推理强度从 max 降到 high 重测,依旧失败。
  • 动画叙事题中,老水手等船的调度和配色都很到位,月亮却画错了。
✍️ 强如 Kimi K3 也犯过类似错误。样本太少,无法归纳规律,只能先记录在案。

04为什么能做到 从“答题”到“把事干完”

这次最直观的质变,是前端审美。过去大半年,AI 生成的前端有个通病:蓝紫渐变、玻璃拟态、圆角卡片,一眼假。0813 的配色、音效与操作反馈,已经进入顶级模型行列。

真正的变化藏在官方叙事里。

不再强调“更会答题”,而是强调“更会把一件事干完”。配合 1M 上下文、双协议兼容和长输出,0813 被设计成能持续干活的“工程师”,而不是会聊天的“问答机”。

4月24日
V4 系列发布Pro 标为 Preview
8月12日
V4-Pro 正式版 0813悄然上线,同步涨价预告
同期
Grok 4.6 发布一闭源一开源,双双走高价值路线

注:时间线为事件先后顺序的简化呈现,具体日期以官方发布为准。

具体到价格:按每 1M token 计算,缓存未命中输入 3 元、输出 6 元;相比 V4-Flash,输出从 2 元涨到 6 元,输入未命中从 1 元涨到 3 元,都是三倍。官方预告“近期整体上调 API 服务定价,预计涨幅较大”。

以这次实测的表现,即便涨价,它依然极具性价比。但这也意味着:DeepSeek 正在告别价格战,AI 大模型集体转向高性能、高价值的路线。

免费午餐的窗口,正在关闭。

05编辑判断 面向行业

编辑核心判断

这次实测最值得记住的不是分数,而是方向:从“更会答题”到“更会把一件事干完”,模型竞争的度量衡变了。“月亮”和“鹈鹕”的失误提醒我们,再强的模型仍有盲区。

DeepSeek 的涨价预告不是孤例,Grok 4.6 同期推出,高性能+高价值的定价路线正在成为行业集体选择。当“把事干完”成为新的度量衡,价格战已经不是最优解——价值战才刚刚开始。

体验入口

DeepSeek V4-Pro 已上线 API 文档,版本号 0813。支持 OpenAI / Anthropic 双协议兼容,可替换 base_url 直接接入 Agent 框架。

DeepSeek 开放平台 → API 文档