🚀 模型发布 · Agent 能力增强

DeepSeek V4 Pro正式版发布:Agent能力超越Claude Fable 5,DeepSWE得分飙升389%

8月13日,DeepSeek-V4-Pro正式版API上线,大幅增强Agent能力,在Cybergym、AutomationBench两项智能体基准中超越Claude Fable 5,DeepSWE编程智能体测试得分从预览版的12.8跃升至62.7,提升幅度达389%。

综合公开信息整理 2026-08-14 全文约 3 分钟读完
#DeepSeek #V4 Pro #Agent #DeepSWE #基准测试
62.7 DeepSWE 正式版得分 · 预览版仅 12.8
389% DeepSWE 较预览版提升幅度
500 API 并发限制 · 低于 Flash 版 2500

⚡ 30 秒速览

  • 赢了多少:在 AI 安全智能体基准 Cybergym、工作流智能体 AutomationBench 中超越 Claude Fable 5,部分性能逼近甚至超越最强闭源模型。
  • 最炸裂的数据:DeepSWE 长周期软件工程测试得分从 12.8 → 62.7,提升 389%,证明复杂编程任务能力实现质的跃迁。
  • 能力增强清单:正式版支持 JSON 结构化输出、工具调用、Responses API、Anthropic API 兼容,Agent 开发体验大幅提升。
  • 一个诚实的注脚:开发者反馈网页端与 API 接口的思维链输出存在明显差异,API 端语序生硬,CoT 一致性有待改善。
  • 成本信号:官方预告近期将整体上调 API 定价,预计涨幅较大,独立开发者需留意成本变化。

01基准成绩 Agent 能力全面超越预览版,部分领先 Fable 5

DeepSeek-V4-Pro 正式版在三个关键智能体基准中交出了截然不同的成绩单:

🥇 DeepSWE长周期编程智能体 · 正式版
62.7
DeepSWE预览版 · 提升 389%
12.8
CybergymAI 安全智能体 · 超越 Fable 5
领先
AutomationBench工作流智能体 · 超越 Fable 5
领先

注:柱形为相对关系示意,非精确标尺。DeepSWE 数据为绝对值(12.8→62.7),Cybergym 与 AutomationBench 排名为"超越 Fable 5",具体分数未公开。领先幅度以标注文字为准。

02这些基准在测什么?智能体时代的硬核考场

传统基准考的是"模型知不知道",智能体基准考的是"模型能不能把事做完"。DeepSeek V4 Pro 跨越的这三道关卡,各有侧重:

传统基准(MMLU / GPQA)

答题式评测,考察知识储备与推理能力,与实际工程交付距离较远。

智能体基准(Cybergym / AutomationBench / DeepSWE)

考察智能体在真实场景中自主规划、调用工具、交付可验证结果的能力。

CybergymAI安全攻防
AutomationBench工作流自动化
DeepSWE长周期软件工程
389%DeepSWE提升

注:三大基准分别覆盖安全、办公、编程三个核心 Agent 落地场景。DeepSWE 的得分跃升是本次发布中最具冲击力的单一数据点。

DeepSWE 的 12.8 → 62.7,意味着什么?它不是 incremental 改进,而是能力层级的跃迁——从"几乎无法完成复杂编程任务"到"可以自主处理长周期、高复杂度的真实软件工程问题"。这个跃升幅度,在同类基准中极为罕见。

03Agent 能力增强 正式版带来了什么

DeepSeek-V4-Pro-0813 版本的核心更新围绕 Agent 开发体验展开,能力清单如下:

JSON 结构化输出 工具调用(Tool Use) Responses API Anthropic API 兼容 并发限制 500 模型版本锁定 以上能力均已在 API 中上线,调用方式不变,使用 deepseek-v4-pro 即可调用最新版本。

其中 JSON 结构化输出工具调用 是 Agent 开发者的核心诉求——前者让模型输出可编程解析,后者让模型能自主调用外部工具。配合 Responses APIAnthropic API 兼容,开发者可以更低成本迁移现有 Agent 工作流。

但是,能力增强的另一面,是开发者真实体验中暴露出的问题。

04诚实的注脚 CoT 差异与定价压力

正式版发布后,社交平台上有开发者反馈了一个值得注意的问题:

⚠️ 开发者反馈

网页端与 API 接口的思维链(CoT)输出存在明显差异。API 返回的推理过程话术读起来十分生硬、语序别扭,与网页端流畅自然的 CoT 表现形成对比。这意味着同一模型在不同部署环境下的推理一致性仍有改善空间,对于依赖 API 输出进行二次开发的团队而言,这是一个需要纳入考量的因素。

来源:对比 DeepSeek-V4-Pro 网页版与 API 调用的输出结果 · 开发者社区反馈

另一个不可忽视的信号是:DeepSeek 已预告近期整体上调 API 定价,预计涨幅较大。目前正式版价格尚未公布,结合此前"昇腾950超节点批量上市后会大幅下调 Pro 价格"的预期,定价策略的走向存在不确定性。

当基准跑分差距不断收窄,调用成本正在成为开发者选择模型的关键变量。

05为什么这件事值得关注?

DeepSeek-V4-Pro 正式版的意义,不只是"又一个模型版本更新"。它揭示了一个正在发生的行业转折:

大模型比拼正在进入智能体决赛圈。Cybergym、AutomationBench、DeepSWE 这类基准,衡量的是模型在真实工作流中的交付能力,而非静态知识储备。DeepSeek 在三个基准上的表现——尤其是 DeepSWE 的 389% 跃升——说明它在 Agent 赛道的竞争力已经进入第一梯队。

但更关键的变量是 成本。预览版发布时官方曾提到"昇腾950超节点批量上市后会大幅下调 Pro 价格",如今正式版发布却预告涨价。对于独立开发者和初创团队而言,Agent 项目落地的瓶颈已经从"模型能力"转向"调用成本"——各家模型在 Agent 基准上的跑分差距正在收窄,而每百万 token 的价格差异,可能成为开发者买单的决定性因素。

一个诚实的判断:

编辑核心判断

Agent 能力的军备竞赛已从"能不能做"进入"做得好不好"阶段,但真正决定开发者生态走向的,是成本与性能的交叉点——谁能在 2026 下半年找到更优的性价比平衡,谁就能赢得下一波 Agent 应用的落地红利。

现在就能用

DeepSeek-V4-Pro-0813 已正式上线,调用方式不变,通过官方 API 使用 deepseek-v4-pro 即可调用最新版本。支持 JSON 结构化输出、工具调用等增强能力,开发者可立即接入体验。

DeepSeek 官方平台 → 开始调用