DeepSeek V4 Pro正式版发布:Agent能力超越Claude Fable 5,DeepSWE得分飙升389%
8月13日,DeepSeek-V4-Pro正式版API上线,大幅增强Agent能力,在Cybergym、AutomationBench两项智能体基准中超越Claude Fable 5,DeepSWE编程智能体测试得分从预览版的12.8跃升至62.7,提升幅度达389%。
8月13日,DeepSeek-V4-Pro正式版API上线,大幅增强Agent能力,在Cybergym、AutomationBench两项智能体基准中超越Claude Fable 5,DeepSWE编程智能体测试得分从预览版的12.8跃升至62.7,提升幅度达389%。
DeepSeek-V4-Pro 正式版在三个关键智能体基准中交出了截然不同的成绩单:
注:柱形为相对关系示意,非精确标尺。DeepSWE 数据为绝对值(12.8→62.7),Cybergym 与 AutomationBench 排名为"超越 Fable 5",具体分数未公开。领先幅度以标注文字为准。
传统基准考的是"模型知不知道",智能体基准考的是"模型能不能把事做完"。DeepSeek V4 Pro 跨越的这三道关卡,各有侧重:
答题式评测,考察知识储备与推理能力,与实际工程交付距离较远。
考察智能体在真实场景中自主规划、调用工具、交付可验证结果的能力。
注:三大基准分别覆盖安全、办公、编程三个核心 Agent 落地场景。DeepSWE 的得分跃升是本次发布中最具冲击力的单一数据点。
DeepSWE 的 12.8 → 62.7,意味着什么?它不是 incremental 改进,而是能力层级的跃迁——从"几乎无法完成复杂编程任务"到"可以自主处理长周期、高复杂度的真实软件工程问题"。这个跃升幅度,在同类基准中极为罕见。
DeepSeek-V4-Pro-0813 版本的核心更新围绕 Agent 开发体验展开,能力清单如下:
其中 JSON 结构化输出与 工具调用 是 Agent 开发者的核心诉求——前者让模型输出可编程解析,后者让模型能自主调用外部工具。配合 Responses API 和 Anthropic API 兼容,开发者可以更低成本迁移现有 Agent 工作流。
但是,能力增强的另一面,是开发者真实体验中暴露出的问题。
正式版发布后,社交平台上有开发者反馈了一个值得注意的问题:
网页端与 API 接口的思维链(CoT)输出存在明显差异。API 返回的推理过程话术读起来十分生硬、语序别扭,与网页端流畅自然的 CoT 表现形成对比。这意味着同一模型在不同部署环境下的推理一致性仍有改善空间,对于依赖 API 输出进行二次开发的团队而言,这是一个需要纳入考量的因素。
另一个不可忽视的信号是:DeepSeek 已预告近期整体上调 API 定价,预计涨幅较大。目前正式版价格尚未公布,结合此前"昇腾950超节点批量上市后会大幅下调 Pro 价格"的预期,定价策略的走向存在不确定性。
当基准跑分差距不断收窄,调用成本正在成为开发者选择模型的关键变量。
DeepSeek-V4-Pro 正式版的意义,不只是"又一个模型版本更新"。它揭示了一个正在发生的行业转折:
大模型比拼正在进入智能体决赛圈。Cybergym、AutomationBench、DeepSWE 这类基准,衡量的是模型在真实工作流中的交付能力,而非静态知识储备。DeepSeek 在三个基准上的表现——尤其是 DeepSWE 的 389% 跃升——说明它在 Agent 赛道的竞争力已经进入第一梯队。
但更关键的变量是 成本。预览版发布时官方曾提到"昇腾950超节点批量上市后会大幅下调 Pro 价格",如今正式版发布却预告涨价。对于独立开发者和初创团队而言,Agent 项目落地的瓶颈已经从"模型能力"转向"调用成本"——各家模型在 Agent 基准上的跑分差距正在收窄,而每百万 token 的价格差异,可能成为开发者买单的决定性因素。
一个诚实的判断:
Agent 能力的军备竞赛已从"能不能做"进入"做得好不好"阶段,但真正决定开发者生态走向的,是成本与性能的交叉点——谁能在 2026 下半年找到更优的性价比平衡,谁就能赢得下一波 Agent 应用的落地红利。
DeepSeek-V4-Pro-0813 已正式上线,调用方式不变,通过官方 API 使用 deepseek-v4-pro 即可调用最新版本。支持 JSON 结构化输出、工具调用等增强能力,开发者可立即接入体验。
DeepSeek 官方平台 → 开始调用