🧠 模型 · 版本升级

DeepSeek V4 Flash 正式版 API 上线,Agent 能力全面超越前代

7 月 31 日,DeepSeek 通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。该模型在 Terminal Bench、NL2Repo、DSBench 等多项 Agent 基准测试中大幅超越 V4-Pro-Preview,成为当前最强版本。

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#DeepSeek #V4 Flash #Agent #基准测试
82.7 Terminal Bench 2.1
终端操作智能体
54.4 DeepSWE
软件工程任务
68.7 DSBench-FullStack
全栈开发

⚡ 30 秒速览

  • 版本升级:DeepSeek-V4-Flash-0731 正式版 API 上线公测,模型结构与预览版保持一致,仅重新后训练。
  • Agent 飞跃:在 Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon 等 9 项基准测试中全面超越 V4-Pro-Preview。
  • 原生适配:支持 Responses API 格式,针对性适配 Codex,开发者可无缝集成。
  • 致胜关键:后训练环节重点强化 Agent 能力,工程优化释放模型潜力。

01Agent 基准测试全览 V4 Flash 正式版多项分数领先

DeepSeek 官方公布的基准测试结果覆盖了从终端操作到全栈开发的多个维度,下图为各任务得分排行(按分数从高到低排列):

Terminal Bench 2.1终端智能体
82.7
Cybergym网络安全
76.7
Toolathlon verified工具调用
70.3
DSBench-FullStack全栈开发
68.7
DSBench-Hard全栈开发(困难)
59.6
NL2Repo自然语言生成代码仓库
54.2
DeepSWE软件工程
54.4
Agent Last Exam智能体综合考试
25.2
Automation Bench (Public)自动化基准
25.1

注:条形图以最高分 82.7 为 100% 缩放,非零起点,便于展示相对差距。分数跨度较大(25.1–82.7),读者可关注绝对数值。

02正式版 vs 预览版:结构不变,能力跃升

DeepSeek 官方在 API 文档中明确说明:V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 保持一致,仅重新进行了后训练。这意味着架构本身未变,升级全部来自训练工艺的优化。

V4-Flash-preview

预览版,基础能力已属上游,但 Agent 场景表现有限。

V4-Flash-0731 正式版

后训练专注 Agent 能力,9 项基准测试全面超越预览版,部分任务分数翻倍。

一个诚实的注脚:

虽然基准分数亮眼,但部分任务(如 Agent Last Exam 25.2)依然偏低,说明复杂推理场景仍有提升空间。正式版的价值在于 针对 Agent 场景的定向优化效果显著,且无需开发者适配新框架——原生支持 Responses API 和 Codex 意味着现有系统可快速集成。

后训练优化适配 CodexResponses APIAgent 能力释放

技术链路:后训练环节重点强化工具调用、任务拆解和结果验证能力,最终通过 API 形式交付给开发者。

03两个典型场景:从终端操作到全栈开发

💻 Terminal Bench:像人一样在终端里工作82.7 分

  • 任务描述:模型需要像真实工程师一样在 Linux 终端中执行命令、读取文件、安装依赖、调试程序,最终完成指定目标。
  • 能力要求:环境感知、命令生成、错误处理、多步规划,每一步都不能出错。
  • 典型用例:「部署一个 Nginx 服务器并配置 HTTPS」——模型自主完成所有 shell 操作。
评分维度:任务完成度、步骤正确性、自主纠错能力 —— 综合得分 82.7,为所有基准最高。

📦 DSBench-FullStack:从需求到部署的全栈应用68.7 分

  • 任务描述:根据自然语言需求,生成完整的前后端代码、数据库 schema、API 文档,并确保可运行。
  • 能力要求:代码生成、框架选择、错误修复、部署配置。
  • 典型用例:「创建一个博客系统,用户可注册、发帖、评论,使用 React + Node.js + PostgreSQL」。
评分维度:代码正确性、功能完整性、部署成功率 —— 大模型在复杂工程任务上取得突破。

这些基准测试的设计理念与 PinchBench 类似:考的是「把整件事做完并交付可验证结果」,而非简单的问答。V4 Flash 正式版在多个维度证明了自己可以胜任复杂工程场景。

04日常开发中的 Agent 能力

基准测试之外,这些能力能直接转化为开发者日常效率提升:

一句话生成自动化脚本

「写一个 Python 脚本,每天从 API 拉取数据,分析后发送邮件报告。」——模型自动生成完整代码,包含错误处理和日志记录。

🔧

智能体辅助调试

「我的 Node.js 应用在部署时出现 502 错误,帮我排查。」——模型自主分析日志、检查配置、定位问题并给出修复建议。

📊

数据流水线编排

「从 MySQL 导出用户数据,清洗后导入 BigQuery,并生成报表。」——多步任务链,每一步依赖上一步的输出,模型完整执行。

编辑核心判断

Agent 能力的突破不再依赖模型参数堆叠,后训练与工程适配已成为释放潜力的关键杠杆。DeepSeek 用结构相同的版本证明了这一点——这预示着未来 AI 竞争将从「参数军备」转向「系统工程效率」。

现在就能用

DeepSeek-V4-Flash 正式版 API 已上线公测,开发者可通过官方 API 文档接入,体验增强的 Agent 能力。

登录 DeepSeek 官网 → 体验 API