DeepSeek V4 Flash 正式版 API 上线,Agent 能力全面超越前代
7 月 31 日,DeepSeek 通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。该模型在 Terminal Bench、NL2Repo、DSBench 等多项 Agent 基准测试中大幅超越 V4-Pro-Preview,成为当前最强版本。
终端操作智能体
软件工程任务
全栈开发
7 月 31 日,DeepSeek 通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。该模型在 Terminal Bench、NL2Repo、DSBench 等多项 Agent 基准测试中大幅超越 V4-Pro-Preview,成为当前最强版本。
DeepSeek 官方公布的基准测试结果覆盖了从终端操作到全栈开发的多个维度,下图为各任务得分排行(按分数从高到低排列):
注:条形图以最高分 82.7 为 100% 缩放,非零起点,便于展示相对差距。分数跨度较大(25.1–82.7),读者可关注绝对数值。
DeepSeek 官方在 API 文档中明确说明:V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 保持一致,仅重新进行了后训练。这意味着架构本身未变,升级全部来自训练工艺的优化。
预览版,基础能力已属上游,但 Agent 场景表现有限。
后训练专注 Agent 能力,9 项基准测试全面超越预览版,部分任务分数翻倍。
一个诚实的注脚:
虽然基准分数亮眼,但部分任务(如 Agent Last Exam 25.2)依然偏低,说明复杂推理场景仍有提升空间。正式版的价值在于 针对 Agent 场景的定向优化效果显著,且无需开发者适配新框架——原生支持 Responses API 和 Codex 意味着现有系统可快速集成。
技术链路:后训练环节重点强化工具调用、任务拆解和结果验证能力,最终通过 API 形式交付给开发者。
这些基准测试的设计理念与 PinchBench 类似:考的是「把整件事做完并交付可验证结果」,而非简单的问答。V4 Flash 正式版在多个维度证明了自己可以胜任复杂工程场景。
基准测试之外,这些能力能直接转化为开发者日常效率提升:
「写一个 Python 脚本,每天从 API 拉取数据,分析后发送邮件报告。」——模型自动生成完整代码,包含错误处理和日志记录。
「我的 Node.js 应用在部署时出现 502 错误,帮我排查。」——模型自主分析日志、检查配置、定位问题并给出修复建议。
「从 MySQL 导出用户数据,清洗后导入 BigQuery,并生成报表。」——多步任务链,每一步依赖上一步的输出,模型完整执行。
Agent 能力的突破不再依赖模型参数堆叠,后训练与工程适配已成为释放潜力的关键杠杆。DeepSeek 用结构相同的版本证明了这一点——这预示着未来 AI 竞争将从「参数军备」转向「系统工程效率」。
DeepSeek-V4-Flash 正式版 API 已上线公测,开发者可通过官方 API 文档接入,体验增强的 Agent 能力。
登录 DeepSeek 官网 → 体验 API