AI·快讯
🧠 模型更新 · 技术解析

架构未变,仅靠后训练 Agent 能力大涨——DeepSeek V4-Flash 更新揭示务实路线

DeepSeek 今日上线 V4-Flash 正式版(0731),与 Preview 版本采用相同模型结构和参数规模,仅重新进行后训练,便在 Agent 基准测试中取得明显提升。同时原生支持 Responses API 与 Codex 适配,模型权重 + 接口环境双线升级

来源:公开信息 2026-07-22 全文约 4 分钟读完
#DeepSeek #V4-Flash #后训练 #Agent #Responses API
82.7 Terminal Bench 2.1
54.4 DeepSWE
68.7 DSBench-FullStack

⚡ 30 秒速览

  • 核心变化:模型架构与参数规模不变,仅重新后训练,Agent 基准成绩大幅提升。
  • 三大测试:Terminal Bench 2.1(82.7)、DeepSWE(54.4)、DSBench-FullStack(68.7)——均属 Agent 类任务,要求模型在真实工作环境中连续执行多步操作。
  • 接口升级:原生支持 Responses API,针对 Codex 工作流适配,降低 Agent 工具接入成本。
  • 诚实注脚:部分测试使用了内部 Harness 与数据集,暂不具备完整外部复现条件,需独立验证。
  • 路线信号:验证了一条更务实的技术路径——不依赖模型扩容,通过后训练与工程适配释放 Agent 潜力。

01这次更新了什么 后训练,而非重新设计

大模型的训练可分为两个阶段。预训练让模型通过海量文本与代码学习知识,形成基础能力,决定模型"知道多少";后训练则针对具体任务进行专项优化——教会模型如何回答问题、调用工具、按指令完成任务。

DeepSeek V4-Flash-0731 没有改变模型架构,也没有扩大参数规模,而是在原有模型上重新进行后训练。内部权重和行为方式发生了变化,但结构不变。

预训练

学习知识、形成基础能力。决定模型"知道多少"。

后训练(本次更新)

针对任务专项优化——学会回答问题、调用工具、按指令完成任务。

这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布本次后训练具体使用了哪些数据、奖励方法和训练流程——性能提升究竟来自哪一项技术,目前仍无法断言

02Agent 基准成绩 测的是"能不能把事做完"

三项测试与传统的代码补全完全不同。它们不要求模型写一段代码,而是要求模型真正进入一个工作环境——读取文件、理解代码仓库、调用终端、修改程序、运行测试,再根据报错继续处理。模型需要连续完成多个步骤,而不是只给出答案。

82.7 Terminal Bench 2.1 终端操作与工具调用
54.4 DeepSWE 软件工程任务
68.7 DSBench-FullStack 全栈开发能力

注:三项测试均为 Agent 类任务,评估模型在真实工作环境中执行多步操作的能力。部分测试使用了 DeepSeek 内部 Harness 及较高推理档位,DSBench-FullStack 为 DeepSeek 内部测试集。更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,在第三方框架中的实际表现,还需更多独立测试。

一个诚实的注脚:这些成绩不能完全理解为模型自身的单独能力。DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位。因此,最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,很难只归功于其中某一项。

03Responses API + Codex 适配 接口层面的 Agent 基建

此次更新还有一个重要变化:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行了适配。Responses API 可以理解为一套更适合 Agent 的通信接口——它能够更统一地处理模型回复、推理状态、工具调用和执行结果。

它本身不会让模型突然变得更"聪明",但可以减少模型接入 Codex 等 Agent 工具时的适配工作,让开发者更容易把模型放进真实的软件开发流程。

所以,这次更新其实包含两个层面:一部分是重新后训练后的模型权重,另一部分是更适合 Agent 使用的接口和运行环境。两者叠加,才构成了最终的基准成绩。

模型后训练Responses APICodex 适配Agent 能力释放

这条链路中,每一环都不可或缺。模型权重决定能力上限,接口与工具环境决定能力能否被有效调用。

04一条更务实的技术路线

目前可以确定的是:DeepSeek 在没有改变 V4-Flash 模型结构和参数规模的情况下,通过重新后训练提高了官方 Agent 基准成绩,同时增强了对 Responses API 和 Codex 工作流的支持。

但现阶段还不能直接得出"后训练已经可以替代模型扩容"或"V4-Flash 已经全面领先其他 Agent 模型"这样的结论。一方面,后训练的具体变化尚未公开;另一方面,官方部分测试所使用的 Harness 和内部数据集还不具备完整的外部复现条件。

所以,这次更新不适合简单总结为"DeepSeek 又发布了一个更强的模型"。更准确的理解是:DeepSeek 正在验证一条更加务实的技术路线——当模型结构和参数规模保持不变时,能否通过重新后训练、工具接口适配和 Agent 运行框架,进一步提高模型完成真实任务的能力。

DeepSeek 已经给出了官方成绩,但这条路线究竟能带来多大的实际提升,还要等待更多训练细节、公开工具和第三方测试。

编辑核心判断

后训练 + 接口适配 + 运行框架的组合优化,正在成为模型能力释放的"隐形杠杆"。参数竞赛之外,工程深度同样决定Agent的天花板。