架构未变,仅靠后训练 Agent 能力大涨——DeepSeek V4-Flash 更新揭示务实路线
DeepSeek 今日上线 V4-Flash 正式版(0731),与 Preview 版本采用相同模型结构和参数规模,仅重新进行后训练,便在 Agent 基准测试中取得明显提升。同时原生支持 Responses API 与 Codex 适配,模型权重 + 接口环境双线升级。
DeepSeek 今日上线 V4-Flash 正式版(0731),与 Preview 版本采用相同模型结构和参数规模,仅重新进行后训练,便在 Agent 基准测试中取得明显提升。同时原生支持 Responses API 与 Codex 适配,模型权重 + 接口环境双线升级。
大模型的训练可分为两个阶段。预训练让模型通过海量文本与代码学习知识,形成基础能力,决定模型"知道多少";后训练则针对具体任务进行专项优化——教会模型如何回答问题、调用工具、按指令完成任务。
DeepSeek V4-Flash-0731 没有改变模型架构,也没有扩大参数规模,而是在原有模型上重新进行后训练。内部权重和行为方式发生了变化,但结构不变。
学习知识、形成基础能力。决定模型"知道多少"。
针对任务专项优化——学会回答问题、调用工具、按指令完成任务。
这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布本次后训练具体使用了哪些数据、奖励方法和训练流程——性能提升究竟来自哪一项技术,目前仍无法断言。
三项测试与传统的代码补全完全不同。它们不要求模型写一段代码,而是要求模型真正进入一个工作环境——读取文件、理解代码仓库、调用终端、修改程序、运行测试,再根据报错继续处理。模型需要连续完成多个步骤,而不是只给出答案。
注:三项测试均为 Agent 类任务,评估模型在真实工作环境中执行多步操作的能力。部分测试使用了 DeepSeek 内部 Harness 及较高推理档位,DSBench-FullStack 为 DeepSeek 内部测试集。更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,在第三方框架中的实际表现,还需更多独立测试。
一个诚实的注脚:这些成绩不能完全理解为模型自身的单独能力。DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位。因此,最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,很难只归功于其中某一项。
此次更新还有一个重要变化:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行了适配。Responses API 可以理解为一套更适合 Agent 的通信接口——它能够更统一地处理模型回复、推理状态、工具调用和执行结果。
它本身不会让模型突然变得更"聪明",但可以减少模型接入 Codex 等 Agent 工具时的适配工作,让开发者更容易把模型放进真实的软件开发流程。
所以,这次更新其实包含两个层面:一部分是重新后训练后的模型权重,另一部分是更适合 Agent 使用的接口和运行环境。两者叠加,才构成了最终的基准成绩。
这条链路中,每一环都不可或缺。模型权重决定能力上限,接口与工具环境决定能力能否被有效调用。
目前可以确定的是:DeepSeek 在没有改变 V4-Flash 模型结构和参数规模的情况下,通过重新后训练提高了官方 Agent 基准成绩,同时增强了对 Responses API 和 Codex 工作流的支持。
但现阶段还不能直接得出"后训练已经可以替代模型扩容"或"V4-Flash 已经全面领先其他 Agent 模型"这样的结论。一方面,后训练的具体变化尚未公开;另一方面,官方部分测试所使用的 Harness 和内部数据集还不具备完整的外部复现条件。
所以,这次更新不适合简单总结为"DeepSeek 又发布了一个更强的模型"。更准确的理解是:DeepSeek 正在验证一条更加务实的技术路线——当模型结构和参数规模保持不变时,能否通过重新后训练、工具接口适配和 Agent 运行框架,进一步提高模型完成真实任务的能力。
DeepSeek 已经给出了官方成绩,但这条路线究竟能带来多大的实际提升,还要等待更多训练细节、公开工具和第三方测试。
后训练 + 接口适配 + 运行框架的组合优化,正在成为模型能力释放的"隐形杠杆"。参数竞赛之外,工程深度同样决定Agent的天花板。