AI·快讯
🚀 模型发布 · 能力反超

倒反天罡:DeepSeek-V4-Flash 正式版上线,Agent 能力全面超越 Pro 预览版

7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测,以 284B 总参 / 13B 激活 的轻量级 MoE 架构,在 Agent 基准测试中全面超越自家 4 月上线的 Pro 预览版——更便宜的型号反而更强,「倒反天罡」成为现实。

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#DeepSeek #V4-Flash #Agent #模型发布 #倒反天罡
🥇 全面反超 Flash 正式版 Agent 能力超越 Pro 预览版
82.7 Terminal Bench 2.1 · 核心基准得分
0.2元/百万tokens 输入价(命中缓存),仅为 Pro 的 1/5

⚡ 30 秒速览

  • 赢在哪:Flash 正式版在 Terminal Bench、NL2Repo、Cybergym 等多项 Agent 基准中,全面超越 4 月上线的 Pro 预览版,价格却低得多。
  • 核心参数:MoE 架构,284B 总参 / 13B 激活,支持最长 100 万 token 上下文,非思考与思考模式一键切换。
  • 生态兼容:原生支持 OpenAI Responses API 格式,针对性适配 Codex,开发者无需修改 Base URL 即可切换模型。
  • 效率跃升:100 万 token 场景下,单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%。
  • 后续节奏:DeepSeek-V4-Pro 正式版将于 8 月初上线,Flash 正式版已开放公测。

01核心参数 Flash 正式版规格一览

DeepSeek-V4-Flash 正式版采用 MoE 混合专家架构,总参数量 284B,激活参数仅 13B,与 4 月发布的 Flash 预览版结构尺寸一致,但通过重新后训练实现了 Agent 能力的显著跃升。支持 100 万 token 超长上下文,并可在非思考与思考模式间自由切换。

MoE 架构 总参 284B 激活 13B 上下文 100 万 token 思考 / 非思考切换 OpenAI API 兼容 适配 Codex

此外,Flash 正式版已原生适配 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品,并支持 OpenAI Responses API 格式——开发者无需修改 Base URL 即可在不同模型间切换,迁移成本极低。

02基准成绩单 九项 Agent 评测全维度覆盖

DeepSeek 官方公布的 Flash 正式版基准测试成绩,覆盖代码生成、终端操作、全栈开发、安全工程等核心 Agent 场景。以下为完整得分:

82.7Terminal Bench 2.1
54.2NL2Repo
76.7Cybergym
54.4DeepSWE
70.3Toolathlon verified
25.2Agent Last Exam
25.1Automation Bench (Public)
68.7DSBench-FullStack
59.6DSBench-Hard

注:以上为 DeepSeek-V4-Flash 正式版在各项基准中的得分。官方表示其 Agent 能力已全面超越 4 月上线的 DeepSeek-V4-Pro-Preview,后者在 Agentic Coding 评测中已进入开源第一梯队,交付质量接近 Claude Opus 4.6 非思考模式。

03价格对比 Flash 正式版 vs Pro 预览版

最令人意外的不是性能,而是定价。Flash 正式版在输入命中缓存场景下,价格仅为 Pro 预览版的 1/5;即使未命中缓存,也仅为 Pro 的 1/12。输出价格差距更为悬殊。

DeepSeek-V4-Pro-Preview

输入(命中缓存)

1 元 / 百万 tokens

输入(未命中缓存)

12 元 / 百万 tokens

输出

24 元 / 百万 tokens

DeepSeek-V4-Flash 正式版

输入(命中缓存)

0.2 元 / 百万 tokens ▼ 80%

输入(未命中缓存)

1 元 / 百万 tokens ▼ 91.7%

输出

2 元 / 百万 tokens ▼ 91.7%

注:价格对比基于 DeepSeek API 官方定价。Flash 正式版在多项 Agent 基准中超越 Pro 预览版,同时价格大幅降低,性价比优势显著。

04长上下文效率 成本降低一个量级

除了 Agent 能力的飞跃,Flash 正式版在长上下文场景下的效率优化同样值得关注。对于需要处理超长文档、复杂代码库或多轮交互的 Agent 任务,算力与显存成本是实际落地中的关键瓶颈。

🔧 100 万 token 场景:推理成本骤降 效率跃升

  • 单 token 推理计算量仅为 DeepSeek-V3.2 的 27%,长链路任务响应速度显著提升。
  • KV Cache 占用降至约 10%,大幅降低显存需求,支持更长上下文的同时减少硬件成本。
  • 两项优化叠加,使百万 token 级 Agent 任务的算力成本从「昂贵」变为「可负担」。
效率优化让长上下文场景的成本结构发生质变,开发者可以在不增加预算的前提下,处理更复杂的多步骤任务。

05为什么是 Flash 赢了 Pro?

答案并不复杂:后训练的价值正在被重新定义。Flash 正式版与预览版在架构、尺寸上完全一致,唯一的变量是「重新进行了后训练」。这意味着 DeepSeek 团队在数据配比、奖励建模、强化学习链路上找到了更优解。

一个诚实的注脚:

Pro 预览版发布于 4 月,当时其在数学、STEM 及竞赛型代码等高难度任务中已比肩 GPT-5.4 与 Claude Opus 4.6-Max。但 Agent 能力不是静态的——它依赖模型与工程框架的协同进化。Flash 正式版的全面反超,说明 DeepSeek 在后训练阶段将「工具使用」与「任务拆解」的能力权重提到了前所未有的高度。

这对行业意味着什么?

编辑核心判断

价格战是入场券,Agent 能力才是决赛圈。低价不等于低能——当最便宜的型号反而交出最强的 Agent 成绩单,模型竞争的底层逻辑已经从「参数军备竞赛」转向「系统工程效率的比拼」。

现在就能用

DeepSeek-V4-Flash 正式版 API 已上线公测,开发者可通过 DeepSeek API 直接调用,体验更强的 Agent 能力与更低的使用成本。

api.deepseek.com → 立即体验