⚡ 模型 · 版本更新

DeepSeek-V4-Flash 正式版上线:Agent 能力全面超越 Pro 预览版,成本更低性能更强

7月31日,DeepSeek-V4-Flash 正式版 API 公测上线。采用 MoE 架构,总参 284B(激活 13B),支持最长 100万 token 上下文。在 Terminal Bench、DeepSWE、DSBench 等多项 Agent 基准测试中,全面超越 4 月发布的 Pro 预览版,且价格仅为 Pro 的约 1/10。

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#DeepSeek #V4-Flash #Agent #MoE #API
82.7 Terminal Bench 2.1 · 最高 Agent 基准
284B 总参数量
13B 激活参数量

⚡ 30 秒速览

  • 反超自家 Pro:Flash 正式版在 Agent 核心评测(Terminal Bench、DeepSWE、DSBench 等)中全面超越 4 月发布的 Pro 预览版,且价格更低。
  • 架构不变,后训练致胜:模型结构与 Flash 预览版一致,仅重新进行后训练,Agent 能力大幅跃升。
  • 原生支持 OpenAI 格式:兼容 Responses API 并适配 Codex,开发者无需修改 Base URL 即可切换模型。
  • 长上下文效率革命:100 万 token 场景下,单 token 推理计算量仅为 V3.2 的 27%,KV Cache 降至约 10%。
  • 价格屠夫:输入命中缓存仅 0.2 元/百万 tokens,约为 Pro 版的 1/5;输出 2 元/百万 tokens,约为 Pro 版的 1/12。

01Flash 正式版上线 MoE 架构,后训练重写 Agent 能力

DeepSeek-V4-Flash 正式版采用 MoE 架构,总参 284B、激活 13B,支持最长 100 万 token 上下文,支持非思考与思考模式切换。模型结构与 3 个月前发布的 Flash 预览版完全一致,仅重新进行了后训练——但正是这一步,让 Agent 能力发生了质变。

一个诚实的注脚:通常后训练只做微调,而 DeepSeek 这次的后训练似乎专门针对 Agent 工具调用、多步任务拆解进行了深度优化。

284B 总参数
13B 激活参数
100万 最大上下文 (tokens)

02Agent 基准成绩 全面超越 Pro 预览版

在官方公布的 9 项 Agent 基准测试中,Flash 正式版分数均远高于 4 月上线的 Pro 预览版(Pro 预览版未公开具体分数,但官方明确表示“远超”)。以下是部分关键分数:

Terminal Bench 2.1终端任务
82.7
DSBench-FullStack全栈开发
68.7
DSBench-Hard困难全栈
59.6
DeepSWE软件工程
54.4
Toolathlon verified工具调用
70.3

注:柱形条长度按比例缩放,非零起点;最高分 82.7 设为 100% 宽度,其余按比例。分数差距以标注数字为准。

03凭什么反超自家 Pro?后训练 + 长上下文效率

Flash 正式版与 Pro 预览版共享同一基座模型,但后训练方向截然不同。Pro 预览版主打数学、STEM 等推理密集型任务,而 Flash 正式版的后训练重点放在了工具调用、多步任务拆解、代码执行等 Agent 核心能力上。

V4-Pro-Preview (4月)

数学与 STEM 推理领先,Agent 能力处于开源第一梯队,但交付质量仍低于 Claude Opus 4.6 思考模式。

V4-Flash 正式版 (7月)

Agent 能力全面超越 Pro 预览版,在 Terminal Bench、DeepSWE 等场景中分数更高,且价格仅为 Pro 的约 1/10。

更关键的是长上下文效率的优化。在 100 万 token 场景下,Flash 正式版单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%——这意味着长链路任务(如代码库分析、多轮对话)的算力与显存成本大幅降低。

27%单 token 推理计算量 (vs V3.2)
10%KV Cache 占用 (vs V3.2)

数据来源:DeepSeek 官方技术报告,100 万 token 场景下测试。

04价格与效率 Flash 正式版 vs Pro 版

价格是这场“反超”中最具冲击力的部分。Flash 正式版在输入命中缓存时仅 0.2 元/百万 tokens,输出 2 元/百万 tokens;而 Pro 版输入命中缓存为 1 元/百万 tokens,输出 24 元/百万 tokens

一组直观对比:

DeepSeek-V4-Pro 预览版

输入 (命中缓存)1 元/百万 tokens
输入 (未命中)12 元/百万 tokens
输出24 元/百万 tokens

DeepSeek-V4-Flash 正式版

输入 (命中缓存)0.2 元/百万 tokens
输入 (未命中)1 元/百万 tokens
输出2 元/百万 tokens

价格对比:Flash 正式版输出价格仅为 Pro 版的 1/12,且 Agent 能力更强。

05编辑核心判断

编辑核心判断

价格战拼的是入场券,Agent 能力才是决赛圈。Flash 正式版用更低的成本交出更强的干活能力,证明低价不等于低能。对开发者而言,模型评测的焦点正从“参数大小”转向“系统工程与后训练方向”的精准度。

现在就能用

Flash 正式版 API 已上线公测,支持 OpenAI 格式无缝切换。通过 DeepSeek 官方 API 文档即可体验。

DeepSeek API 文档 → 立即体验