DeepSeek-V4-Flash 正式版上线:Agent 能力全面超越 Pro 预览版,成本更低性能更强
7月31日,DeepSeek-V4-Flash 正式版 API 公测上线。采用 MoE 架构,总参 284B(激活 13B),支持最长 100万 token 上下文。在 Terminal Bench、DeepSWE、DSBench 等多项 Agent 基准测试中,全面超越 4 月发布的 Pro 预览版,且价格仅为 Pro 的约 1/10。
7月31日,DeepSeek-V4-Flash 正式版 API 公测上线。采用 MoE 架构,总参 284B(激活 13B),支持最长 100万 token 上下文。在 Terminal Bench、DeepSWE、DSBench 等多项 Agent 基准测试中,全面超越 4 月发布的 Pro 预览版,且价格仅为 Pro 的约 1/10。
DeepSeek-V4-Flash 正式版采用 MoE 架构,总参 284B、激活 13B,支持最长 100 万 token 上下文,支持非思考与思考模式切换。模型结构与 3 个月前发布的 Flash 预览版完全一致,仅重新进行了后训练——但正是这一步,让 Agent 能力发生了质变。
一个诚实的注脚:通常后训练只做微调,而 DeepSeek 这次的后训练似乎专门针对 Agent 工具调用、多步任务拆解进行了深度优化。
在官方公布的 9 项 Agent 基准测试中,Flash 正式版分数均远高于 4 月上线的 Pro 预览版(Pro 预览版未公开具体分数,但官方明确表示“远超”)。以下是部分关键分数:
注:柱形条长度按比例缩放,非零起点;最高分 82.7 设为 100% 宽度,其余按比例。分数差距以标注数字为准。
Flash 正式版与 Pro 预览版共享同一基座模型,但后训练方向截然不同。Pro 预览版主打数学、STEM 等推理密集型任务,而 Flash 正式版的后训练重点放在了工具调用、多步任务拆解、代码执行等 Agent 核心能力上。
数学与 STEM 推理领先,Agent 能力处于开源第一梯队,但交付质量仍低于 Claude Opus 4.6 思考模式。
Agent 能力全面超越 Pro 预览版,在 Terminal Bench、DeepSWE 等场景中分数更高,且价格仅为 Pro 的约 1/10。
更关键的是长上下文效率的优化。在 100 万 token 场景下,Flash 正式版单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%——这意味着长链路任务(如代码库分析、多轮对话)的算力与显存成本大幅降低。
数据来源:DeepSeek 官方技术报告,100 万 token 场景下测试。
价格是这场“反超”中最具冲击力的部分。Flash 正式版在输入命中缓存时仅 0.2 元/百万 tokens,输出 2 元/百万 tokens;而 Pro 版输入命中缓存为 1 元/百万 tokens,输出 24 元/百万 tokens。
一组直观对比:
| 输入 (命中缓存) | 1 元/百万 tokens |
| 输入 (未命中) | 12 元/百万 tokens |
| 输出 | 24 元/百万 tokens |
| 输入 (命中缓存) | 0.2 元/百万 tokens |
| 输入 (未命中) | 1 元/百万 tokens |
| 输出 | 2 元/百万 tokens |
价格对比:Flash 正式版输出价格仅为 Pro 版的 1/12,且 Agent 能力更强。
价格战拼的是入场券,Agent 能力才是决赛圈。Flash 正式版用更低的成本交出更强的干活能力,证明低价不等于低能。对开发者而言,模型评测的焦点正从“参数大小”转向“系统工程与后训练方向”的精准度。
Flash 正式版 API 已上线公测,支持 OpenAI 格式无缝切换。通过 DeepSeek 官方 API 文档即可体验。
DeepSeek API 文档 → 立即体验