倒反天罡:DeepSeek-V4-Flash 正式版上线,Agent 能力全面超越 Pro 预览版
7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测,以 284B 总参 / 13B 激活 的轻量级 MoE 架构,在 Agent 基准测试中全面超越自家 4 月上线的 Pro 预览版——更便宜的型号反而更强,「倒反天罡」成为现实。
7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测,以 284B 总参 / 13B 激活 的轻量级 MoE 架构,在 Agent 基准测试中全面超越自家 4 月上线的 Pro 预览版——更便宜的型号反而更强,「倒反天罡」成为现实。
DeepSeek-V4-Flash 正式版采用 MoE 混合专家架构,总参数量 284B,激活参数仅 13B,与 4 月发布的 Flash 预览版结构尺寸一致,但通过重新后训练实现了 Agent 能力的显著跃升。支持 100 万 token 超长上下文,并可在非思考与思考模式间自由切换。
此外,Flash 正式版已原生适配 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品,并支持 OpenAI Responses API 格式——开发者无需修改 Base URL 即可在不同模型间切换,迁移成本极低。
DeepSeek 官方公布的 Flash 正式版基准测试成绩,覆盖代码生成、终端操作、全栈开发、安全工程等核心 Agent 场景。以下为完整得分:
注:以上为 DeepSeek-V4-Flash 正式版在各项基准中的得分。官方表示其 Agent 能力已全面超越 4 月上线的 DeepSeek-V4-Pro-Preview,后者在 Agentic Coding 评测中已进入开源第一梯队,交付质量接近 Claude Opus 4.6 非思考模式。
最令人意外的不是性能,而是定价。Flash 正式版在输入命中缓存场景下,价格仅为 Pro 预览版的 1/5;即使未命中缓存,也仅为 Pro 的 1/12。输出价格差距更为悬殊。
输入(命中缓存)
输入(未命中缓存)
输出
输入(命中缓存)
输入(未命中缓存)
输出
注:价格对比基于 DeepSeek API 官方定价。Flash 正式版在多项 Agent 基准中超越 Pro 预览版,同时价格大幅降低,性价比优势显著。
除了 Agent 能力的飞跃,Flash 正式版在长上下文场景下的效率优化同样值得关注。对于需要处理超长文档、复杂代码库或多轮交互的 Agent 任务,算力与显存成本是实际落地中的关键瓶颈。
答案并不复杂:后训练的价值正在被重新定义。Flash 正式版与预览版在架构、尺寸上完全一致,唯一的变量是「重新进行了后训练」。这意味着 DeepSeek 团队在数据配比、奖励建模、强化学习链路上找到了更优解。
一个诚实的注脚:
Pro 预览版发布于 4 月,当时其在数学、STEM 及竞赛型代码等高难度任务中已比肩 GPT-5.4 与 Claude Opus 4.6-Max。但 Agent 能力不是静态的——它依赖模型与工程框架的协同进化。Flash 正式版的全面反超,说明 DeepSeek 在后训练阶段将「工具使用」与「任务拆解」的能力权重提到了前所未有的高度。
这对行业意味着什么?
价格战是入场券,Agent 能力才是决赛圈。低价不等于低能——当最便宜的型号反而交出最强的 Agent 成绩单,模型竞争的底层逻辑已经从「参数军备竞赛」转向「系统工程效率的比拼」。
DeepSeek-V4-Flash 正式版 API 已上线公测,开发者可通过 DeepSeek API 直接调用,体验更强的 Agent 能力与更低的使用成本。
api.deepseek.com → 立即体验