🚀 模型·技术 重磅发布

DeepSeek V4 Pro 正式版上线,Terminal Bench 2.1 得分 87.9,超越 Fable 5

8 月 13 日深夜,DeepSeek V4 Pro 正式版悄然上线 API。基于 1.6 万亿参数 MoE 架构,其Terminal Bench 2.1 评测得分 87.9,远超预览版 72.1,整体性能接近甚至超越美国顶级模型 Fable 5 与 Opus 4.8。

综合公开信息整理 2026-08-14 全文约 3 分钟读完
#DeepSeek V4 Pro #MoE #Terminal Bench #模型评测
1.6 万亿 总参数量 · 每次推理仅激活 490 亿
87.9 Terminal Bench 2.1 得分
3 倍 V4 Flash 价格的 3 倍

⚡ 30 秒速览

  • 发了什么:DeepSeek V4 Pro 正式版(deepseek-v4-pro-0813)通过 API 开放,无需修改模型名称即可自动升级。
  • 强在哪:1.6 万亿参数 MoE,每次推理仅激活 490 亿参数;Terminal Bench 2.1 得分 87.9,比预览版提升 15.8 分。
  • 怎么用:支持 100 万 token 上下文、38.4 万 token 输出;提供思考/非思考双模式,完全兼容 JSON、Tool Calls、Responses API、Anthropic API。
  • 价格贵不贵:输入 3 元/百万 tokens,输出 6 元/百万 tokens,缓存命中仅 0.025 元/百万 tokens。
  • 开源态度:权重仍为 MIT 许可证,正式版权重预计后续发布。

01Terminal Bench 2.1:一个硬核评测

Terminal Bench 2.1 是一场针对工程向 AI 智能体的实战测验。它不考"模型知不知道",而是考"能不能在真实终端环境中完成复杂任务"。从代码执行、系统运维到数据处理,全链条可验证。

DeepSeek V4 Pro 正式版得分 87.9,预览版仅为 72.1。提升幅度接近 22%

一个诚实的注脚:

Terminal Bench 2.1 的评测维度极其严格,任务涉及多步工具调用与结果验证。87.9 分意味着模型在绝大多数场景下能够自主完成端到端任务,失分主要来自边缘案例与长链执行中的不稳定性。

🥇 DeepSeek V4 Pro 正式版2026-08-13
87.9
DeepSeek V4 Pro 预览版2026-07
72.1

注:柱形自 65 分起缩放,非零起点;分差以标注分数为准。正式版比预览版高出 15.8 分,提升幅度显著。

021.6 万亿参数,但每次只激活 490 亿

DeepSeek V4 Pro 是一款基于混合专家(MoE)架构的模型。总参数量高达 1.6 万亿,但在实际推理中,每个 token 仅需激活 490 亿参数。这意味着:

传统稠密模型

所有参数一次激活,推理成本与参数规模成正比。模型越大,越贵越慢。

MoE 架构

仅激活部分专家网络,兼顾性能与效率。1.6 万亿参数,推理成本仅相当于 490 亿参数的稠密模型。

此外,V4 Pro 提供100 万 token 上下文窗口与 38.4 万 token 的最大输出长度,远超行业主流水平。配合"思考模式"与"非思考模式"双模式切换,模型可灵活应对不同复杂度的推理任务。

它还会什么?

100 万上下文窗口(token)
38.4 万最大输出长度(token)
2 种交互模式:思考/非思考
4 种API 兼容:JSON / Tool Calls / Responses / Anthropic

注:数据来源于 DeepSeek 官方 API 文档与公开技术报告。

03它能做什么?三个典型场景

💻 代码生成与调试默认思考模式

  • 复杂逻辑实现:从需求描述到完整代码,Agent 自主拆解,多步生成,支持自动修复语法错误。
  • 多文件项目:根据需求生成项目结构,创建多个文件,调用工具链完成编译与测试。
  • Tool Calls 能力:支持自定义函数调用,可集成外部代码库与 API 进行增强开发。
适合场景:快速原型、自动化脚本、API 集成开发。

📄 超长文档处理与结构化输出非思考模式、JSON 输出

  • 100 万 token 上下文:一次处理整本技术手册、法律合同或多篇研究报告。
  • 38.4 万 token 输出:直接生成结构化报告、数据表格或完整代码库,无需分段拼接。
  • JSON 结构化:精确控制输出格式,便于下游系统直接解析使用。
适合场景:文档摘要、数据提取、报告生成。

🤖 Agent 工作流与工具调用Responses API 兼容

  • 多步任务链:自主规划任务步骤,调用外部工具,验证中间结果,最终交付可验证的成果。
  • Anthropic API 兼容:可直接复用已有 Agent 框架,降低迁移成本。
  • 思考模式自动切换:复杂推理自动启用思考模式,简单任务直接响应,兼顾速度与质量。
适合场景:自动化工作流、智能助手、数据处理流水线。

04价格是 V4 Flash 的 3 倍,但缓存极便宜

DeepSeek 此前已预告将大幅上调 API 价格。V4 Pro 正式版定价为 V4 Flash 版本的 3 倍

3 元输入(缓存未命中)/百万 tokens
6 元输出/百万 tokens
0.025 元缓存命中输入/百万 tokens

注:缓存命中时输入价格极低,仅为 0.025 元/百万 tokens,适合高频复用场景。

对于开发者,这是一个按需付费的灵活定价策略:高频调用者可通过缓存大幅降低成本,低频开发者按次计费,无需预付费。

此外,DeepSeek V4 Pro 的权重仍采用 MIT 许可证,正式版权重预计后续发布。这意味着开源社区可以继续使用、修改、商用,无需担心许可证限制。

🔓 开源友好:权重为 MIT 许可证,可自由使用、修改、商用。
无缝升级:现有 API 调用无需修改模型名称,自动切换到最新版本。

05为什么是 DeepSeek 做出来了?

2026 年的模型竞赛,已经不再是单纯的参数比拼。DeepSeek V4 Pro 的发布,回答了三个关键问题:

第一,MoE 架构的工程天花板到底有多高?1.6 万亿参数、每次仅激活 490 亿,实现了性能与成本的兼顾。这不仅是架构创新,更是系统工程能力的体现——让模型在保持强大能力的同时,推理成本可控。

第二,生态兼容性有多重要?V4 Pro 全面兼容 JSON、Tool Calls、Responses API、Anthropic API,让开发者无需学习新框架,即可直接迁移。这不是"跟风",而是降低应用门槛的务实策略

第三,开源与商业化的平衡点在哪?MIT 许可证 + 商业 API 定价——DeepSeek 选择了"开源吸引社区,商业服务开发者"的双轨模式。这既避免了闭源被社区孤立,也保障了可持续的商业模式。

一个诚实的注脚:

Terminal Bench 2.1 的高分,不代表在所有场景下都优于 Fable 5 或 Opus 4.8。评测维度聚焦于命令行任务,在对话、创意写作、多模态理解等维度,V4 Pro 仍需更多数据验证。但 87.9 分已经证明,它在工程向智能体这一细分领域,做到了当前最强。

编辑核心判断

MoE 架构的工程上限,正在从"参数规模竞赛"转向"系统效率与生态兼容性"的综合较量。DeepSeek V4 Pro 证明了:参数可以很大,但激活可以很小,应用可以很容易。

现在就能用

通过 API 调用 deepseek-v4-pro 即可自动使用最新版本,无需修改模型名称。

DeepSeek 平台 → 开始使用