DeepSeek V4 Pro 正式版上线,Terminal Bench 2.1 得分 87.9,超越 Fable 5
8 月 13 日深夜,DeepSeek V4 Pro 正式版悄然上线 API。基于 1.6 万亿参数 MoE 架构,其Terminal Bench 2.1 评测得分 87.9,远超预览版 72.1,整体性能接近甚至超越美国顶级模型 Fable 5 与 Opus 4.8。
8 月 13 日深夜,DeepSeek V4 Pro 正式版悄然上线 API。基于 1.6 万亿参数 MoE 架构,其Terminal Bench 2.1 评测得分 87.9,远超预览版 72.1,整体性能接近甚至超越美国顶级模型 Fable 5 与 Opus 4.8。
Terminal Bench 2.1 是一场针对工程向 AI 智能体的实战测验。它不考"模型知不知道",而是考"能不能在真实终端环境中完成复杂任务"。从代码执行、系统运维到数据处理,全链条可验证。
DeepSeek V4 Pro 正式版得分 87.9,预览版仅为 72.1。提升幅度接近 22%。
一个诚实的注脚:
Terminal Bench 2.1 的评测维度极其严格,任务涉及多步工具调用与结果验证。87.9 分意味着模型在绝大多数场景下能够自主完成端到端任务,失分主要来自边缘案例与长链执行中的不稳定性。
注:柱形自 65 分起缩放,非零起点;分差以标注分数为准。正式版比预览版高出 15.8 分,提升幅度显著。
DeepSeek V4 Pro 是一款基于混合专家(MoE)架构的模型。总参数量高达 1.6 万亿,但在实际推理中,每个 token 仅需激活 490 亿参数。这意味着:
所有参数一次激活,推理成本与参数规模成正比。模型越大,越贵越慢。
仅激活部分专家网络,兼顾性能与效率。1.6 万亿参数,推理成本仅相当于 490 亿参数的稠密模型。
此外,V4 Pro 提供100 万 token 上下文窗口与 38.4 万 token 的最大输出长度,远超行业主流水平。配合"思考模式"与"非思考模式"双模式切换,模型可灵活应对不同复杂度的推理任务。
它还会什么?
注:数据来源于 DeepSeek 官方 API 文档与公开技术报告。
DeepSeek 此前已预告将大幅上调 API 价格。V4 Pro 正式版定价为 V4 Flash 版本的 3 倍:
注:缓存命中时输入价格极低,仅为 0.025 元/百万 tokens,适合高频复用场景。
对于开发者,这是一个按需付费的灵活定价策略:高频调用者可通过缓存大幅降低成本,低频开发者按次计费,无需预付费。
此外,DeepSeek V4 Pro 的权重仍采用 MIT 许可证,正式版权重预计后续发布。这意味着开源社区可以继续使用、修改、商用,无需担心许可证限制。
2026 年的模型竞赛,已经不再是单纯的参数比拼。DeepSeek V4 Pro 的发布,回答了三个关键问题:
第一,MoE 架构的工程天花板到底有多高?1.6 万亿参数、每次仅激活 490 亿,实现了性能与成本的兼顾。这不仅是架构创新,更是系统工程能力的体现——让模型在保持强大能力的同时,推理成本可控。
第二,生态兼容性有多重要?V4 Pro 全面兼容 JSON、Tool Calls、Responses API、Anthropic API,让开发者无需学习新框架,即可直接迁移。这不是"跟风",而是降低应用门槛的务实策略。
第三,开源与商业化的平衡点在哪?MIT 许可证 + 商业 API 定价——DeepSeek 选择了"开源吸引社区,商业服务开发者"的双轨模式。这既避免了闭源被社区孤立,也保障了可持续的商业模式。
一个诚实的注脚:
Terminal Bench 2.1 的高分,不代表在所有场景下都优于 Fable 5 或 Opus 4.8。评测维度聚焦于命令行任务,在对话、创意写作、多模态理解等维度,V4 Pro 仍需更多数据验证。但 87.9 分已经证明,它在工程向智能体这一细分领域,做到了当前最强。
MoE 架构的工程上限,正在从"参数规模竞赛"转向"系统效率与生态兼容性"的综合较量。DeepSeek V4 Pro 证明了:参数可以很大,但激活可以很小,应用可以很容易。
通过 API 调用 deepseek-v4-pro 即可自动使用最新版本,无需修改模型名称。
DeepSeek 平台 → 开始使用