DeepSeek V4 Pro 正式版上线,Agent 能力逼近 Fable 5
8 月 12 日晚,DeepSeek 发布 V4 Pro 正式版 API,Agent 能力大幅增强,部分性能逼近甚至超越 Claude Fable 5。百万 Token 上下文、思考与非思考双模式、全线工具调用能力均已开放,定价为输入 3 元 / 百万 Token。
8 月 12 日晚,DeepSeek 发布 V4 Pro 正式版 API,Agent 能力大幅增强,部分性能逼近甚至超越 Claude Fable 5。百万 Token 上下文、思考与非思考双模式、全线工具调用能力均已开放,定价为输入 3 元 / 百万 Token。
8 月 12 日晚,DeepSeek 官方 API 后台悄然更新,模型节点从此前版本切换至 DeepSeek-V4-Pro-0813。目前官方尚未发布单独的版本公告,但开发者已可直接调用新版本。
这并非一次突然的行动。在先前 V4 Flash 正式版发布时,DeepSeek 便明确表示,V4 Pro 正式版将在后续推出。如今,这支"预定"的升级如约而至。
一次安静的升级,背后是Agent能力的显著跃升。
注:所有数字来自官方 API 文档。缓存命中输入价格仅为 0.025 元/百万 Token,意味着重复工作场景下成本极低。
V4 Pro 最核心的升级在于 Agent 能力。根据官方披露的评测数据,新版本在多项 Agent 任务中表现接近甚至超越 Claude Fable 5——这是 Anthropic 当前最强的 Agent 模型。
具体来看,支撑这一判断的评测覆盖了多个维度:
代码生成、调试、重构等任务,完成率接近 Fable 5,部分场景中 生成的代码可直接运行,无需人工修正。
工具调用、多步任务链、条件分支等场景,任务完成率较前代提升约 30%,接近行业顶尖水平。
百万 Token 窗口内,信息检索与综合能力稳定,长文档分析精度不衰减,优于多数竞品。
科研综述、数据分析、报告生成等场景,输出质量与人类专家趋近,在 PaperBench 中取得较高分数。
注:评测数据来自官方公开信息,覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向。与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比,各项结果互有高低。
DeepSeek V4 Pro 的发布,意味着 Agent 能力的竞争已经从"能不能做"进入"做得多好"的阶段。
对比来看,V4 Pro 的定价策略尤其值得关注:输入 3 元 / 百万 Token,输出 6 元 / 百万 Token,缓存命中输入仅 0.025 元 / 百万 Token。相比之下,Claude Fable 5 的定价约为 15 美元 / 百万 Token——差距悬殊。
一个诚实的注脚:
V4 Pro 并非在所有维度上超越 Fable 5。官方评测显示,在部分需要深度推理的复杂任务中,Fable 5 仍有一定优势。但 V4 Pro 在 Agent 任务链的完整性和工具调用的灵活性上,展现了更强的工程能力。
V4 Pro 的发布并非孤立事件。8 月 12 日同一天,多个 AI 模型相关动态值得关注:
注:柱形示意各模型在 Agent 能力维度的相对表现,非绝对分数。Qwen3.8 为阿里最新开源旗舰模型,参数规模 2.4T,激活 95B。腾讯混元 Hy4 计划近期发布,具体参数未对外公布。
值得注意的是,三星电子在半导体研发中引入 Claude 模型,将原本耗时一个月的 SoC 设计验证缩短至两天——效率提升约 15 倍。这一案例表明,Agent 能力正在从"实验室能力"加速走向"工业级应用"。
DeepSeek 的路径选择始终清晰:在 Agent 能力上持续投入,而非一味追求参数规模。
从架构逻辑看,V4 Pro 的 Agent 能力提升来自三个层面:
百万 Token 窗口让模型可以处理更长、更复杂的任务链;工具调用框架让 Agent 能够自主调用外部 API 和工具;思考与非思考双模式覆盖了从快速响应到深度推理的全场景。
但更值得关注的是定价策略。V4 Pro 的定价约为 Fable 5 的 1/5,缓存命中场景成本更低——这意味着,Agent 能力的规模化部署门槛正在快速降低。
Agent 能力正在从"能不能做到"进入"性价比是否可行"的阶段。V4 Pro 证明了,在 Agent 领域,定价策略与工程优化同样重要——低成本、高完成率的模型,可能比一味追求顶尖性能的模型,拥有更广阔的落地空间。
V4 Pro 正式版已通过 API 开放,开发者可直接调用 DeepSeek-V4-Pro-0813 节点。
deepseek.com → 开发者控制台