模型实测 · 旗舰对照

实测:两款旗舰模型在编程与视觉任务中分出高下|DeepSeek-V4-Pro 对 Kimi K3

DeepSeek-V4-Pro正式版没有全面追上Kimi K3,但也没有被拉开明显差距:叙事与明确指令修改更快,视觉理解、截图还原和物理仿真则明显落后。

实测报道重制 4 类任务 单次生成结果,仅供参考
#DeepSeek-V4-Pro #Kimi K3 #AI编程 #Agent
1M 上下文窗口,可容纳更大的代码库与文档
384K 最大输出空间,面向连续编程与复杂任务
4 类 内容创作、编程、视觉审美、物理仿真

注:Hero 只呈现产品规格与测试范围;模型优劣由后文的对照任务与限制条件展开。

⚡ 30 秒速览

  • 发生了什么:DeepSeek-V4-Pro正式版经历 API 静默上线、公告撤回后,于 8 月 13 日晚同步登陆 App、网页端与 API。
  • 谁更强:没有总赢家。DeepSeek 更会把故事讲顺、修改明确需求更快;Kimi K3 更擅长视觉还原、审美完成度与物理因果。
  • 怎么测的:四类任务使用同一套提示词,但调用环境不同,且每项只有一次生成,结果不能等同于严格排行榜。
  • 价格变化:8 月 17 日起采用峰谷定价,DeepSeek-V4-Pro 缓存未命中输入与输出的高峰价格为 9 元、27 元
  • 更大的问题:DeepSeek正在从单一模型扩展到 Harness 与 Agent 基础设施,下一关是能否把开发者能力变成稳定的真实工作流。

01正式版如何落地?一次不算平滑的发布

这次更新并不是一场从公告到产品同步完成的标准发布。模型先出现在 API 侧,随后公告短暂撤回,直到当日晚间才确认三个入口同步开放。对用户来说,真正重要的不是发布过程的曲折,而是产品方向已经非常清楚:继续押注长任务、工具调用与 Agent 执行。

先看它是怎么到用户手里的。

API 端静默出现新版本

官方 API 定价页面更新,出现 DeepSeek-V4-Pro-0813,对应正式版先在 API 侧上线。

公告撤回,模型仍留在页面

官网发布通知与开放平台公告被撤回,但模型继续显示在模型与价格页面中。

正式确认三端同步

重新发布公告,确认正式版已登陆 App、网页端与 API,并新增 low、high、max 三档思考强度。

API 切换峰谷定价

9:00—12:00、14:00—18:00为高峰,其余时间为空闲时段,空闲价格为高峰的一半。

注:时间线只还原报道中明确出现的事件节点,不推断公告撤回背后的原因。

规格层面,正式版延续大上下文和大输出空间,并支持非思考、思考两种模式,思考模式默认开启;同时原生支持 Responses API。它瞄准的并不是单轮问答,而是需要持续读取、调用工具、反复修改并交付结果的任务链。

02为什么不能只看一个总分?跑分与实测指向不同

DeepSeek-V4-Pro与Kimi K3的能力区间高度重合,都把 Coding、Agent 和复杂任务执行放在核心位置。对照结果没有出现“一方把另一方完全甩开”的情况,而是呈现出比较明确的能力分工。

能力维度
DeepSeek
Kimi K3
实测读法
长程软件工程
相对占优
连续任务与还原准确度更稳
自动化与安全
相对占优
部分高难任务更有优势
视觉理解与审美
偏弱
明显占优
截图、3D画面、素材组织
明确需求的修改
更快
更慢
改桥洞任务约 5 分钟对约 10 分钟

注:原始报道没有列出各基准项目的具体分值,因此这里不画比例柱形,只呈现明确写出的相对优势;“相对占优”不等于全面领先。

同一套 提示词与任务要求保持一致
4 类 从文字表达延伸到 3D 物理场景
单次 每个任务只观察一次生成结果

还有一个必须保留的变量:DeepSeek-V4-Pro当时通过编程工具环境调用,Kimi K3则在自己的工作台中调用。网页生成、文件操作和代码运行的最终效果,除了模型本身,也可能被工具链和运行环境放大或削弱。

03它们到底会做什么?四组任务,四种差异

真正的差别,不在“能不能生成”,而在于模型能否理解任务背后的结构,并把结果推进到可使用的状态。

✍️ 内容创作:DeepSeek 更会讲故事,Kimi 更会做报告 各赢一题

  • 在 AI 漫剧续写任务中,两款模型都有明显“AI味”,且对人物设定的理解并不完整。
  • DeepSeek生成的故事线更顺,能够延续现实主义冲突;但人物细节仍与原剧设定存在偏差。
  • Kimi K3在故事正文里混入“第一季里……”之类的背景说明,把给模型看的资料写进了叙事,导致观感出戏。
  • 行业报告任务中,DeepSeek框架清楚但展开偏少;Kimi K3整理了市场规模、采用率、份额、定价等信息,并用表格增强比较。
编辑观察:DeepSeek擅长保持叙事连续性,Kimi K3更擅长资料搜集、结构化与信息铺陈。

💻 编程:DeepSeek 修改快,Kimi 还原准 差异集中在复杂需求

  • 在“电影选片器”任务中,两款模型都完成了至少 24 部电影、类型筛选、评分筛选和随机抽选等核心功能。
  • DeepSeek生成的页面出现胶片图标与文字重叠的小问题;Kimi K3整体功能与视觉结构接近。
  • 在艺术博物馆截图还原任务中,DeepSeek只抓住了色调,最终做成了品牌官网;Kimi K3保留了原图结构,并用几何图形替代缺失的实景素材。
  • 威尼斯运河游戏中,DeepSeek约 5 分钟完成交错桥洞修改;Kimi K3约 10 分钟完成同类修改,但视觉、倒影、衣物状态和音效更完整。
编辑观察:两款模型都能把前端功能跑起来,但Kimi K3更像在还原设计,DeepSeek更像在快速响应明确指令。

🌌 视觉审美:DeepSeek 先卡壳,Kimi 一次“出片” Kimi 完成度更高

  • 任务要求用 Three.js 制作“水母湖”:金色水母、光束、丛林倒影、鱼群,以及近景和远景层次都要出现。
  • DeepSeek首次运行约半小时后页面空白,第一次修改出现渲染错误,第二次调整后才显示,但仍留下错误提醒。
  • DeepSeek做出了大量金色光点,却把真正的水母处理成灰色椭圆,整体偏暗,缺少“金色星河”和水面光照层次。
  • Kimi K3约 40 分钟一次交付可运行成品,金色水母群、鱼群、水面和光束都得到呈现;不足是水下植物基本缺失。
编辑观察:这不是单纯的美术风格差异,而是视觉描述能否被准确翻译成物体、层次和光照关系。

🧨 物理仿真:Kimi 跑通逻辑,DeepSeek 卡在穿模 因果链分胜负

  • “鞭炮箱子”要求 100 个鞭炮完成落入、点燃、爆炸、弹射和连锁引燃,同时处理碰撞、碎片与烟雾。
  • Kimi K3约 10 分钟完成:鞭炮落入透明箱后没有明显穿模,外部点火、局部引爆两种模式也有清楚区分。
  • DeepSeek前后接近 40 分钟,首先出现鞭炮穿过箱体的碰撞问题;随后箱内物体无明显火源便开始爆炸,过程还伴随卡顿。
  • DeepSeek的“单个引爆”按钮存在,但与普通燃放没有形成真正不同的交互逻辑。
编辑观察:当任务要求“每一步都必须由上一步导致”时,视觉上像爆炸并不够,底层物理约束才是验收标准。

04为什么能力会这样分化?模型之外,还有一套工作系统

这组实测反复说明,模型能力不是一个孤立分数。长上下文、工具调用、代码运行、存储和反复修改,最终会组合成一条任务链;其中任何一环不稳,用户看到的就不是“模型答错”,而是整个任务没有交付。

模型只是起点,Agent 系统决定它怎么干活。

01
模型底座理解指令、生成代码与文本
02
长上下文与大输出承载更长代码、文档和连续步骤
03
工具调用与运行环境执行代码、处理文件、访问实时信息
04
存储与任务状态保留中间结果,支持反复修改
05
Agent 工作流把模型能力变成可重复的任务执行

注:阶梯表示从模型到工作流的依赖关系,不代表官方公布的唯一技术架构。

DeepSeek在正式版之外,还开放了 Harness 开发者预览版,并以 MIT 协议开源。它允许模型、工具、存储等能力通过插件组合,解决的是“模型如何持续完成任务”的问题。与此同时,团队公开招聘范围从算法研发扩展到产品、数据工程、运维和通用 Agent 数据产品,说明产品正在从单模型向基础设施延伸。

但这条路也会让系统变“重”:更长的任务意味着更多算力消耗,更复杂的工具链意味着更高的稳定性要求。模型能生成一次漂亮演示,和它能在真实工作流里稳定运行,是两件事。

05价格变了,性价比该怎么算?低价标签正在重新定价

DeepSeek过去最鲜明的竞争方式,是用相对低的价格提供足够强的能力。正式版上线后,API采用峰谷定价,开发者可以通过错峰调用控制成本,但“绝对低价”不再像过去那样简单。

此前价格

3 / 6 元 缓存未命中输入 / 输出

空闲时段

4.5 / 13.5 元 高峰之外,价格约为高峰一半

高峰时段

9 / 27 元 9:00—12:00、14:00—18:00

注:单位为元,顺序为缓存未命中输入 / 输出;以上为报道给出的 DeepSeek-V4-Pro 示例价格,实际调用需以当时定价页面为准。

1

涨价后还值不值?模型规模扩大、Agent任务变长都会推高成本。它需要靠更高的任务完成率、更少的失败重试和更高的调用效率,证明自己仍然“够用且划算”。

2

能不能进入真实工作流?目前 Harness 仍主要面向开发者。更关键的下一步,是把开放框架转化为普通用户和企业可以直接使用的 Agent 产品。

编辑核心判断

DeepSeek-V4-Pro的真实位置,不是“追上”或“没追上”的二元答案:它在叙事与明确指令修改上已经具备旗舰可用性,但在视觉理解、渲染稳定性和物理因果上仍不稳;峰谷定价也削弱了它的绝对低价标签。行业竞争的分水岭,正在从单次跑分转向模型能否以可控成本稳定完成跨工具、跨步骤的真实工作流。

现在怎么体验?

按报道所述,DeepSeek-V4-Pro正式版已同步登陆官方 App、网页端与 API。普通用户可在 App 或网页端选择对应模型;开发者接入 API 前,应先确认思考强度、峰谷时段与最新价格。

官方 App / 网页端 / API → 选择 DeepSeek-V4-Pro