⚡ 模型路线 · 深度解析

Kimi K3 与 DeepSeek V4 之间,隔着原生多模态的时间差

K3 以 2.8 万亿参数、原生多模态登顶 Frontend Code 榜单,而 DeepSeek V4 用 1/10 参数、纯文本后训练紧追不舍。两种路线背后,是对「视觉何时介入」的截然判断。

综合公开信息整理 2026-08-04 全文约 5 分钟读完
#Kimi K3 #DeepSeek V4 #原生多模态 #模型路线 #Agent
🏆 1679 分 K3 登顶 Arena Frontend Code 榜单
2.8 万亿 K3 总参数 · 每 token 激活 1040 亿
2840 亿 DeepSeek V4 总参数 · 约 K3 的 1/10

⚡ 30 秒速览

  • 两条路线:K3 走「大而全」原生多模态,视觉从预训练阶段介入;DeepSeek V4 走纯文本 + 后训练优化,用更小参数追平多数 Coding 任务。
  • 核心差距:原生多模态让模型在长链 Agent 任务中「看得见」,能通过视觉反馈自我修正;纯文本路线依赖外挂工具,通信带宽受限。
  • 代价现实:K3 参数是 V4 的 10 倍,训练与推理成本更高;且多模态与文本能力存在「跷跷板效应」,需要精细调平。
  • 行业分歧:阿里、字节跟进原生多模态;DeepSeek、智谱、腾讯混元仍以文本为主。这不是技术对错之争,而是时机与资源的取舍。
  • 编辑判断:Coding 是上牌桌的门票,多模态是决定终局的牌。两个时钟在同时走动。

01两条路线,一个分歧 视觉该不该从预训练就介入

过去一年,Coding 与 Agent 能力不断改写大模型排名,也加速了原生多模态的落地。Kimi K3DeepSeek V4——2026 年 7 月先后发布的这两款国产头部模型,恰好站在路线的两侧。

K3:原生多模态「大而全」

2.8 万亿参数,100 万 token 上下文,MoE 架构。视觉从预训练阶段就与文本共同塑造主模型,后训练中继续优化,最终参与 Agent 的感知与决策。

DeepSeek V4:纯文本 + 极致后训练

2840 亿参数,每 token 激活 130 亿。不加入视觉,不扩张参数规模,把更新集中在后训练。多项 Coding 评测大幅超过预览版,逼近头部模型。

K3 发布后以 1679 分登顶 Arena Frontend Code 榜单——该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。在 Puter 的视觉偏差测试中,K3 对照目标页与运行页截图,5 处偏差全部找出且没有误报

而 DeepSeek V4-Flash 正式版在不加入视觉的情况下,Arena WebDev 得分一度升至 1577 分,接近 GLM-5.2,前面只剩 K3、Claude Fable 5 和 GPT-5.6 Sol 等少数模型。

注:Arena Frontend Code 与 Arena WebDev 为不同评测榜单,侧重不同,分数不可直接横向对比。此处并列仅展示各自表现。

两种路线都能出成绩。但「长链任务」的复杂度,正在把视觉从加分项变成必选项。

02Agent 为什么需要眼睛?

「长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。」一位多模态研究员表示,「视觉是一种更准确的反馈,也更贴近用户意图。」

K3 将这种能力称为 「vision in the loop」:模型写完代码后查看页面,再根据视觉结果继续调整。这背后依赖的是原生多模态——视觉信息与语言主干之间「通信的通道更宽」,而不是先把画面压缩成文字,再交给另一个模型判断。

生成代码渲染页面截图对比视觉反馈修正代码

纯文本模型本身「看不见」。实际系统可以调用 OCR 或独立 VLM,先把图片转换成文字再交给文本模型推理。但在多模态研究员看来,这种模块化方案有边界:外接工具要将画面转成文字,再传递;原生多模态可以直接看懂页面变化,直接决定下一步

一位研究员回忆第一次让 GPT-5.6 Sol 操作 PC 端 Agent 时的感受:模型不仅自动打开浏览器,还能处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。「如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。」

「很多时候我就喜欢截图输入。可能文本也能做到同样的需求,但是你得花很多上下文去描述视觉关系。」 —— 某头部基模团队研究员

但这不是一个「要不要」的问题,而是一个「什么时候要」的问题。

03模型长出眼睛的代价

「对于 LLM 来说,多模态更像是一个挂件。」一位研究员说,「模型发展的核心不是多模态,而是完成任务的能力。」

一个更现实的问题是:LLM 加入多模态后,甚至可能削弱原有的语言、推理和 Coding 能力。K3 技术报告在一项融合时机的消融实验中记录了这种影响:如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。

2.8 万亿K3 总参数
1040 亿K3 每 token 激活
2840 亿DeepSeek V4 总参数
130 亿DeepSeek V4 每 token 激活

注:K3 总参数约为 DeepSeek V4 的 10 倍,每 token 激活参数约为 8 倍。参数规模差异直接反映训练与推理成本差距。

「多模态数据每多一点,文本理解、Coding 或者数学可能就会变差,后面还得继续调比例。考验的是基模团队合版的能力。」一位研究员这样总结。

K3 从零训练了约 4 亿参数的视觉编码器 MoonViT-V2,不再依赖 SigLIP 的初始化权重,并让视觉表示直接进入下一 token 预测目标。技术报告称,这一做法在保持视觉效果的同时提高了训练稳定性。

而 DeepSeek V4 证明:在不加入视觉、也不大幅扩张参数规模的情况下,后训练仍能显著提升 Coding 等核心任务能力。当这条路线还在快速产生回报时,基模公司应该把多少资源提前留给视觉,似乎还没有统一答案。

这不是技术对错之争,而是「两个时钟」的节奏选择。

04看得见 vs 看不见:三个任务场景

🖥️ 网页开发:视觉偏差检测 K3 满分通过

  • Puter 在测试网页中制造 5 处视觉偏差,K3 对照目标页与运行页截图,全部找出且没有误报。
  • 纯文本模型需借助外部工具描述截图,再对比代码逻辑,效率与准确率均受限于中间环节。
  • K3 的「vision in the loop」可反复迭代:写代码 → 看页面 → 修正 → 再看,形成闭环。
关键差异:原生多模态让模型「自己看见自己做的结果」,而非等别人转述。

📊 长链 Agent:多步工具操作 K3 视觉反馈闭环

  • Agent 需要打开浏览器、登录平台、执行代码、检查结果——每一步都可能出错。
  • 纯文本模型每一步都依赖外部工具将界面状态转成文字,误差随链长累积
  • 原生多模态模型可直接读取屏幕截图,理解布局变化,用视觉信号替代文本描述
一位研究员评价:「如果系统调得足够好,外挂视觉也能解决大量任务。但通信带宽的差距,在长链任务中会持续放大。」

📄 日常办公:PPT 制作与图片理解 用户高频需求

  • 「一般人可能感觉不到,但对于开发者群体而言,有多模态还是很方便。」——但需求不只属于开发者。
  • 非 AI 从业者使用模型最多的场景之一就是制作 PPT,视觉输入是刚需
  • 智谱首席科学家唐杰在 X 平台征集「下一版 GLM 必须加入的功能」,评论区反复出现的答案就是「视觉」
用户期待正在从「能聊天」转向「能看见、能操作、能交付」。

05为什么是现在?为什么是 K3?

答案藏在两个时间刻度里。

Coding 与 Agent 的排名,几个月甚至几周就会变化。DeepSeek V4 用后训练快速追赶,证明这条路还有足够回报。而 模型从语言走向世界,需要更漫长的进化周期——视觉数据的清洗、对齐、训练,都不是短期能完成的。

K3 选择在 2026 年 7 月拿出 2.8 万亿参数的原生多模态模型,意味着它的视觉训练周期至少提前了 12-18 个月。阿里 Qwen3.8-Max 也选择了相近的「大而全」方向:2.4 万亿参数、每 token 激活 950 亿,同时承载原生视觉、Coding 和 Cowork 能力。

而 DeepSeek、智谱和腾讯混元的最新通用基座,仍以文本输入为主。智谱与腾讯混元的下一代模型,都可能进一步向原生多模态迈进——但那是下一章的故事。

「多模态肯定不是决定性的,但它很重要。基础的图片、视频答题已经做得比较饱和了。下一步应该把多模态放进贴近生产的实际场景和复杂任务中。」 —— 某模型研究员

一位业内人士的观察更直白:「每家公司选择多大的模型、选择什么卖点,最后可能都是那几个人,或者说是老板说了算。」核心成员的研究背景、产品场景和训练成本,都会影响优先级。

K3 发布后,月之暗面公司附近的咖啡馆和餐厅里,多了一些猎头的身影——「多模态」成为了他们前来拜访的关键词。但人才市场的热度,不等于所有公司都会立即跟进超大参数 + 原生多模态的路线。

Coding 是上牌桌的门票。多模态是决定终局的牌。

编辑核心判断

原生多模态不是技术路线之争,而是时间窗口之争。提前两年布局视觉的公司,将在 2028 年的长链 Agent 竞争中拥有不可逆的工程积累。而此刻选择观望的团队,赌的是后训练和工具链的进步速度,能跑赢视觉数据本身的代际壁垒。

现在就能体验

K3 能力已通过 Kimi 产品面向用户开放,支持 100 万 token 上下文与原生多模态输入。

kimi.moonshot.cn → 体验 K3