Kimi K3 与 DeepSeek V4 之间,隔着原生多模态的时间差
K3 以 2.8 万亿参数、原生多模态登顶 Frontend Code 榜单,而 DeepSeek V4 用 1/10 参数、纯文本后训练紧追不舍。两种路线背后,是对「视觉何时介入」的截然判断。
K3 以 2.8 万亿参数、原生多模态登顶 Frontend Code 榜单,而 DeepSeek V4 用 1/10 参数、纯文本后训练紧追不舍。两种路线背后,是对「视觉何时介入」的截然判断。
过去一年,Coding 与 Agent 能力不断改写大模型排名,也加速了原生多模态的落地。Kimi K3 和 DeepSeek V4——2026 年 7 月先后发布的这两款国产头部模型,恰好站在路线的两侧。
2.8 万亿参数,100 万 token 上下文,MoE 架构。视觉从预训练阶段就与文本共同塑造主模型,后训练中继续优化,最终参与 Agent 的感知与决策。
2840 亿参数,每 token 激活 130 亿。不加入视觉,不扩张参数规模,把更新集中在后训练。多项 Coding 评测大幅超过预览版,逼近头部模型。
K3 发布后以 1679 分登顶 Arena Frontend Code 榜单——该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。在 Puter 的视觉偏差测试中,K3 对照目标页与运行页截图,5 处偏差全部找出且没有误报。
而 DeepSeek V4-Flash 正式版在不加入视觉的情况下,Arena WebDev 得分一度升至 1577 分,接近 GLM-5.2,前面只剩 K3、Claude Fable 5 和 GPT-5.6 Sol 等少数模型。
注:Arena Frontend Code 与 Arena WebDev 为不同评测榜单,侧重不同,分数不可直接横向对比。此处并列仅展示各自表现。
两种路线都能出成绩。但「长链任务」的复杂度,正在把视觉从加分项变成必选项。
「长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。」一位多模态研究员表示,「视觉是一种更准确的反馈,也更贴近用户意图。」
K3 将这种能力称为 「vision in the loop」:模型写完代码后查看页面,再根据视觉结果继续调整。这背后依赖的是原生多模态——视觉信息与语言主干之间「通信的通道更宽」,而不是先把画面压缩成文字,再交给另一个模型判断。
纯文本模型本身「看不见」。实际系统可以调用 OCR 或独立 VLM,先把图片转换成文字再交给文本模型推理。但在多模态研究员看来,这种模块化方案有边界:外接工具要将画面转成文字,再传递;原生多模态可以直接看懂页面变化,直接决定下一步。
一位研究员回忆第一次让 GPT-5.6 Sol 操作 PC 端 Agent 时的感受:模型不仅自动打开浏览器,还能处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。「如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。」
但这不是一个「要不要」的问题,而是一个「什么时候要」的问题。
「对于 LLM 来说,多模态更像是一个挂件。」一位研究员说,「模型发展的核心不是多模态,而是完成任务的能力。」
一个更现实的问题是:LLM 加入多模态后,甚至可能削弱原有的语言、推理和 Coding 能力。K3 技术报告在一项融合时机的消融实验中记录了这种影响:如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。
注:K3 总参数约为 DeepSeek V4 的 10 倍,每 token 激活参数约为 8 倍。参数规模差异直接反映训练与推理成本差距。
「多模态数据每多一点,文本理解、Coding 或者数学可能就会变差,后面还得继续调比例。考验的是基模团队合版的能力。」一位研究员这样总结。
K3 从零训练了约 4 亿参数的视觉编码器 MoonViT-V2,不再依赖 SigLIP 的初始化权重,并让视觉表示直接进入下一 token 预测目标。技术报告称,这一做法在保持视觉效果的同时提高了训练稳定性。
而 DeepSeek V4 证明:在不加入视觉、也不大幅扩张参数规模的情况下,后训练仍能显著提升 Coding 等核心任务能力。当这条路线还在快速产生回报时,基模公司应该把多少资源提前留给视觉,似乎还没有统一答案。
这不是技术对错之争,而是「两个时钟」的节奏选择。
答案藏在两个时间刻度里。
Coding 与 Agent 的排名,几个月甚至几周就会变化。DeepSeek V4 用后训练快速追赶,证明这条路还有足够回报。而 模型从语言走向世界,需要更漫长的进化周期——视觉数据的清洗、对齐、训练,都不是短期能完成的。
K3 选择在 2026 年 7 月拿出 2.8 万亿参数的原生多模态模型,意味着它的视觉训练周期至少提前了 12-18 个月。阿里 Qwen3.8-Max 也选择了相近的「大而全」方向:2.4 万亿参数、每 token 激活 950 亿,同时承载原生视觉、Coding 和 Cowork 能力。
而 DeepSeek、智谱和腾讯混元的最新通用基座,仍以文本输入为主。智谱与腾讯混元的下一代模型,都可能进一步向原生多模态迈进——但那是下一章的故事。
一位业内人士的观察更直白:「每家公司选择多大的模型、选择什么卖点,最后可能都是那几个人,或者说是老板说了算。」核心成员的研究背景、产品场景和训练成本,都会影响优先级。
K3 发布后,月之暗面公司附近的咖啡馆和餐厅里,多了一些猎头的身影——「多模态」成为了他们前来拜访的关键词。但人才市场的热度,不等于所有公司都会立即跟进超大参数 + 原生多模态的路线。
Coding 是上牌桌的门票。多模态是决定终局的牌。
原生多模态不是技术路线之争,而是时间窗口之争。提前两年布局视觉的公司,将在 2028 年的长链 Agent 竞争中拥有不可逆的工程积累。而此刻选择观望的团队,赌的是后训练和工具链的进步速度,能跑赢视觉数据本身的代际壁垒。
K3 能力已通过 Kimi 产品面向用户开放,支持 100 万 token 上下文与原生多模态输入。
kimi.moonshot.cn → 体验 K3