苏神复盘 Kimi K3:2.8万亿参数、896专家+16激活,LatentMoE与混合注意力如何重构Scaling逻辑?

总参数 · 容量
2.8T
容量: 极高 100%
路由专家 · 分工
896
分工: 极细 88%
每 Token 激活 · 成本
16
成本: 受控 32%
设计目标
  • 容量扩大但单次计算成本不线性增长
新问题
  • Router 选择精度
  • 专家负载不均
  • 跨设备通信激增
  • KV Cache 成本
  • 低精度训练异常值

LatentMoE:压缩专家入口,重组能力分工

传统 MoE 将完整隐藏状态发送给专家,通信成本随隐藏维度和激活专家数增长。LatentMoE 先将状态压缩到更窄的潜在空间(7168→3584),再送入专家,完成后恢复维度。

传统 MoE
完整隐藏状态 → 专家(宽专家,少数量)
LatentMoE
压缩状态 → 窄专家(多数量,细分工)+ 共享专家(通用兜底)
压缩收益
专家计算量、权重读取量、激活尺寸、跨设备传输量同步下降
节省的预算用于扩大专家池:从 448选8 扩展为 896选16,激活比例相同但专家粒度更细。

Stable LatentMoE:数值稳定与专家负载均衡

LatentMoE 计算路径更长,数值波动易被放大。K3 引入 RMSNorm、SiTU-GLU 和 Quantile Balancing,改造成 Stable LatentMoE。

稳定机制 01
RMSNorm
放在专家结果聚合后、升维前,校准专家分支整体尺度,避免不同 Token 因专家组合和 Router 权重差异导致尺度波动扩散。
稳定机制 02
SiTU-GLU
通过 Soft Cap 限制激活增长:小值时保持原行为,危险区平滑饱和,避免直接 Clamp 的硬截断,对 BF16/FP8 低精度训练更安全。
稳定机制 03
Quantile Balancing
直接观察 Router 分数与 Top-K 门槛的分布,估计每个专家的选择门槛应移动多少才能接收目标 Token 数,将负载均衡从经验反馈变为直接分布求解。
「RMSNorm、SiTU-GLU 与 QB 分别控制整体尺度、局部极值和专家流量,共同构成 Stable LatentMoE 的稳定机制。」
—— 苏剑林(Kimi 研究员、RoPE 提出者),K3 架构文章

注意力双轨:KDA 与 Gated MLA 的分工

K3 注意力由 KDA(Kv-Distilled Attention)和 Gated MLA 交替组成,约每 3 层 KDA 插入 1 层 MLA。二者在历史信息保存方式上本质不同。

KDA 持续状态 高频维持
不保存完整历史,将信息持续写入固定大小状态,通过更新/遗忘/覆盖维持,低成本处理长序列但有信息压缩。负责高频维持连续状态。
MLA 全局检索 周期回查
压缩 KV Cache 但保留全局访问能力,当前 Token 可回查具体历史,承担全局检索。周期性访问完整历史,补充固定状态遗漏。
Gate 筛选 结果控制
MLA 输出后增加 Gate:MLA 负责从历史找相关内容,Gate 根据当前输入判断哪些通道值得写回主干,控制检索结果的使用强度。KDA、MLA、Gate 分工明确:维持状态、全局回查、筛选结果。
MLA 视角 压缩 KV Cache 但保留全局访问能力,当前 Token 可回查具体历史,承担全局检索。K3 的 MLA 可移除 RoPE:KDA 按顺序递归更新状态,顺序与距离已部分内嵌于状态演化。
KDA 视角 不保存完整历史,将信息持续写入固定大小状态,通过更新/遗忘/覆盖维持,低成本处理长序列但有信息压缩。所谓“广义 RoPE”强调位置信息可由顺序性状态更新表达。

工程取舍与未解问题

  • NoPE MLA 遗留分支:保留了原本用于 RoPE 的额外 64 维分支,虽理论上可删除,但删除会改变 Query/Key 张量形状,影响 KV Cache 布局、Attention Kernel、通信逻辑和推理框架。对已建成的 2.8T 模型,最小改动原则优先于数学简洁性。
  • Per-Head Muon:K3 继续使用 Muon 优化器,但按不同 Attention Head 分开处理参数,避免大梯度 Head 干扰其他 Head 的更新尺度,让优化方式与结构边界一致。
  • 未完全解决的问题:低维潜在空间可能损失信息,KDA 固定状态仍会遗忘细节,更多专家不必然形成同等数量的清晰能力。模型效率依赖专家通信、低精度训练和专用 Kernel,单独复制架构未必获得相同收益。
「K3 展示了一条明确路线:当模型进入万亿参数和百万上下文阶段,Scaling 的重点已不只是扩大容量,而是建立更有效的参数、记忆与计算调度机制。」
—— 雷峰网,编辑总结