K3 拥有 2.8 万亿总参数和 896 个路由专家,但每个 Token 只激活 16 个;注意力结构交替使用 KDA 与 Gated MLA。所有设计共同指向一个目标:扩大模型容量,但让单次计算和长上下文成本受控。
核心参数 总参数 2.8T,路由专家 896,每 Token 激活 16,主隐藏维度 7168,专家隐藏维度 3584
相比同激活比例(激活比例 16/896≈1.8%)的 448选8 方案,K3 拥有更多可组合专家,分工更细。
规模扩张带来的新问题:Router 选择准确性、专家负载不均、跨设备通信激增、长上下文下 KV Cache 与注意力成本上升、低精度训练对异常值敏感。K3 的关键是建立配套控制机制。