Kimi K3 发布 47 页技术报告,重构大模型长程执行架构
月之暗面发布 Kimi K3 技术报告,以 2.8T 参数与 100 万上下文为基础,重点解决 Agent 连续工作数小时后的状态保存与资源调度难题。报告显示,在多项长程 Kernel 优化任务中,其表现超越 GPT-5.6 与 Claude Opus 4.8。
月之暗面发布 Kimi K3 技术报告,以 2.8T 参数与 100 万上下文为基础,重点解决 Agent 连续工作数小时后的状态保存与资源调度难题。报告显示,在多项长程 Kernel 优化任务中,其表现超越 GPT-5.6 与 Claude Opus 4.8。
Kimi K3 在多项长程 Kernel 优化任务中,展现了持续执行、保留进度并不断刷新最好成绩的能力,而非一次性代码生成。以下为 KDA-GPGPU Kernel 优化任务加速对比(相对 FLA Triton 基线):
注:为便于直观对比,柱形自 50% 起缩放,非零起点;分差以标注分数为准。在 MLA Kernel 任务中,Kimi K3 达到 518 TFLOPS,亦高于 Claude Fable 5 的 493 TFLOPS。
Kimi K3 的核心思路,是把原本随规模膨胀的计算和状态,改造成可压缩、可调度、可暂停恢复的结构。三项架构变化分别处理 Transformer 在三个维度的扩展瓶颈:
3层 KDA + 1层 Gated MLA。固定大小递归状态,解决长上下文 KV Cache 膨胀。衰减参数设下界,适配 Tensor Core 稠密矩阵乘法。
按 12 层一个 Block 聚合,允许当前层加权选择前面不同深度的表示。解决深层网络早期信息混合问题。
7168维压缩到3584维,896个专家选16个。RMSNorm + SiTU-GLU 限幅防溢出,Quantile Balancing 直接计算路由偏置。
架构决定模型能容纳多少信息,但要让 Agent 连续工作数小时,真正困难的部分发生在强化学习系统里。Kimi K3 形成了一个完整闭环:
未完成轨迹暂停恢复,逐 token 正则限制策略变化,解决长任务阻塞整批训练问题。接受长程训练必然存在的异步与延迟。
基于 Firecracker microVM,支持暂停、恢复、快照。训练期创建超 5100 万 sandbox,避免等待推理时持续占用 CPU/内存。
从零训练视觉编码器,作为 Agent 的反馈通道。模型可看到代码渲染截图,发现偏差并继续修正,而非仅靠文本猜测结果。
2.5 倍扩展效率来自架构、数据、优化器等共同作用,报告未公开逐项消融与总训练 FLOPs;评测成绩混合了 Kimi Code、Claude Code 等不同 Agent Harness,更接近"模型+工具系统"的综合表现,而非裸模型对比。读者宜将其视为系统级工程能力的展示,而非单一参数的胜利。
完整技术报告与开放权重详情,可访问官方博客获取。
kimi.com/blog/kimi-k3 → 查看报告