🔬 模型 · 技术报告

Kimi K3 发布 47 页技术报告,重构大模型长程执行架构

月之暗面发布 Kimi K3 技术报告,以 2.8T 参数与 100 万上下文为基础,重点解决 Agent 连续工作数小时后的状态保存与资源调度难题。报告显示,在多项长程 Kernel 优化任务中,其表现超越 GPT-5.6 与 Claude Opus 4.8。

来源:官方发布 全文约 3 分钟读完
#KimiK3 #大模型架构 #AI Agent #长程任务
2.8T 总参数 · 104B 激活参数
100 上下文窗口 · 渐进式训练
2.5x 整体扩展效率 · 相比 Kimi K2

⚡ 30 秒速览

  • 解决什么:当模型变大、上下文变长,Agent 连续工作数小时后,传统 Transformer 架构与训练系统难以支撑。
  • 架构三招:KDA 压缩序列状态,AttnRes 跨层调用深度信息,Stable LatentMoE 压缩专家通信。
  • 训练系统:Partial rollout 异步强化学习 + Firecracker microVM 保存执行现场,训练期创建超 5100 万个沙盒。
  • 实测表现:在 KDA-GPGPU Kernel 优化任务中,持续工作 20 小时,加速幅度达 73.6%,超越 GPT-5.6 Sol 与 Claude 系列。
  • 诚实提示:2.5 倍扩展效率为综合作用结果,报告未提供逐项消融;评测混合了不同 Agent Harness,非裸模型对比。

01长程任务实测 持续工作 20 小时的工程能力

Kimi K3 在多项长程 Kernel 优化任务中,展现了持续执行、保留进度并不断刷新最好成绩的能力,而非一次性代码生成。以下为 KDA-GPGPU Kernel 优化任务加速对比(相对 FLA Triton 基线):

Kimi K3月之暗面
73.6
GPT-5.6 SolOpenAI
66.7
Claude Opus 4.8Anthropic
57.0
Claude Fable 5Anthropic
56.5

注:为便于直观对比,柱形自 50% 起缩放,非零起点;分差以标注分数为准。在 MLA Kernel 任务中,Kimi K3 达到 518 TFLOPS,亦高于 Claude Fable 5 的 493 TFLOPS。

02架构重构 处理序列、深度与宽度的信息流

Kimi K3 的核心思路,是把原本随规模膨胀的计算和状态,改造成可压缩、可调度、可暂停恢复的结构。三项架构变化分别处理 Transformer 在三个维度的扩展瓶颈:

序列 · KDA

3层 KDA + 1层 Gated MLA。固定大小递归状态,解决长上下文 KV Cache 膨胀。衰减参数设下界,适配 Tensor Core 稠密矩阵乘法。

深度 · AttnRes

12 层一个 Block 聚合,允许当前层加权选择前面不同深度的表示。解决深层网络早期信息混合问题。

宽度 · LatentMoE

7168维压缩到3584维,896个专家选16个。RMSNorm + SiTU-GLU 限幅防溢出,Quantile Balancing 直接计算路由偏置。

03Agent 训练闭环 状态保存与持续纠错

架构决定模型能容纳多少信息,但要让 Agent 连续工作数小时,真正困难的部分发生在强化学习系统里。Kimi K3 形成了一个完整闭环:

保存任务状态异步执行观察真实结果反馈调整
🔄

Partial Rollout 异步强化学习

未完成轨迹暂停恢复,逐 token 正则限制策略变化,解决长任务阻塞整批训练问题。接受长程训练必然存在的异步与延迟。

📦

AgentENV 可恢复执行环境

基于 Firecracker microVM,支持暂停、恢复、快照。训练期创建超 5100 万 sandbox,避免等待推理时持续占用 CPU/内存。

👁️

MoonViT-V2 原生视觉反馈

从零训练视觉编码器,作为 Agent 的反馈通道。模型可看到代码渲染截图,发现偏差并继续修正,而非仅靠文本猜测结果。

04编辑视角

诚实提示与独立判断

2.5 倍扩展效率来自架构、数据、优化器等共同作用,报告未公开逐项消融与总训练 FLOPs;评测成绩混合了 Kimi Code、Claude Code 等不同 Agent Harness,更接近"模型+工具系统"的综合表现,而非裸模型对比。读者宜将其视为系统级工程能力的展示,而非单一参数的胜利。

当模型能力进入长程 Agent 阶段,决定能力上限的不再只是参数规模,而是系统级的上下文管理、状态保存与持续纠错能力。

现在就能看

完整技术报告与开放权重详情,可访问官方博客获取。

kimi.com/blog/kimi-k3 → 查看报告