🧠 架构 · 深度解析
从GPT-2到Kimi K3:七年规模扩大22,580倍,大模型架构主线是在建立一套"记忆操作系统"
从"记住一切"到"选择性记忆",七年间大模型架构经历了一场静默的革命。KV Cache 解决了生成效率,线性注意力探索了高效长期记忆,DeltaNet 和 Kimi Linear 则让模型学会更新、遗忘和管理信息。核心主线,是建立一套越来越精密的"记忆操作系统"。
综合公开信息整理•
2026-07-22•
全文约 4 分钟读完
#Kimi K3
#架构演进
#记忆操作系统
#DeltaNet
#线性注意力
22,580×
规模增长倍数 · GPT-2 → Kimi K3
2.8万亿
Kimi K3 参数量
1.24亿
GPT-2 参数量(2019年)
⚡ 30 秒速览
- 规模跃迁:GPT-2(1.24亿参数)→ Kimi K3(2.8万亿参数),七年扩大 22,580 倍。
- 架构主线:从 Softmax 注意力到 Kimi Linear,核心是在建立一套"记忆操作系统"——从"记住一切"走向"选择性记忆"。
- 四个里程碑:KV Cache(避免重复计算)→ 线性注意力(固定大小记忆)→ DeltaNet(精确更新)→ 门控 DeltaNet(遗忘机制)→ Kimi Linear(细粒度门控)。
- Kimi K3 混合架构:23 个四层宏环(3 层 KDA + 1 层 MLA),898 个专家,每 token 激活 16 个,门控 MLA + 潜在空间 MoE + SiTU 激活函数。
- 深层信号:参数规模不再是唯一壁垒——记忆管理架构的工程能力,正在成为下一代模型的核心竞争力。
01七年规模扩大 22,580 倍 从 GPT-2 到 Kimi K3
2019 年,GPT-2 以 1.24 亿参数、12 层 Transformer、12 个注意力头的规模,证明了 decoder-only 架构的可行性。2026 年,Kimi K3 将这一数字推至 2.8 万亿——相当于把 22,580 个 GPT-2 塞进同一个模型。
但规模只是故事的一半。更根本的变化隐藏在架构里。
GPT-2(2019)
1.24 亿参数 · 12 层 · 12 头 · 768 维
Softmax 注意力 · 无 KV 缓存 · 全连接 MLP
Kimi K3(2026)
2.8 万亿参数 · 23 个四层宏环 · 898 专家
KDA + MLA 混合 · 门控机制 · 潜在空间 MoE
注:参数量对比为整数倍关系,实际架构复杂度差异远大于参数倍数。Kimi K3 采用混合专家(MoE)架构,激活参数量远小于总参数量。
02架构演进主线:从"记住一切"到"选择性记忆"
大模型架构的七年演进,本质上是一套"记忆操作系统"的迭代。每一代架构都在回答同一个问题:模型应该记住什么、遗忘什么、以及如何高效管理记忆。
七步演化路径:
Softmax 注意力→
KV Cache→
线性注意力→
DeltaNet→
门控 DeltaNet→
Kimi Linear→
Kimi K3
每一步都在解决前一代的瓶颈:Softmax 注意力计算成本随序列长度平方增长;KV Cache 避免了重复计算,但缓存本身随序列线性增长;线性注意力将缓存压缩为固定大小矩阵,但信息开始相互干扰;DeltaNet 引入精确更新机制,只保留真正的新信息;门控 DeltaNet 增加了遗忘机制,让模型可以主动释放容量;Kimi Linear 则为每个通道学习独立的衰减值,实现细粒度记忆管理。
注:上图为架构演进的主线路径,实际工程实现中不同技术之间存在交叉与融合。Kimi K3 是这一演进路径的集大成者。
03记忆操作系统的四个里程碑 关键技术解析
🗄️ KV Cache:避免重复计算的"缓存层"2019
- 自回归解码时,每次生成新 token 都要重新计算之前所有 token 的 Key 和 Value。
- KV Cache 的核心洞察:把历史 token 的 K、V 向量存下来,避免重复计算。这是"记忆操作系统"的第一层——缓存层。
- 代价:缓存随序列长度线性增长(O(N)),成为内存带宽瓶颈。
本质:用空间换时间——存储历史计算结果,避免重复计算。
📐 线性注意力:固定大小的"工作记忆"2020
- 将 Softmax 替换为 ELU+1 特征映射,使矩阵乘法可以重新结合。
- 关键突破:不断增长的 K、V 向量被压缩为一个固定大小的 D×D 状态矩阵——记忆容量不再随序列增长。
- 代价:表达能力较弱的特征映射可能导致精度损失;纯累加更新导致信息相互干扰。
本质:用固定容量换取线性复杂度——记忆有上限,但效率大幅提升。
🎯 DeltaNet:精确更新的"选择性记忆"2022
- 当序列长度超过存储容量时,纯累加更新会导致信息相互覆盖。DeltaNet 引入了 Delta 规则。
- 核心创新:每次写入时,先读取当前 key 对应的旧记忆,只保留真正的新信息(v_new - v_old),再乘以写入强度 β。
- 效果:模型可以精确更新单个关联,而不会干扰其他记忆。
本质:从"累加"到"更新"——记忆系统学会了选择性写入,避免信息干扰。
🚪 门控 DeltaNet + Kimi Linear:可遗忘的"动态记忆"2024→2026
- DeltaNet 只能更新有明确替代项的记忆,无法在上下文切换时整体释放容量。
- 门控 DeltaNet 的贡献:增加一个 0~1 的衰减参数 α,结合 Mamba 的门控更新与 Delta 规则——当 α=1 时纯 Delta,α=0 时清空记忆。
- Kimi Linear 的飞跃:不再使用单一标量控制衰减,而是为每个通道学习独立的衰减值(α 投影),实现细粒度遗忘。
本质:从"只能更新"到"可以遗忘"——记忆系统拥有了主动释放和管理容量的能力,这是"操作系统"级的能力。
04Kimi K3:记忆操作系统的最终形态 混合架构的工程实现
Kimi K3 的语言骨干网络建立在 Kimi Linear 基础之上,但引入了三个关键的结构性变化:混合注意力层(KDA + MLA)、潜在空间 MoE、以及门控机制与 SiTU 激活函数。
它的架构可以理解为:23 个四层宏环堆叠而成。每个宏环中,3 层使用 Kimi Delta Attention(KDA),1 层使用多头潜在注意力(MLA)。第一层使用密集 FFN,其余所有层均使用潜在空间 MoE。
23
四层宏环
898
专家总数
16
每 token 激活专家
3:1
KDA : MLA 比例
注:898 个专家中包含 2 个共享专家(处理每个 token)和 896 个路由专家(每 token 激活 16 个)。MLA 层保留了完整的 Softmax 检索能力,KDA 层提供恒定状态的循环记忆——两者协同工作。
三个关键工程创新:
- 门控 MLA:决定从 MLA 检索到的每个特征有多少能传递到残差流中,通过逐元素门控实现精细控制。
- 潜在空间 MoE:将输入下投影到共享专家空间,在潜在空间完成专家混合,再投影回原始维度——计算效率更高。
- SiTU 激活函数:用 Beta·tanh(gate/Beta)·sigmoid(gate) 替代传统 SiLU,在保持非线性的同时提供更稳定的梯度行为。
KDA 提供恒定状态的循环记忆,周期性的 MLA 层则保留了对上下文进行完整 Softmax 检索的能力。这种"循环 + 检索"的混合设计,让 Kimi K3 在长序列任务中同时兼顾了效率与精度。
编辑核心判断
大模型架构的竞争,正在从"参数规模竞赛"转向"记忆管理工程"——谁能在有限的计算和存储预算下,构建更精准的"记忆操作系统",谁就能在下一代模型竞争中占据主动。Kimi K3 用 22,580 倍的规模增长证明了一件事:规模可以堆出能力,但只有架构才能定义上限。