💻 模型 · 前端工程

中国开源模型 K3 搓出「螺旋丸」:一段 26 次迭代的前端工程实录

在资源受限的境况下,一个 80 人团队用 2.8 万亿参数的开源模型,硬生生挤出了世界级的前端能力。它搓出的不止是一颗虚拟的丸子,更是一套关于「如何用约束创造密度」的工程方法论。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Kimi K3 #开源模型 #前端工程 #架构创新
2.8T 参数规模,最大开源模型
896/16 MoE 专家激活比
26 次迭代,完成一个前端的「螺旋丸」

⚡ 30 秒速览

  • K3 做了一件什么事:用纯前端技术(Canvas 2D),在网页上搓出了一颗具有物理吸入感的「螺旋丸」,所有文字、按钮、装饰物都被吸进同一个涡旋力场。
  • 技术内核:不是靠更大的模型,而是靠两个架构创新——KDA(注意力残差)和 AttnRes(注意力残差),分别省推理和训练,让 2.8T 模型“跑得起、训得省”。
  • 真实的代价:API 输出价格是前作的 4 倍(15 美元/百万 token),1M 上下文在长程工程中两次被撑满,且需要特定的脚手架适配才能发挥全部实力。
  • 它的工程哲学:“约束才是威力的本源” —— 不是资源最大化,而是通过限制(KV cache 降 75%、训练效率提升 25%)来换取密度和性能。
  • 去哪体验:项目已开源,可直接在浏览器中搓丸子,按数字键 1/2/3 切换形态。

01 2.8T 参数的秘密:不是堆料,是省料

K3 最引人注目的数字是 2.8 万亿参数,但它的技术灵魂恰恰是 反参数竞赛。两个核心创新,一个省推理,一个省训练,全部是用更聪明的结构换能力,而不是用更多参数换能力。

传统注意力机制

每一层都要看全部内容,上下文越长,成本涨得越离谱。就像读一本厚书,每翻一页都要把前面所有页重新扫一遍。

KDA(Kimi Delta Attention)

大部分时候不回头翻原文,只看自己手写的那一页摘要。只有每隔三层,才允许真正回头翻一次完整原文。

-75%KV cache 降幅
6x100万 token 解码速度
3:1线性/全注意力混合比
+25%训练效率提升

注:KV cache 和速度数据来自 48B 验证模型,不是 2.8T 本体。训练效率提升来自 AttnRes 机制,在 1.4T token 训练上追平了 1.25 倍算力的基线。

在 48B 规模的验证模型上,KV cache 最多降 75%,100 万 token 长度下解码速度快 6 倍。这就是“1M 上下文能真跑起来”的原因——不是靠硬堆资源,是靠限制。

一个诚实的注脚:

K3 的 API 定价是输入 3 美元、输出 15 美元每百万 token,相比前作 K2.7 的 0.95 和 4 美元,输出涨了将近四倍。它选择把有限的资源全部押在能力上限上,然后诚实地说明了跑满血版的成本和代价。

02 它到底会做什么?从「螺旋丸」开始

一个前端项目,26 次迭代,最终呈现的效果是:搓球的时候,页面上所有文字、按钮、导航栏,都被吸进那颗球里。这不是一个简单的“炸开”特效,而是一个完整的物理系统。

🌀 文字的「吸入」:计算几何的硬核应用 6 次迭代

  • 第一步:用 TreeWalker 遍历文本节点,每个字包进独立的 span,同时跳过注音标签。
  • 第二步:用递归半平面切割将每个字切成随机多边形碎片,再通过 CSS clip-path 落在 DOM 上。
  • 第三步:处理斜排文字的旋转补偿——沿着祖先元素一路累乘 CSS matrix 旋转角,克隆碎片时反向补偿回去。
这个隐性难点(斜排文字碎片会歪)需求里根本没提,是 K3 在实现过程中自动暴露并解决的。

🌪️ 所有东西活在同一个力场里 一致性

  • 文字碎片、树叶、球面甩出的气流、环境尘埃——四类对象共用同一套流场公式。
  • 一个环量项决定绕球转多快,一个径向汇流项决定往里吸多快,都随距离衰减。
  • 每个个体都有自己的系数,所以有的叶子会盘旋很久才被吞掉,有的一下就没了。
这是专业运动模糊的做法:飞得越快,拉得越长。架构决策在前,视觉效果在后。

🔄 完整的三状态机:爆炸容易,收回来难 无限循环

  • 静止 → 吸入中 → 归位中,松手后三件事同时发生。
  • 碎掉的碎片沿缓动曲线飞回原位淡出;被拉扯变形的元素弹性回弹;被吞掉的元素就地重新淡入聚合。
  • 全部结束后状态归零,页面回到最初的样子,可以再搓一次,效果完全一样。
一个只有真调试过才会写的补丁:长按按钮碎掉后,用透明度归零而不是隐藏,以保证浏览器能收到松手事件。

03 为什么是它做出来了?

答案藏在 K3 的架构哲学里:约束才是威力的本源。密度不来自总量,来自被秩序化的程度。

2.8 万亿参数,但每次只激活 896 个专家中的 16 个;从后训练阶段就开始用 MXFP4 权重、MXFP8 激活做量化感知训练。它是一开始就在被压的状态下训练。

K3 的工程思路是:资源永远受限,但思维不是。他们没有更多的卡,于是去想清楚了哪些层其实根本不需要看全文。

限制参数限制注意力限制专家换取密度

在螺旋丸项目里,这个逻辑也处处可见:球体在长按后会进化成一个更大的形态,K3 给出的方案是“加内部层次、减外部厚度”——让球在往外涨,核在往里收,壳在变薄。这已经符合人类的审美和感知了。

编辑核心判断

K3 证明了一件事:在资源受限的公开舞台上,通过架构创新和工程约束,一个 80 人团队可以做出世界级的前端能力。竞赛的逻辑已经不再是“谁的参数更多”,而是“唤醒得更聪明”。

04 诚实的注脚:它不完美

一篇只有优点的测评不值得信。K3 在螺旋丸项目里暴露的问题同样具体:

💰

贵,且不包含脚手架

项目成本一共 19 美元(约 129 元人民币),两天就用完了基础订阅的所有额度。但这是 26 次迭代中的人类引导成本,不是一次生成的证据。

📏

1M 上下文被撑满

在长程多轮多图工程中,1M 上下文被撑满了两次。一次导致会话直接中断,一次导致早期对话记录被压缩、原话不可考。

🐛

低级错误仍然存在

裁一张人物头像时裁错了位置,要靠生成一张带网格坐标的参考图重新定位才修对。日志里它自己写下的教训是:目测容易错,最好让用户确认。

⚠️

需要稳定脚手架

官方文档明确警告:多轮对话和工具调用时,必须把 API 返回的完整 assistant message 原样传回去。第三方框架如果没处理好,可能会系统性低估它的能力。

一个诚实的注脚:

这个项目证明的是 K3 在有人引导、反复迭代下能达到什么程度。至于同一句提示词重复提交三次能不能稳定出好东西,那是人类该解决的自我幻觉问题。

现在就能搓

项目已开源,可直接在浏览器中体验螺旋丸的吸入效果。按数字键 1/2/3 可以切换形态。

体验项目 → 搓丸子