中国开源模型 K3 搓出「螺旋丸」:一段 26 次迭代的前端工程实录
在资源受限的境况下,一个 80 人团队用 2.8 万亿参数的开源模型,硬生生挤出了世界级的前端能力。它搓出的不止是一颗虚拟的丸子,更是一套关于「如何用约束创造密度」的工程方法论。
在资源受限的境况下,一个 80 人团队用 2.8 万亿参数的开源模型,硬生生挤出了世界级的前端能力。它搓出的不止是一颗虚拟的丸子,更是一套关于「如何用约束创造密度」的工程方法论。
K3 最引人注目的数字是 2.8 万亿参数,但它的技术灵魂恰恰是 反参数竞赛。两个核心创新,一个省推理,一个省训练,全部是用更聪明的结构换能力,而不是用更多参数换能力。
每一层都要看全部内容,上下文越长,成本涨得越离谱。就像读一本厚书,每翻一页都要把前面所有页重新扫一遍。
大部分时候不回头翻原文,只看自己手写的那一页摘要。只有每隔三层,才允许真正回头翻一次完整原文。
注:KV cache 和速度数据来自 48B 验证模型,不是 2.8T 本体。训练效率提升来自 AttnRes 机制,在 1.4T token 训练上追平了 1.25 倍算力的基线。
在 48B 规模的验证模型上,KV cache 最多降 75%,100 万 token 长度下解码速度快 6 倍。这就是“1M 上下文能真跑起来”的原因——不是靠硬堆资源,是靠限制。
一个诚实的注脚:
K3 的 API 定价是输入 3 美元、输出 15 美元每百万 token,相比前作 K2.7 的 0.95 和 4 美元,输出涨了将近四倍。它选择把有限的资源全部押在能力上限上,然后诚实地说明了跑满血版的成本和代价。
一个前端项目,26 次迭代,最终呈现的效果是:搓球的时候,页面上所有文字、按钮、导航栏,都被吸进那颗球里。这不是一个简单的“炸开”特效,而是一个完整的物理系统。
答案藏在 K3 的架构哲学里:约束才是威力的本源。密度不来自总量,来自被秩序化的程度。
2.8 万亿参数,但每次只激活 896 个专家中的 16 个;从后训练阶段就开始用 MXFP4 权重、MXFP8 激活做量化感知训练。它是一开始就在被压的状态下训练。
K3 的工程思路是:资源永远受限,但思维不是。他们没有更多的卡,于是去想清楚了哪些层其实根本不需要看全文。
在螺旋丸项目里,这个逻辑也处处可见:球体在长按后会进化成一个更大的形态,K3 给出的方案是“加内部层次、减外部厚度”——让球在往外涨,核在往里收,壳在变薄。这已经符合人类的审美和感知了。
K3 证明了一件事:在资源受限的公开舞台上,通过架构创新和工程约束,一个 80 人团队可以做出世界级的前端能力。竞赛的逻辑已经不再是“谁的参数更多”,而是“唤醒得更聪明”。
一篇只有优点的测评不值得信。K3 在螺旋丸项目里暴露的问题同样具体:
项目成本一共 19 美元(约 129 元人民币),两天就用完了基础订阅的所有额度。但这是 26 次迭代中的人类引导成本,不是一次生成的证据。
在长程多轮多图工程中,1M 上下文被撑满了两次。一次导致会话直接中断,一次导致早期对话记录被压缩、原话不可考。
裁一张人物头像时裁错了位置,要靠生成一张带网格坐标的参考图重新定位才修对。日志里它自己写下的教训是:目测容易错,最好让用户确认。
官方文档明确警告:多轮对话和工具调用时,必须把 API 返回的完整 assistant message 原样传回去。第三方框架如果没处理好,可能会系统性低估它的能力。
一个诚实的注脚:
这个项目证明的是 K3 在有人引导、反复迭代下能达到什么程度。至于同一句提示词重复提交三次能不能稳定出好东西,那是人类该解决的自我幻觉问题。
项目已开源,可直接在浏览器中体验螺旋丸的吸入效果。按数字键 1/2/3 可以切换形态。
体验项目 → 搓丸子