🔬 模型 · 参数深水区

两款长文本模型撞上同一个「-5」:线性注意力的黄金窗口,被中国团队集体踩中

智谱 GLM-5.3-Flash 上线首日登顶 OpenRouter 调用量榜,却因一个底层参数引爆讨论:KDA 核心遗忘门下界 gate_lower_bound = -5,与 Kimi K3 完全一致。这不是像素级对标——而是线性注意力数值最优区间极度狭窄之下,行业必然的技术趋同。

综合公开信息整理 事件透视 全文约 6 分钟读完
#GLM-5.3-Flash #Kimi K3 #线性注意力 #KDA #算子优化
🥇 Top 1 OpenRouter 调用量榜 · 上线首日
-5 gate_lower_bound 遗忘门下界,两模型一致
20 Kimi K3 报告公开 → GLM-5.3-Flash 上线
⚡ 30 秒速览
  • 事件:智谱认领「牛来」模型,正式命名 GLM-5.3-Flash,上线首日登顶 OpenRouter 调用量榜。
  • 发现:Kimi 核心研究员陈广宇对比代码后指出,两者 KDA 核心参数 gate_lower_bound 同为 -5
  • 含义:-5 经激活函数换算约对应 0.67% 的强制信息留存,是「训不炸、忘不掉」的折中点。
  • 性质:工程上更可能是「中途注入」——对齐经工业验证的最佳实践,省下以亿元计的试错算力
  • 判断:参数撞衫不是抄袭,而是线性注意力数值最优区间极度狭窄之下的技术趋同。

01从「牛来」到 GLM-5.3-Flash 一款模型引发的参数对照

昨晚,智谱 AI 正式认领了在 OpenRouter 盲测榜上风头最盛的「牛来」模型,命名为 GLM-5.3-Flash。上线首日,它登顶调用量榜,同时刷新了全网长文本性价比的斩杀线——长文本 API 的价格下限,又被压低了一截。

这款模型的底层架构,堪称「集百家之长」:稀疏注意力(NSA)来自 DeepSeek 谱系,线性注意力(KDA)来自 Kimi 谱系,再叠加 DeepSeek 的流形约束超连接(mHC)。混合架构的目标只有一个:大幅降本提效。

真正让行业侧目的,是今天早上的一张贴图。

月之暗面核心研究员陈广宇,在仔细研究 GLM-5.3-Flash 的模型配置文件后,贴出与 Kimi K3 的底层代码对比图。结论很直接:两者不仅都采用 KDA 线性注意力,排布逻辑高度重合,连核心参数「遗忘门下界」gate_lower_bound 也同为 -5

从 Kimi K3 公开技术报告到智谱上新,隔了不到 20 天。有人感叹:哪怕是参考公开参数,20 天内做出这么强的模型,也快得惊人。

Kimi K3 · 原生设计

  • gate_lower_bound=-5 从预训练第一天嵌入
  • 万卡级预训练中大量试错踩出的稳定解
  • 公开技术报告:算子实现、配置、工程坑全量披露

GLM-5.3-Flash · 疑似中途注入

  • 预训练中后期追加门控约束 + 调低学习率续训
  • 无需重置权重,快速对齐验证过的最佳实践
  • 省下的是以亿元计的底层试错算力

注:「中途注入」是社区基于模型配置文件与公开信息的技术推断,智谱官方尚未就此做出说明。

一个诚实的注脚:靠改一个数字做不出新模型。智谱在线性注意力方向已有数月积累,更合理的逻辑是——团队原本就在相近区间做实验,看到 Kimi 报告验证了 -5 在大参数量级下的稳定性后,直接收敛到了同一坐标。

02一个数字背后的工程深渊 -5 为什么是黄金点

参数重合为什么值得被刷屏?因为 -5 不是随手填出来的。要理解它,得先看懂线性注意力趟过的那条路。

传统 Transformer 的 Softmax 注意力保留完整记忆——每个 Token 都写进 KV 缓存。对话一长,计算量平方级暴涨,显存随上下文线性攀升。上下文拉到百万级,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

于是行业转向线性注意力。Kimi 的 KDA 是代表:不存全量 KV 缓存,改用一块固定大小的状态矩阵压缩历史;模型一边写入新内容,一边用「遗忘门」控制旧信息的衰减。显存开销基本恒定——这是近期百万级长文本 API 能卖成「白菜价」的底层逻辑。

但压缩记忆有一个致命伤:数值溢出。

线性注意力靠循环乘法更新状态。每处理一个新 Token,旧状态就要乘一次遗忘门系数。上下文越长,乘法次数越多:数值要么衰减归零,要么膨胀成无穷大——只要算出一个 NaN,训练直接崩溃,千万级算力打水漂。

Token 进入 状态矩阵更新 遗忘门衰减 强制保留 0.67% 稳定输出
-3
留存 ≈ 5% · 设太高

旧信息过度堆积,导致网络过载、梯度爆炸、上下文混杂幻觉。

-5
留存 ≈ 0.67% · 黄金点

算子稳定性与长文本召回率的最优折中,百万级上下文商业化落地关键。

-8
留存 ≈ 0.03% · 设太低

模型严重「健忘」:长代码调试、长财报分析等精准召回任务直接失效

注:留存率经激活函数换算,为近似值;区间效应综合自 Kimi K3 技术报告与社区讨论。三档对比旨在展示数量级差异,非精确映射。

Kimi 团队之所以必须下潜到算子层,是因为撞上了半精度芯片的物理极限:fp16 / bf16 动态范围极窄,数万次循环累乘会把微小发散迅速放大。于是他们在自研 FlashKDA CUDA 内核里写下 gate_lower_bound = -5,用算子层的硬约束给数值稳定性上保险。

-5 不是算出来的,是海量试错「试」出来的。它精确卡在「训不炸」与「忘不掉」之间,是线性注意力从论文走向大规模商业化的关键一跃。

03同一个 -5,两种不同的走法 原生设计与中途注入

同样的 -5,对 Kimi 是原生设计,对智谱更可能是「中途注入」。

对 Kimi K3 而言,混合注意力架构从预训练第一天就位:线性注意力承接长上下文的记忆压缩,传统 Softmax 注意力处理复杂逻辑推理,保证核心能力不打折。在这个架构里,gate_lower_bound=-5 是原生设计的一部分,完整记载于公开技术报告。

而智谱的配置文件中出现完全一致的 -5,社区推测是「中途注入」:在预训练中后期追加门控约束,再用调低的学习率续训一段时间。这不需要推倒重来,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种策略在工程逻辑上完全成立,体现的是智谱极强的工程落地效率

⚠️ 风险提示 隐性分布偏移的代价。模型经过数千万步预训练,已形成「遗忘门可以调到极低」的内在行为模式。中途锁死下限,相当于半路修改底层运行规则。表面看训练损失与公开跑分都正常,但内部记忆分布可能已悄悄偏移——常规测试发现不了,在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能因残留信息持续累积出现「慢性中毒」式的逻辑错误。
开发者视角 · Oliver Sieberling 这属于「非侵入式改动」:遗忘门本身是模型自适应学习的结果,加一个下限只是卡住极端取值,并不改变遗忘门的学习目标,对模型主体扰动极小,更像加了一道安全护栏,性价比很高。

同一份改动,有人看到性价比,有人看到风险——这正是工程判断的分野。

04算法岔路口 DeepSeek 走了另一条路

在长文本底层优化赛道上,-5 并不是唯一答案。DeepSeek 没有走 Delta Rule 谱系的门控方案,而是沿自研 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,用低秩压缩和硬件级算子优化,在另一套数学框架里同样实现了长序列数值稳定。

为什么中国最顶尖的团队,都在死磕同一个底层瓶颈?

答案藏在大推理模型时代的算力账本里。自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台深度推导时要自主生成几十万字的思维链 Token。如果固守平方级算力成本,超长思维链的显存黑洞会直接吞掉任何一家公司的商业毛利。

门控线性注意力 KDA · Kimi K3 / GLM-5.3-Flash
固定状态矩阵压缩历史 + 遗忘门下界 -5,用算子层硬约束锁定数值稳定,显存开销基本恒定。
MLA + NSA · DeepSeek 谱系
低秩压缩 + 原生稀疏注意力,在另一套数学框架中实现长序列稳定,绕开 Delta Rule 的门控路线。

注:两条路径的目标一致——以近似线性的成本支撑超长上下文,但数学基础与工程实现完全不同。

谁能用线性成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然指向这个窄小的黄金带。

从这个角度看,参数「撞衫」从来不是抄袭的佐证——它是行业集体挺进技术深水区时,必然会出现的技术趋同

05不是争吵,是行业成熟的信号 参数战之外

回到最初的问题:智谱有没有「参考」Kimi 的参数?

在工业界,这个问题的答案已经不重要。大模型技术日新月异,只讲数学规律和商业 ROI 的产业界,不会为任何单一架构站台。-5 不是谁的专利,它是攀登技术高峰途中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路。

任何经受住万卡集群实战检验的「最佳实践」,都会在最短时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型——因为在极致的算力压迫下,中国最顶尖的团队,正以一种惊人的敏捷度,不约而同地攀上同一座山的极顶。

竞争已经下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战——这本身就是行业成熟的信号

编辑核心判断

参数会趋同,天花板不会。当 -5 从 Kimi 的「独家秘方」变成行业的「默认配置」,真正的分水岭已经转移——谁能在一个参数之上,继续堆出别人抄不走的系统工程能力,谁才是下一轮洗牌的赢家

🧪

想亲手验证两条技术路径?GLM-5.3-Flash 已上线智谱开放平台,可实测长文本与推理表现;Kimi K3 的技术报告亦已公开。同一道题,两种解法,值得亲自跑一遍。