两款长文本模型撞上同一个「-5」:线性注意力的黄金窗口,被中国团队集体踩中
智谱 GLM-5.3-Flash 上线首日登顶 OpenRouter 调用量榜,却因一个底层参数引爆讨论:KDA 核心遗忘门下界 gate_lower_bound = -5,与 Kimi K3 完全一致。这不是像素级对标——而是线性注意力数值最优区间极度狭窄之下,行业必然的技术趋同。
智谱 GLM-5.3-Flash 上线首日登顶 OpenRouter 调用量榜,却因一个底层参数引爆讨论:KDA 核心遗忘门下界 gate_lower_bound = -5,与 Kimi K3 完全一致。这不是像素级对标——而是线性注意力数值最优区间极度狭窄之下,行业必然的技术趋同。
昨晚,智谱 AI 正式认领了在 OpenRouter 盲测榜上风头最盛的「牛来」模型,命名为 GLM-5.3-Flash。上线首日,它登顶调用量榜,同时刷新了全网长文本性价比的斩杀线——长文本 API 的价格下限,又被压低了一截。
这款模型的底层架构,堪称「集百家之长」:稀疏注意力(NSA)来自 DeepSeek 谱系,线性注意力(KDA)来自 Kimi 谱系,再叠加 DeepSeek 的流形约束超连接(mHC)。混合架构的目标只有一个:大幅降本提效。
真正让行业侧目的,是今天早上的一张贴图。
月之暗面核心研究员陈广宇,在仔细研究 GLM-5.3-Flash 的模型配置文件后,贴出与 Kimi K3 的底层代码对比图。结论很直接:两者不仅都采用 KDA 线性注意力,排布逻辑高度重合,连核心参数「遗忘门下界」gate_lower_bound 也同为 -5。
从 Kimi K3 公开技术报告到智谱上新,隔了不到 20 天。有人感叹:哪怕是参考公开参数,20 天内做出这么强的模型,也快得惊人。
注:「中途注入」是社区基于模型配置文件与公开信息的技术推断,智谱官方尚未就此做出说明。
一个诚实的注脚:靠改一个数字做不出新模型。智谱在线性注意力方向已有数月积累,更合理的逻辑是——团队原本就在相近区间做实验,看到 Kimi 报告验证了 -5 在大参数量级下的稳定性后,直接收敛到了同一坐标。
参数重合为什么值得被刷屏?因为 -5 不是随手填出来的。要理解它,得先看懂线性注意力趟过的那条路。
传统 Transformer 的 Softmax 注意力保留完整记忆——每个 Token 都写进 KV 缓存。对话一长,计算量平方级暴涨,显存随上下文线性攀升。上下文拉到百万级,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。
于是行业转向线性注意力。Kimi 的 KDA 是代表:不存全量 KV 缓存,改用一块固定大小的状态矩阵压缩历史;模型一边写入新内容,一边用「遗忘门」控制旧信息的衰减。显存开销基本恒定——这是近期百万级长文本 API 能卖成「白菜价」的底层逻辑。
但压缩记忆有一个致命伤:数值溢出。
线性注意力靠循环乘法更新状态。每处理一个新 Token,旧状态就要乘一次遗忘门系数。上下文越长,乘法次数越多:数值要么衰减归零,要么膨胀成无穷大——只要算出一个 NaN,训练直接崩溃,千万级算力打水漂。
旧信息过度堆积,导致网络过载、梯度爆炸、上下文混杂幻觉。
算子稳定性与长文本召回率的最优折中,百万级上下文商业化落地关键。
模型严重「健忘」:长代码调试、长财报分析等精准召回任务直接失效。
注:留存率经激活函数换算,为近似值;区间效应综合自 Kimi K3 技术报告与社区讨论。三档对比旨在展示数量级差异,非精确映射。
Kimi 团队之所以必须下潜到算子层,是因为撞上了半精度芯片的物理极限:fp16 / bf16 动态范围极窄,数万次循环累乘会把微小发散迅速放大。于是他们在自研 FlashKDA CUDA 内核里写下 gate_lower_bound = -5,用算子层的硬约束给数值稳定性上保险。
-5 不是算出来的,是海量试错「试」出来的。它精确卡在「训不炸」与「忘不掉」之间,是线性注意力从论文走向大规模商业化的关键一跃。
同样的 -5,对 Kimi 是原生设计,对智谱更可能是「中途注入」。
对 Kimi K3 而言,混合注意力架构从预训练第一天就位:线性注意力承接长上下文的记忆压缩,传统 Softmax 注意力处理复杂逻辑推理,保证核心能力不打折。在这个架构里,gate_lower_bound=-5 是原生设计的一部分,完整记载于公开技术报告。
而智谱的配置文件中出现完全一致的 -5,社区推测是「中途注入」:在预训练中后期追加门控约束,再用调低的学习率续训一段时间。这不需要推倒重来,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种策略在工程逻辑上完全成立,体现的是智谱极强的工程落地效率。
同一份改动,有人看到性价比,有人看到风险——这正是工程判断的分野。
在长文本底层优化赛道上,-5 并不是唯一答案。DeepSeek 没有走 Delta Rule 谱系的门控方案,而是沿自研 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,用低秩压缩和硬件级算子优化,在另一套数学框架里同样实现了长序列数值稳定。
为什么中国最顶尖的团队,都在死磕同一个底层瓶颈?
答案藏在大推理模型时代的算力账本里。自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台深度推导时要自主生成几十万字的思维链 Token。如果固守平方级算力成本,超长思维链的显存黑洞会直接吞掉任何一家公司的商业毛利。
注:两条路径的目标一致——以近似线性的成本支撑超长上下文,但数学基础与工程实现完全不同。
谁能用线性成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然指向这个窄小的黄金带。
从这个角度看,参数「撞衫」从来不是抄袭的佐证——它是行业集体挺进技术深水区时,必然会出现的技术趋同。
回到最初的问题:智谱有没有「参考」Kimi 的参数?
在工业界,这个问题的答案已经不重要。大模型技术日新月异,只讲数学规律和商业 ROI 的产业界,不会为任何单一架构站台。-5 不是谁的专利,它是攀登技术高峰途中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路。
任何经受住万卡集群实战检验的「最佳实践」,都会在最短时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型——因为在极致的算力压迫下,中国最顶尖的团队,正以一种惊人的敏捷度,不约而同地攀上同一座山的极顶。
竞争已经下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战——这本身就是行业成熟的信号。
参数会趋同,天花板不会。当 -5 从 Kimi 的「独家秘方」变成行业的「默认配置」,真正的分水岭已经转移——谁能在一个参数之上,继续堆出别人抄不走的系统工程能力,谁才是下一轮洗牌的赢家。
想亲手验证两条技术路径?GLM-5.3-Flash 已上线智谱开放平台,可实测长文本与推理表现;Kimi K3 的技术报告亦已公开。同一道题,两种解法,值得亲自跑一遍。