🧠 模型·技术

唐杰:万亿参数是行业早期的弯路,Scaling Law 不止一个旋钮

智谱联合创始人、首席科学家唐杰在 X 平台发文,阐述对 Scaling Law 的最新理解。他认为,讨论模型规模不能只看参数量,万亿参数模型是行业"集体走过又集体折返的弯路"。GLM-5.3 选择不扩大参数,而是聚焦长程任务环境和强化学习,证明"Scaling 不只有一个旋钮"

综合公开信息整理 2026-08-19 全文约 4 分钟读完
#Scaling Law #GLM-5.3 #智谱 #后训练 #MoE
⚡ 新范式 Scaling Law 从单旋钮转向多旋钮
0.730.27 Kaplan 2020:参数 vs 数据扩展指数
20 Token/参数 Chinchilla 2022:最优计算配置

⚡ 30 秒速览

  • 核心观点:唐杰发文反思 Scaling Law,认为万亿参数模型是行业早期"集体走过又集体折返的弯路",模型扩展不应只看参数量。
  • 历史脉络:从 Kaplan(2020)到 Chinchilla(2022),再到推理成本优化的新阶段——最优方案正在向"规模更小、训练时间更长"移动。
  • GLM-5.3 实验:与 GLM-5.2 相同基础模型、架构、参数量,仅用一个月扩大长程任务环境和强化学习,性能提升并非小幅改进。
  • 核心隐喻:"Scaling 不只有一个旋钮"——不同阶段应调整不同的优化方向,后训练是目前提升空间最大的旋钮。
  • 后续计划:智谱并未停止扩展,后续可能继续扩大中期训练、预训练等环节,只是不再盲目追逐参数规模。

01Scaling Law 不止一个旋钮 唐杰的核心判断

唐杰在 X 平台发文,开篇即点明问题:"模型规模还在扩大,但扩展的不应只有参数量。"他认为,参数量只有与另外三个问题放在一起才有意义——拥有多少训练数据、准备把计算资源用在哪里,以及谁会在什么条件下运行这个模型。

这不是一个理论问题,而是一个工程选择问题。

他将模型扩展比作调节多个旋钮:参数量、预训练数据、单次前向计算深度、后训练——每个旋钮在不同阶段有不同剩余空间。这次智谱选择了后训练,并不意味着其他方向已经完成。

传统观点:单旋钮思维

以参数量为核心指标,认为"更大参数 = 更强模型"。2020 年 Kaplan 研究推动行业优先扩大参数量,GPT-3、Gopher、MT-NLG 均受此影响。

唐杰观点:多旋钮协同

参数量、数据量、计算深度、后训练是四个独立旋钮。不同阶段应调整不同的旋钮,不存在一个始终最值得增加的指标。

0.73Kaplan 参数指数
0.27Kaplan 数据指数
20×Chinchilla Token/参数
889×Gemma-2-9B Token/参数

注:Kaplan 2020 年拟合的扩展规律认为参数规模增长应快于数据规模;Chinchilla 2022 年重新实验发现最优配置更接近每个参数对应 20 个 Token;Gemma-2-9B 则采用了"过度训练"路线,每个参数对应约 889 个 Token。

02从万亿参数到后训练 Scaling Law 的三次转折

唐杰回顾了 Scaling Law 的演变历程,将其划分为三个阶段。每个阶段都有不同的"最优答案",而行业为此付出了实践的代价。

2020 · Kaplan参数优先时代
参数指数 0.73
2022 · Chinchilla平衡配置时代
20 Token/参数
2025 · 推理成本优化过度训练时代
200-889 Token/参数
2026 · MoE 与后训练多旋钮协同
按任务调优

注:柱形为示意,反映各阶段对"最优指标"的相对置信度,非精确数值。从左到右依次为 Kaplan 参数优先、Chinchilla 平衡配置、推理成本驱动的过度训练、以及当前的多旋钮协同阶段。

唐杰特别指出,Chinchilla 并非 Scaling Law 的终点。当模型每天被调用数十亿次,推理成本在模型全生命周期中的占比上升,最优方案开始向"规模更小、训练时间更长"的模型移动。Llama-2-7B 和 Gemma-2-9B 采用的正是这种"过度训练"路线。

一个诚实的注脚:

混合专家模型(MoE)的普及,使总参数量和每次实际激活的参数量需要分开考虑。唐杰认为,总参数量影响模型容纳知识的能力,激活参数量和有效计算深度则影响推理链长度。对于漏洞发现等任务,模型需要连续完成多步推理——"这种能力并不存在于总参数量本身。"

03GLM-5.3:一次诚实的对照实验 不改变基础模型,只调后训练旋钮

GLM-5.3 是智谱针对上述判断进行的一次对照实验。唐杰明确写道:GLM-5.3 采用了与 GLM-5.2 相同的基础模型、架构、总参数量和激活参数量。唯一的变化是用一个月扩大长程任务环境及强化学习训练。

结果呢?"最终取得的提升并不是小幅改进。"

🔬 GLM-5.3 实验设计 对照实验

  • 基础模型:与 GLM-5.2 完全相同,未改变架构、总参数量、激活参数量
  • 干预变量:扩大长程任务环境 + 强化学习训练,为期一个月
  • 结果:性能提升显著,证明后训练旋钮仍有较大剩余空间
  • 含义:Scaling 的不同旋钮不必同时转动,下一步最值得调整的指标通常不是上一次最值得调整的指标
唐杰强调:这并不意味着基础模型规模、预训练数据已经不再重要——智谱后续仍可能继续扩大中期训练、预训练及其他环节。

唐杰用了一个形象的比喻:Scaling 不只有一个旋钮。这一次智谱选择调高后训练这个旋钮,是因为它仍然拥有最大的提升空间,而不是因为其他方向已经完成。"基础模型规模、预训练数据以及每次前向计算投入的计算量,仍然都是可以继续扩展的方向,我们也会重新回到这些方面。"

04社区反应 网友追问:后训练的 Scaling Law 在哪里?

唐杰的发文在 X 平台引发讨论。多位研究者围绕 Scaling Law 的下一阶段方向提出追问。

"后训练领域何时会出现类似 Chinchilla 的 Scaling Law 研究?GLM 的强化学习曲线目前已经趋于平缓,还是仍有继续增长的空间?"

—— 社区研究者追问

"中小规模模型仍有提升空间,视觉能力和运行速度可能成为 GLM 系列接下来的升级方向。"

—— 以 Qwen 3.8 27B 及 GLM-5.3 为例的观察

"值得关注的不只是问题的表面答案,而是其背后更深层的结构——能够提出好问题的人,比能够给出答案的人更加少见。"

—— 关于"如何提出问题"的延伸思考

这些讨论折射出行业对 Scaling Law 走向的普遍关切:当参数规模不再是唯一叙事,新的坐标系在哪里?后训练、推理效率、多模态能力,可能成为下一阶段竞争的焦点。

编辑核心判断

万亿参数叙事曾是行业最大的共识泡沫,而唐杰的坦诚在于:他承认那是"集体走过又集体折返的弯路"。但更值得关注的是"多旋钮"框架的实操价值——在算力成本高企的存量时代,能够精确识别哪个旋钮还有剩余空间,比盲目堆参数更考验工程判断力。后训练不是终点,但它证明了一件事:模型能力的边界,远不止于参数表的最后一行。

思考延伸

Scaling Law 的下一阶段方向正在被重新定义。当"更大"不再是唯一答案,"更聪明地分配计算"正在成为新的竞争主轴。

前往 X 平台查看原文讨论