GLM-5.3 明明更强了,为什么没能刷屏?
8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。它在 Artificial Analysis 综合智能指数拿到 60 分,与 Kimi K3 并列开源模型第一,与 Claude Fable 5、GPT-5.6 Sol 同处全球前沿区间。但发布当天,智谱股价不涨反跌 3.6%——更强的模型,没有换来更大的市场回响。
8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。它在 Artificial Analysis 综合智能指数拿到 60 分,与 Kimi K3 并列开源模型第一,与 Claude Fable 5、GPT-5.6 Sol 同处全球前沿区间。但发布当天,智谱股价不涨反跌 3.6%——更强的模型,没有换来更大的市场回响。
GLM-5.3 没有换基座——它沿用 GLM-5.2,主要靠扩大后训练规模提升能力。大模型研究员曾小健有一个通俗的解释:预训练是增加模型「读过的东西」,后训练是增加模型「做过的事情」。模型不只继续学知识,还要进入真实环境做任务、拿反馈,再调整做法。
这套方法的进步,集中体现在两项能力上:编程与网络安全。
注:数据来自智谱官方公开评测与 Artificial Analysis 榜单;前三项为评测得分对比,Token 消耗越低越好。
综合来看,GLM-5.3 相对前代的变化是具体的:编程更接近完整工程任务,长任务稳定性提升,网络安全的进步尤其明显。
但资本市场给出了相反的回答。
GLM-5.3 发布当天,智谱股价下跌 3.6%。
注:柱长按涨跌幅绝对值等比绘制,红色=上涨,绿色=下跌;条长仅供直观对比,以数值标签为准。
模型明明更强了——这一点几乎没有人否认。为什么市场反而更冷淡了?
一个直接原因是,这轮升级的方向相对专业:编程服务开发者,网络安全服务安全研究员与企业客户。能力都实用,但受众集中。
更大的错位在于,用户期待的并不是这两项。发布前,唐杰在社交平台上征集对新模型的期待,视觉与多模态是呼声较高的方向。越来越多 Agent 任务需要「看」:做网页要看截图,改 UI 要理解设计稿,分析报告里是图表和 PDF。
独立开发者李然(化名)的实测也印证了这种落差:常规代码任务,GLM-5.3 高过 Kimi K3、略逊于 GPT-5.6 Sol;但到了游戏生成、创意编码这类依赖视觉反馈的场景,体验明显逊色,甚至出现过生成的页面按钮都是歪的。
更强的 GLM-5.3,不是靠更大参数堆出来的,而是靠「更会练」。支撑这轮后训练的,是三套工程组件:
曾小健举了个例子:假设 100 个 Agent 任务里,80 个十分钟就能跑完,15 个要半小时,最后 5 个要两小时。传统训练方式要求这一批全部结束后才能进入下一步——先完成的只能干等最慢的 5 个,昂贵的 GPU 就此空转。新框架不再等所有任务一起「交卷」。
训练效率提高了,还得有足够多的「题」。GLM-5.3 搭起了一条自动出题流水线:
AI 自己出题、试做、验题,再拿合格题目训练自己——这就是 GLM-5.3 提分的底层逻辑。
但一款模型有没有竞争优势,要放到同期对手里看。
7 月中旬 Kimi K3 上线,8 月初 Qwen3.8-Max 跟进,8 月中旬 DeepSeek V4 Pro 正式版发布——不到一个月,四款国产旗舰接连亮相。
编程与安全双项领先,权重将开源;短板是多模态缺席。
长程软件工程贴身竞争;原生多模态,能力覆盖更完整。
综合能力与价格优势依旧;同步开源 Harness,造出新话题。
单项跑分不占优,但背靠阿里生态,企业工作流落地更有基础。
单看成绩,GLM-5.3 拿了不少第一,网络安全优势最明显;但 Coding 和长程 Agent 只是进入第一梯队,与 Kimi K3、DeepSeek V4 Pro 没有拉开明显差距。
一个事实:GLM-5.3 的提升方向,恰好是竞争最拥挤的方向。当大家解的是同一道题,跑分第一的窗口期,开始按周计算。
模型能力正在失去话题性。当所有头部厂商都涌向同一道题,跑分领先的窗口期会越来越短。真正难复制的,是真实工作环境、任务分布、验证机制与用户反馈构成的训练闭环。智谱把模型推到了第一梯队,剩下的问题是:把技术领先,持续变成产品与收入。
GLM-5.3 已经走出评测,进入真实工具链。