🧠 模型 · 技术路线

GLM-5.3 明明更强了,为什么没能刷屏?

8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。它在 Artificial Analysis 综合智能指数拿到 60 分,与 Kimi K3 并列开源模型第一,与 Claude Fable 5、GPT-5.6 Sol 同处全球前沿区间。但发布当天,智谱股价不涨反跌 3.6%——更强的模型,没有换来更大的市场回响。

综合公开信息 2026-08-20 全文约 5 分钟读完
#智谱 #GLM-5.3 #大模型 #后训练 #开源
60 AA 综合智能指数 · 全球前沿模型区间
54.4% ExploitBench · 较前代提升超一倍
-3.6% 发布日股价 · 前两代发布日分别 +11.5% / +32.8%

⚡ 30 秒速览

  • 强在哪:AA 指数 60 分,与 Kimi K3 并列开源第一,与 Claude Fable 5、GPT-5.6 Sol 同档。
  • 晋升在哪:DeepSWE 46.2→66.9,ExploitBench 24.4%→54.4%,编程靠近完整工程任务,安全能力翻了一倍。
  • 反差:发布日股价跌 3.6%;前两代发布日分别涨 11.5%、32.8%。
  • 为什么安静:升级方向偏专业(编程+安全),多模态缺席;两个月一迭代,跑分第一的震撼正在衰减。
  • 商业考题:Coding Plan 已从 20 元/月涨到 118 元/月;模型优势需要变成第二个高频付费场景。

01进步了多少 练深,而不是练大

GLM-5.3 没有换基座——它沿用 GLM-5.2,主要靠扩大后训练规模提升能力。大模型研究员曾小健有一个通俗的解释:预训练是增加模型「读过的东西」,后训练是增加模型「做过的事情」。模型不只继续学知识,还要进入真实环境做任务、拿反馈,再调整做法。

这套方法的进步,集中体现在两项能力上:编程网络安全

66.9 DeepSWE v1.1 · 长程软件工程(前代 46.2)
54.4% ExploitBench · 漏洞利用推理(前代 24.4%)
7.5 最高难度任务 Token 消耗(前代 9.6 万)
2436 真实漏洞累计发现 · 覆盖 269 个项目

注:数据来自智谱官方公开评测与 Artificial Analysis 榜单;前三项为评测得分对比,Token 消耗越低越好。

综合来看,GLM-5.3 相对前代的变化是具体的:编程更接近完整工程任务,长任务稳定性提升,网络安全的进步尤其明显。

02市场不买账 能力与股价的反差

但资本市场给出了相反的回答。

GLM-5.3 发布当天,智谱股价下跌 3.6%。

GLM-5.1 发布 +11.5%
GLM-5.2 发布 +32.8%
GLM-5.3 发布 -3.6%

注:柱长按涨跌幅绝对值等比绘制,红色=上涨,绿色=下跌;条长仅供直观对比,以数值标签为准。

模型明明更强了——这一点几乎没有人否认。为什么市场反而更冷淡了?

一个直接原因是,这轮升级的方向相对专业:编程服务开发者,网络安全服务安全研究员与企业客户。能力都实用,但受众集中。

更大的错位在于,用户期待的并不是这两项。发布前,唐杰在社交平台上征集对新模型的期待,视觉与多模态是呼声较高的方向。越来越多 Agent 任务需要「看」:做网页要看截图,改 UI 要理解设计稿,分析报告里是图表和 PDF。

独立开发者李然(化名)的实测也印证了这种落差:常规代码任务,GLM-5.3 高过 Kimi K3、略逊于 GPT-5.6 Sol;但到了游戏生成、创意编码这类依赖视觉反馈的场景,体验明显逊色,甚至出现过生成的页面按钮都是歪的。

03它究竟强在了哪 三个侧面

💻 编程:把一项工程任务从头干到尾 +44.8%

  • DeepSWE v1.1 从前代 46.2 分提升到 66.9 分——模型能理解陌生项目,自己定位问题、调用工具、修改代码,再根据测试结果继续修正。
  • 智谱 Code Bench 最高难度档:GLM-5.3 以约 7.5 万输出 Token 拿到 34.5%,GLM-5.2 需要约 9.6 万 Token,只有 23.4%。
曾小健:完成率提高、Token 消耗反而下降,比单纯跑分上涨更值得关注——模型学会了更有效地探索,而不是靠堆思考时间换成绩。

🛡️ 安全:从读懂代码到找到漏洞 +123%

  • ExploitBench 从前代 24.4% 提升到 54.4%,测试要求模型不仅读懂代码,还要判断漏洞藏在哪里、如何触发。
  • 已进入真实项目:从 GLM-5.2 起,智谱联合多家国内安全机构持续找漏洞。截至 GLM-5.3 发布,经专家复核、筛选、去重,累计发现 2436 个漏洞,覆盖 269 个项目,其中 1097 个属于中高危。
部分漏洞已经存在了数十年——这轮提升不是刷题,而是进入了真实世界的存量风险。

🧪 开发者实测:Goal Mode 的可靠性 长任务更稳

  • ZCode 的 Goal Mode 是这位开发者感受最深的功能:给定一个目标后,模型会持续推进、检查、验证,直到任务完成。
  • 长任务的可靠性明显高于 GLM-5.2;常规代码任务已有实用价值,但依赖视觉反馈的创意类任务仍是短板。
应受访者要求,李然为化名;实证视角真实,但样本有限。

04为什么能提这么多 后训练工程化

更强的 GLM-5.3,不是靠更大参数堆出来的,而是靠「更会练」。支撑这轮后训练的,是三套工程组件:

IndexShare降低长上下文的计算成本
SAO单任务完成即可进入训练,不必等整批结束
slime模型执行任务与参数更新解耦,减少算力闲置

曾小健举了个例子:假设 100 个 Agent 任务里,80 个十分钟就能跑完,15 个要半小时,最后 5 个要两小时。传统训练方式要求这一批全部结束后才能进入下一步——先完成的只能干等最慢的 5 个,昂贵的 GPU 就此空转。新框架不再等所有任务一起「交卷」。

训练效率提高了,还得有足够多的「题」。GLM-5.3 搭起了一条自动出题流水线:

Research Agent 从真实工作找任务 Judge Agent 亲自试做 检查评分漏洞 合格题目送入后训练

AI 自己出题、试做、验题,再拿合格题目训练自己——这就是 GLM-5.3 提分的底层逻辑。

05对手也在加速 同一道题的拥挤赛道

但一款模型有没有竞争优势,要放到同期对手里看。

7 月中旬 Kimi K3 上线,8 月初 Qwen3.8-Max 跟进,8 月中旬 DeepSeek V4 Pro 正式版发布——不到一个月,四款国产旗舰接连亮相。

智谱

GLM-5.3

编程与安全双项领先,权重将开源;短板是多模态缺席。

月之暗面

Kimi K3

长程软件工程贴身竞争;原生多模态,能力覆盖更完整。

深度求索

DeepSeek V4 Pro

综合能力与价格优势依旧;同步开源 Harness,造出新话题。

阿里

Qwen3.8-Max

单项跑分不占优,但背靠阿里生态,企业工作流落地更有基础。

单看成绩,GLM-5.3 拿了不少第一,网络安全优势最明显;但 Coding 和长程 Agent 只是进入第一梯队,与 Kimi K3、DeepSeek V4 Pro 没有拉开明显差距。

一个事实:GLM-5.3 的提升方向,恰好是竞争最拥挤的方向。当大家解的是同一道题,跑分第一的窗口期,开始按周计算。

编辑核心判断

模型能力正在失去话题性。当所有头部厂商都涌向同一道题,跑分领先的窗口期会越来越短。真正难复制的,是真实工作环境、任务分布、验证机制与用户反馈构成的训练闭环。智谱把模型推到了第一梯队,剩下的问题是:把技术领先,持续变成产品与收入。

现在就能用

GLM-5.3 已经走出评测,进入真实工具链。

🌐 API 已开放调用 📦 权重下周五开源 💻 已上线 ZCode / Claude Code / OpenCode 🎯 GLM Coding Plan 用户全量开放