🔵 模型更新 · 技术快讯

基座不变,复杂工程与安全能力跃升:GLM-5.3发布

8月14日,智谱 AI 发布新一代基座模型 GLM-5.3。它没有更换基座,却通过极致的后训练 Scaling,把能力重点推向了长程编程、复杂工程执行与网络安全任务。

事件时间:8月14日 技术方向:后训练 Scaling 全文约 4 分钟读完
#GLM-5.3 #后训练Scaling #代码智能体 #网络安全
7430亿 总参数规模
2个月 从 GLM-5.2 到新版本
纯文本 仍未搭载视觉编码器

注:Hero 只展示版本定位与核心边界;具体评测分数、任务表现和不足放在正文展开。

⚡ 30 秒速览

  • 发生了什么:GLM-5.3 正式发布,官方强调“基座模型没变”,升级核心来自更大规模的后训练与环境交互。
  • 编程涨在哪:Terminal Bench 3.0 得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9。
  • 安全表现:CyberGym 得分 83.5%,接近 Mythos 5;但在更深的漏洞利用任务上,仍明显落后。
  • 真实案例:联合安全团队发现 2404 个漏洞,其中 1088 个为中高危,部分漏洞存在于 Android、Windows、macOS 和应用软件中。
  • 仍待回答:视觉能力、深度漏洞利用和商业化收入,构成 GLM-5.3 下一阶段的三道门槛。

01发生了什么?一次“基座不变”的版本升级

过去几个月,大模型行业连续进入版本更新期。GLM-5.3 的特殊之处不在于重新训练了一个更大的基座,而在于它选择了一条更克制、也更难验证的路径:在既有基座上继续压榨任务执行能力

这不是换发动机,而是把整套训练与执行系统重新调到更高转速。

GLM-5.2开源

混合专家架构,约7530亿参数,上下文窗口达到100万 token。

新版本页面短暂出现

“ZCode for GLM-5.3”页面意外上线约一小时,引发市场快速反应。

GLM-5.3正式发布

官方确认升级重点是后训练 Scaling,而非更换基座模型。

注:时间轴按公开披露的事件顺序排列;8月3日页面短暂上线属于发布前信号,不等同于正式发布。

此前的意外曝光曾带动智谱股价当天上涨超过 8%,一周后,高盛上调智谱收入预期 35%。但这组市场反应只能说明外界对产品更新有预期,不能替代模型能力本身的验证。

02为什么可信?先看 GLM-5.2 的起点

要判断 GLM-5.3 的增量,不能只看新版本发布时的宣传语。GLM-5.2 已经建立了一个相当高的比较基线:它不是从普通开源模型起跑,而是此前国产开源阵营中表现最靠前的模型之一。

观察维度 GLM-5.2已披露表现 这意味着什么
模型结构 MoE,总参数约7530亿 具备较大的专家容量,但不能直接等同于实际任务能力。
上下文窗口 100万 token 适合处理长文档、大型代码库和多文件任务。
综合能力 51分 在独立模型智能指数中达到开源模型最佳水平。
全球位置 综合第3 编程能力排名第4,智能体能力排名第2。

注:表内信息来自原报道对多项公开评测与研报的整理;不同评测的分数体系不同,不应横向相加。

因此,GLM-5.3 的问题不是“能不能从零进入第一梯队”,而是:在已经很强的模型上,继续训练是否还能带来可观回报? 目前披露的结果给出了肯定答案,但答案主要集中在代码与安全等高复杂度场景。

03它能做什么?从写代码转向推进项目

GLM-5.3 的编程升级,不只是单轮生成代码更准确。更关键的变化是,它开始更接近一个能够长期工作的工程执行者:理解任务目标、修改多个文件、反复运行验证,再根据反馈继续推进。

长程代码工程:接住数万行级别的复杂目标 体感提升50%

  • 据智谱 AI 方面披露,GLM-5.3 相比 GLM-5.2 的编程能力体感评测提升 50%
  • 在复杂任务中,需要同时处理数万行代码、上百个文件,以及多个相互依赖的系统模块。
  • 模型能够在较少人工干预下持续开发、运行测试并反复修正,目标不再只是输出一段“看起来正确”的代码。
判断:真正的进步不在单个函数的完成率,而在于能否把一个大目标推进到可交付状态。

公开基准:多个代码任务实现大幅跃升 开源模型第一

  • Terminal Bench 3.0:得分由 4.6 提升至 28.3
  • DeepSWE v1.1:得分由 46.2 提升至 66.9
  • Agents' Last Exam:得分由 23.8 提升至 28.5;在 GDPval-AA v2 中获得 1769 分。
判断:这些结果指向的是代码能力向专业任务执行能力的外溢,而不是单纯的代码补全。

思考档位:在质量、速度与成本之间调节 可控推理

  • 从 GLM-5.2 开始,模型引入 effort level,允许用户控制任务所投入的思考强度。
  • 在相近 Token 预算下,GLM-5.3 试图同时改善任务完成质量、执行速度和调用成本。
  • 这意味着模型不必对所有问题都使用最高强度,简单任务可以更快完成,复杂任务则保留更长的推理空间。
判断:模型能力开始从“最高分是多少”转向“能否按任务需要稳定分配计算资源”。

注:案例卡中的分数为公开披露结果,主观“体感提升”属于厂商方面表述,应与标准化基准分开阅读。

04安全能力为何突出?发现漏洞已接近顶尖,利用仍有距离

如果说编程能力是 GLM-5.3 的主线升级,那么网络安全能力更像是训练过程中涌现出的另一条支线。智谱给出的解释是:安全工作本质上是约束严格的编程能力

网络安全基准对比
GLM-5.3 GLM-5.2 前沿模型
CyberGym 白盒代码审查与漏洞验证
GLM-5.3
83.5%
GLM-5.2
77.2%
Mythos 5
83.8%
ExploitBench 漏洞成因理解与利用
GLM-5.3
54.4%
GLM-5.2
24.4%
Mythos 5
78.0%
ExploitGym 限定时间内完成漏洞利用任务数
GLM-5.3 · 2小时
105项
GLM-5.3 · 6小时
130项
Mythos 5 · 6小时
247项

注:百分比按各自测试满分归一化,ExploitGym按247项的最高展示值缩放;不同基准之间不能直接比较,条形只用于观察同一测试内的差距。

三项测试呈现出一条清晰边界:越靠近漏洞发现与验证的前端,GLM-5.3 越接近全球顶尖水平;越深入完整漏洞利用链,差距越明显。也就是说,“发现问题”已接近第一梯队,“证明问题并完成利用”仍未追平。

2404 联合安全团队发现的漏洞数量
1088 其中被标记为中高危的漏洞数量

注:案例披露称,部分漏洞最早可追溯至约40年前,涉及 Android、Windows、macOS 及应用软件。

05为什么能做到?答案是更长、更丰富的训练环境

GLM-5.3 的技术路径可以概括为:不急着把基座做得更大,而是把模型放进更复杂、更接近真实工作的任务环境里。官方披露的变化包括数十倍的长程任务环境、更丰富的环境类型,以及更长的后训练时间

01 · 目标

提出复杂任务

从代码、文档到安全环境,设置更接近真实工作的目标。

02 · 交互

持续调用工具

让模型在终端、文件、测试环境中持续行动,而非只回答一次。

03 · 反馈

反复验证修正

根据运行结果、错误信息和任务状态,形成长链路反馈。

04 · 交付

完成可验收结果

训练目标从“生成内容”转向“把任务推进到完成”。

注:流程图是对后训练 Scaling 逻辑的编辑化拆解,不代表模型内部唯一执行路径。

传统升级思路

更换或扩大基座,依靠参数规模与通用预训练获得能力增量。

GLM-5.3 的升级思路

基座保持不变,把更多计算投入长程任务、环境交互和后训练过程。

这也解释了为什么 GLM-5.3 的提升集中出现在编程和安全任务:这些任务天然拥有清晰的执行环境、可重复的反馈信号和相对明确的验收标准。后训练不是平均地提升所有能力,而是在特定任务链上把模型“磨得更深”。

06下一步看什么?三道尚未跨过的门槛

GLM-5.3 的成绩单足够漂亮,但它并没有解决大模型产品化的全部问题。尤其是当模型从“会做题”进入“能交付”阶段后,能力边界会变得更加具体。

问题 01

视觉能力何时补齐?

GLM-5.3 仍是纯文本模型,无法直接理解截图、表格和 UI 设计图。开发者对视觉能力的呼声,已经成为版本建议中的高频主题。

问题 02

深度漏洞利用怎么追?

CyberGym 已接近 Mythos 5,但 ExploitBench 和 ExploitGym 的差距仍大。发现、验证、修复之间,不能只完成第一步。

问题 03

能力如何变成收入?

政企与大客户集成是起点,但模型公司最终仍需在更广泛的商业场景中证明调用量、付费率和利润空间。

注:三张问题卡分别对应技术形态、安全深度与商业化,不是对产品优先级的官方排序。

商业化信号目前并不单一:智谱 2025 年全年总营收为 7.24亿元,国内排名前十的互联网公司中有 9家被披露已深度集成 GLM 系列模型;与此同时,高盛上调收入预期,却下调目标价并维持“中性”评级。

7.24亿 2025年全年总营收
9/10 头部互联网公司集成比例
+35% 收入预期上调幅度
中性 目标价下调后的评级

注:市场数据反映商业预期与估值态度,不能直接用来证明模型技术能力。

编辑核心判断

GLM-5.3 证明了后训练 Scaling 可以在不更换基座的情况下继续释放模型能力,但它还不是全能模型:编程已进入第一梯队,深度漏洞利用、视觉和商业化仍是决定下一阶段上限的三道门槛;大模型竞争的分水岭,正在从“谁的参数更多”转向“谁能把训练出来的能力稳定交付”。

如何获取

原报道未提供 GLM-5.3 的直接体验地址或公开 API 入口。实际调用方式、开放范围与服务价格,请以官方后续发布的模型公告和 API 文档为准。

入口状态等待官方公布具体体验与调用方式