基座不变,复杂工程与安全能力跃升:GLM-5.3发布
8月14日,智谱 AI 发布新一代基座模型 GLM-5.3。它没有更换基座,却通过极致的后训练 Scaling,把能力重点推向了长程编程、复杂工程执行与网络安全任务。
注:Hero 只展示版本定位与核心边界;具体评测分数、任务表现和不足放在正文展开。
8月14日,智谱 AI 发布新一代基座模型 GLM-5.3。它没有更换基座,却通过极致的后训练 Scaling,把能力重点推向了长程编程、复杂工程执行与网络安全任务。
注:Hero 只展示版本定位与核心边界;具体评测分数、任务表现和不足放在正文展开。
过去几个月,大模型行业连续进入版本更新期。GLM-5.3 的特殊之处不在于重新训练了一个更大的基座,而在于它选择了一条更克制、也更难验证的路径:在既有基座上继续压榨任务执行能力。
这不是换发动机,而是把整套训练与执行系统重新调到更高转速。
混合专家架构,约7530亿参数,上下文窗口达到100万 token。
“ZCode for GLM-5.3”页面意外上线约一小时,引发市场快速反应。
官方确认升级重点是后训练 Scaling,而非更换基座模型。
注:时间轴按公开披露的事件顺序排列;8月3日页面短暂上线属于发布前信号,不等同于正式发布。
此前的意外曝光曾带动智谱股价当天上涨超过 8%,一周后,高盛上调智谱收入预期 35%。但这组市场反应只能说明外界对产品更新有预期,不能替代模型能力本身的验证。
要判断 GLM-5.3 的增量,不能只看新版本发布时的宣传语。GLM-5.2 已经建立了一个相当高的比较基线:它不是从普通开源模型起跑,而是此前国产开源阵营中表现最靠前的模型之一。
| 观察维度 | GLM-5.2已披露表现 | 这意味着什么 |
|---|---|---|
| 模型结构 | MoE,总参数约7530亿 | 具备较大的专家容量,但不能直接等同于实际任务能力。 |
| 上下文窗口 | 100万 token | 适合处理长文档、大型代码库和多文件任务。 |
| 综合能力 | 51分 | 在独立模型智能指数中达到开源模型最佳水平。 |
| 全球位置 | 综合第3 | 编程能力排名第4,智能体能力排名第2。 |
注:表内信息来自原报道对多项公开评测与研报的整理;不同评测的分数体系不同,不应横向相加。
因此,GLM-5.3 的问题不是“能不能从零进入第一梯队”,而是:在已经很强的模型上,继续训练是否还能带来可观回报? 目前披露的结果给出了肯定答案,但答案主要集中在代码与安全等高复杂度场景。
GLM-5.3 的编程升级,不只是单轮生成代码更准确。更关键的变化是,它开始更接近一个能够长期工作的工程执行者:理解任务目标、修改多个文件、反复运行验证,再根据反馈继续推进。
注:案例卡中的分数为公开披露结果,主观“体感提升”属于厂商方面表述,应与标准化基准分开阅读。
如果说编程能力是 GLM-5.3 的主线升级,那么网络安全能力更像是训练过程中涌现出的另一条支线。智谱给出的解释是:安全工作本质上是约束严格的编程能力。
注:百分比按各自测试满分归一化,ExploitGym按247项的最高展示值缩放;不同基准之间不能直接比较,条形只用于观察同一测试内的差距。
三项测试呈现出一条清晰边界:越靠近漏洞发现与验证的前端,GLM-5.3 越接近全球顶尖水平;越深入完整漏洞利用链,差距越明显。也就是说,“发现问题”已接近第一梯队,“证明问题并完成利用”仍未追平。
注:案例披露称,部分漏洞最早可追溯至约40年前,涉及 Android、Windows、macOS 及应用软件。
GLM-5.3 的技术路径可以概括为:不急着把基座做得更大,而是把模型放进更复杂、更接近真实工作的任务环境里。官方披露的变化包括数十倍的长程任务环境、更丰富的环境类型,以及更长的后训练时间。
从代码、文档到安全环境,设置更接近真实工作的目标。
让模型在终端、文件、测试环境中持续行动,而非只回答一次。
根据运行结果、错误信息和任务状态,形成长链路反馈。
训练目标从“生成内容”转向“把任务推进到完成”。
注:流程图是对后训练 Scaling 逻辑的编辑化拆解,不代表模型内部唯一执行路径。
更换或扩大基座,依靠参数规模与通用预训练获得能力增量。
基座保持不变,把更多计算投入长程任务、环境交互和后训练过程。
这也解释了为什么 GLM-5.3 的提升集中出现在编程和安全任务:这些任务天然拥有清晰的执行环境、可重复的反馈信号和相对明确的验收标准。后训练不是平均地提升所有能力,而是在特定任务链上把模型“磨得更深”。
GLM-5.3 的成绩单足够漂亮,但它并没有解决大模型产品化的全部问题。尤其是当模型从“会做题”进入“能交付”阶段后,能力边界会变得更加具体。
GLM-5.3 仍是纯文本模型,无法直接理解截图、表格和 UI 设计图。开发者对视觉能力的呼声,已经成为版本建议中的高频主题。
CyberGym 已接近 Mythos 5,但 ExploitBench 和 ExploitGym 的差距仍大。发现、验证、修复之间,不能只完成第一步。
政企与大客户集成是起点,但模型公司最终仍需在更广泛的商业场景中证明调用量、付费率和利润空间。
注:三张问题卡分别对应技术形态、安全深度与商业化,不是对产品优先级的官方排序。
商业化信号目前并不单一:智谱 2025 年全年总营收为 7.24亿元,国内排名前十的互联网公司中有 9家被披露已深度集成 GLM 系列模型;与此同时,高盛上调收入预期,却下调目标价并维持“中性”评级。
注:市场数据反映商业预期与估值态度,不能直接用来证明模型技术能力。
GLM-5.3 证明了后训练 Scaling 可以在不更换基座的情况下继续释放模型能力,但它还不是全能模型:编程已进入第一梯队,深度漏洞利用、视觉和商业化仍是决定下一阶段上限的三道门槛;大模型竞争的分水岭,正在从“谁的参数更多”转向“谁能把训练出来的能力稳定交付”。
原报道未提供 GLM-5.3 的直接体验地址或公开 API 入口。实际调用方式、开放范围与服务价格,请以官方后续发布的模型公告和 API 文档为准。