GLM-5.3 编程能力提升 50%,满分通过 GPT-5.6 亲设的盲测
8 月 14 日,智谱正式发布 GLM-5.3。在 GPT-5.6 亲自设计、交由 ZCode 执行的五项工程盲测中,GLM-5.3 以 151 秒拿下 100 分满分,获评 A−。智谱内部 Code Bench 成绩较前代提高约 50%,网络安全能力出现超预期跃升。
8 月 14 日,智谱正式发布 GLM-5.3。在 GPT-5.6 亲自设计、交由 ZCode 执行的五项工程盲测中,GLM-5.3 以 151 秒拿下 100 分满分,获评 A−。智谱内部 Code Bench 成绩较前代提高约 50%,网络安全能力出现超预期跃升。
智谱做了一个大胆的测试:让 GPT-5.6 sol(最高推理档)设计一整套可直接交给 ZCode 执行的测试压缩包,总分 100 分,每项 20 分,覆盖五个维度。
整个测试期间,除了权限确认外,没有任何额外人工操作。
注:五项测试各 20 分,总分 100。GLM-5.3 在约 13 分钟内全部完成并满分通过;151 秒为模型纯执行耗时,不含文件操作与测试运行时间。
本次所有性能提升均来自后训练。GLM-5.3 的核心工作可以概括为一件事:在 GLM-5.2 已建成的技术栈上,继续 Scaling post-training。结果显示,即使基础模型保持不变,复杂代码、长程 Agent 任务和网络安全方向仍然出现明显提升。
但参数没变,能力怎么涨的?
「写一段代码」——短时、单步、规格清晰,离真实工程较远。
「独立承担一项工程工作」——部分任务对应一名有经验工程师数天的工作量。
以机器学习基础设施任务为例,模型获得与真实工程师类似的工作环境——计算集群、存储系统、内部文档、代码仓库和实验结果,需要自行诊断训练栈性能瓶颈、实现优化方案、运行实验,并最终在保证正确性的前提下实现可量化的端到端性能提升。
支撑这套训练的三大基础设施:IndexShare(高效长上下文处理)、SAO(长程任务强化学习)、slime(大规模异步训练框架)。其中 slime 的训练与 Rollout 路径数值对齐差异已控制在 10⁻⁷ 量级,长程 Coding RL 端到端训练吞吐提升超过 2.3 倍。
当前模型不仅要看「能不能完成任务」,还需要看为了完成任务消耗多少 Token 和算力。测试结果显示,GLM-5.3 不仅性能提高,完成任务所需输出 Token 也明显下降。
注:柱形自 20 分起缩放,非零起点,以突出分差对比。分数为智谱内部 Code Bench 端到端任务完成率,Token 为每项任务平均输出量。GLM-5.3 在 High effort 下用不到一半的 Token 超过了 Claude Opus 4.8 的成绩,但距 Claude Fable 5 仍有 5 个百分点差距。
GLM-5.3 此次最意外的变化来自网络安全。团队最初只是想提高模型寻找和分析漏洞的能力,但随着强化学习训练规模扩大,相关能力增长速度超过预期——模型不仅更擅长定位单个漏洞,还开始能跨越漏洞利用的多个阶段进行推理,形成相对完整的攻击利用链。
两个安全基准,一喜一忧。
GLM-5.3:84.5%
GLM-5.2:77.2% | GPT-5.6 Sol:83.6%
已超过 GPT-5.6
GLM-5.3:54.4%
GLM-5.2:24.4%(翻倍)
Claude Opus 4.8:78.0% | GPT-5.6:76.5%
仍有明显差距
智谱还将相关能力用于真实开源项目测试。自 GLM-5.2 以来,团队与中国多家安全团队合作,在真实代码库中运行模型。
注:2436 项发现中,53 项已公开披露,2383 项仍处于漏洞披露保护期。按严重程度:Critical 107 / High 990 / Medium 1286 / Low 53。智谱已建立 Security Disclosure Ledger 持续跟踪披露状态。
只依靠人工制作少量任务已经难以支撑强化学习继续扩展。为此,智谱建立了一套自动化环境生成流水线:
系统在不知道标准答案的情况下自动生成 Verifier,用于判断 Agent 最终是否完成任务。为了降低模型通过奖励漏洞「投机取巧」的风险,训练过程中还会分析 Solver 轨迹寻找 reward shortcut,并持续修补验证规则。
智谱坦言,这套流程目前仍然需要相当程度的人工参与,进一步提高环境生成和验证环节的自动化程度将是后续重点之一。
GLM-5.3 证明了「后训练 Scaling」是一条可行路径——基础模型不变,工程化训练环境与验证体系仍能释放巨大潜力。但盲测满分只是小型离线任务的局部胜利,真正的分水岭在于:谁能把自动化环境生成流水线的规模和真实性做到极致,谁就能在下一代 Agent 竞赛中拿到定义赛道的权力。
GLM-5.3 已向全部 GLM Coding Plan 用户开放,支持 ZCode、Claude Code、OpenCode 等 Coding Agent。模型权重将在约两周完成安全评估后正式公开。
访问 GLM Coding Plan → 立即体验