🧑‍💻 模型 · 技术突破

GLM-5.3 编程能力提升 50%,满分通过 GPT-5.6 亲设的盲测

8 月 14 日,智谱正式发布 GLM-5.3。在 GPT-5.6 亲自设计、交由 ZCode 执行的五项工程盲测中,GLM-5.3 以 151 秒拿下 100 分满分,获评 A−。智谱内部 Code Bench 成绩较前代提高约 50%,网络安全能力出现超预期跃升。

综合公开信息整理 2025-08-14 全文约 4 分钟读完
#GLM-5.3 #智谱AI #代码评测 #网络安全
100 GPT-5.6 亲设 5 项盲测 · 满分通过
50% 内部 Code Bench 成绩提升幅度
151 完成全部 5 项小型离线工程测试

⚡ 30 秒速览

  • AI 测 AI:让 GPT-5.6 设计测试包,GLM-5.3 在 ZCode 中执行,五项全满分,GPT-5.6 评其为 A− 级。
  • 提升来源:全部来自后训练 Scaling,基础模型未变,长程强化学习训练栈持续扩大规模。
  • 效率跃升:Max effort 下用 7.5 万 Token 拿 34.5%,前代需 9.6 万 Token 仅得 23.4%。
  • 安全意外:CyberGym 得分 84.5% 超过 GPT-5.6;ExploitBench 从 24.4% 跃至 54.4%,但仍有差距。
  • 真实战果:已在 269 个开源项目中发现 2436 个漏洞,含 1097 个高危及严重漏洞。
  • 获取方式:已向全部 GLM Coding Plan 用户开放,支持 ZCode、Claude Code 等 Agent。

01让最强模型出题,自己答题 GPT-5.6 亲设盲测

智谱做了一个大胆的测试:让 GPT-5.6 sol(最高推理档)设计一整套可直接交给 ZCode 执行的测试压缩包,总分 100 分,每项 20 分,覆盖五个维度。

整个测试期间,除了权限确认外,没有任何额外人工操作。

20推理强度 / JSON 遵循 / 延迟与令牌消耗
20算法代码生成(510 项测试)
20小型仓库缺陷修复
20多轮工具调用(库存/超卖)
20受控安全审计

注:五项测试各 20 分,总分 100。GLM-5.3 在约 13 分钟内全部完成并满分通过;151 秒为模型纯执行耗时,不含文件操作与测试运行时间。

🧪 GPT-5.6 的评审结论评级 A−

  • 不只是写代码:理解了任务中的原子性、确定性、异常语义和安全边界。
  • 没有作弊:实现方式符合常规工程写法,没有为测试硬编码答案。
  • 自我审查靠谱:报告中指出的风险与实际代码基本一致。
  • 效率不错:151 秒完成 5 项任务,作为小型离线工程测试表现良好。
⚠️ 诚实注脚:测试仅覆盖小型、单文件、规格清晰的 Python 问题,未涉及跨语言、并发、数据库、前端、编译系统、模糊需求或长上下文等真实大型仓库复杂度场景。

02能力从何而来?全部来自后训练 Scaling

本次所有性能提升均来自后训练。GLM-5.3 的核心工作可以概括为一件事:在 GLM-5.2 已建成的技术栈上,继续 Scaling post-training。结果显示,即使基础模型保持不变,复杂代码、长程 Agent 任务和网络安全方向仍然出现明显提升。

但参数没变,能力怎么涨的?

传统训练任务

「写一段代码」——短时、单步、规格清晰,离真实工程较远。

GLM-5.3 训练环境

「独立承担一项工程工作」——部分任务对应一名有经验工程师数天的工作量。

以机器学习基础设施任务为例,模型获得与真实工程师类似的工作环境——计算集群、存储系统、内部文档、代码仓库和实验结果,需要自行诊断训练栈性能瓶颈、实现优化方案、运行实验,并最终在保证正确性的前提下实现可量化的端到端性能提升。

支撑这套训练的三大基础设施:IndexShare(高效长上下文处理)、SAO(长程任务强化学习)、slime(大规模异步训练框架)。其中 slime 的训练与 Rollout 路径数值对齐差异已控制在 10⁻⁷ 量级,长程 Coding RL 端到端训练吞吐提升超过 2.3 倍

03Token 更少,得分更高 效率与能力的双重跃升

当前模型不仅要看「能不能完成任务」,还需要看为了完成任务消耗多少 Token 和算力。测试结果显示,GLM-5.3 不仅性能提高,完成任务所需输出 Token 也明显下降。

GLM-5.3(Max effort)7.5 万 Token · 智谱
34.5
Claude Fable 5(Max)参考 · Anthropic
39.5
GLM-5.3(High effort)5 万 Token · 智谱
31.4
Claude Opus 4.8(High)12 万 Token · Anthropic
29.5
GLM-5.2(Max effort)9.6 万 Token · 智谱
23.4

注:柱形自 20 分起缩放,非零起点,以突出分差对比。分数为智谱内部 Code Bench 端到端任务完成率,Token 为每项任务平均输出量。GLM-5.3 在 High effort 下用不到一半的 Token 超过了 Claude Opus 4.8 的成绩,但距 Claude Fable 5 仍有 5 个百分点差距。

04意外跃升的安全能力 从找漏洞到构建完整攻击链

GLM-5.3 此次最意外的变化来自网络安全。团队最初只是想提高模型寻找和分析漏洞的能力,但随着强化学习训练规模扩大,相关能力增长速度超过预期——模型不仅更擅长定位单个漏洞,还开始能跨越漏洞利用的多个阶段进行推理,形成相对完整的攻击利用链。

两个安全基准,一喜一忧。

CyberGym · 白盒源码审计

GLM-5.3:84.5%
GLM-5.2:77.2%  |  GPT-5.6 Sol:83.6%
已超过 GPT-5.6

ExploitBench · 真实漏洞利用推理

GLM-5.3:54.4%
GLM-5.2:24.4%(翻倍)
Claude Opus 4.8:78.0%  |  GPT-5.6:76.5%
仍有明显差距

智谱还将相关能力用于真实开源项目测试。自 GLM-5.2 以来,团队与中国多家安全团队合作,在真实代码库中运行模型。

2436 已发现漏洞总数(经专家复核、筛选、去重)
269 覆盖开源项目,含内核、OS、浏览器引擎等
1097 高危及严重漏洞,含 107 项 Critical
26.6 漏洞平均存在时间,最早可追溯至 1981 年

注:2436 项发现中,53 项已公开披露,2383 项仍处于漏洞披露保护期。按严重程度:Critical 107 / High 990 / Medium 1286 / Low 53。智谱已建立 Security Disclosure Ledger 持续跟踪披露状态。

05自动化环境生成流水线 让强化学习持续扩展

只依靠人工制作少量任务已经难以支撑强化学习继续扩展。为此,智谱建立了一套自动化环境生成流水线:

Research Agent 收集真实任务模式转化为可执行长程环境Judge Agent 验证可解性自动生成 Verifier分析 Solver 轨迹修补奖励漏洞

系统在不知道标准答案的情况下自动生成 Verifier,用于判断 Agent 最终是否完成任务。为了降低模型通过奖励漏洞「投机取巧」的风险,训练过程中还会分析 Solver 轨迹寻找 reward shortcut,并持续修补验证规则。

智谱坦言,这套流程目前仍然需要相当程度的人工参与,进一步提高环境生成和验证环节的自动化程度将是后续重点之一。

编辑核心判断

GLM-5.3 证明了「后训练 Scaling」是一条可行路径——基础模型不变,工程化训练环境与验证体系仍能释放巨大潜力。但盲测满分只是小型离线任务的局部胜利,真正的分水岭在于:谁能把自动化环境生成流水线的规模和真实性做到极致,谁就能在下一代 Agent 竞赛中拿到定义赛道的权力。

现在就能用

GLM-5.3 已向全部 GLM Coding Plan 用户开放,支持 ZCode、Claude Code、OpenCode 等 Coding Agent。模型权重将在约两周完成安全评估后正式公开。

访问 GLM Coding Plan → 立即体验