GLM-5.3 来了:底座没换,编程暴涨 50%,还顺手揪出潜伏 40 年的世界级漏洞

智谱 GLM-5.3 后训练技术 安全模型
核心论点

智谱通过极致的后训练技术体系(IndexShare、SAO、Slime),在基座模型未变的情况下,使GLM-5.3编程能力暴涨50%,并成为最强安全模型,挖掘出包括一个40年历史DNS漏洞在内的2436个漏洞,证明后训练是预训练红利见顶后的新增长曲线。

多种基准下模型能力对比
Terminal-Bench 3.0 真实终端环境复杂操作
↑4.6 28.3
33.7
GLM-5.3 逼近 Fable 5 差距 5.4 分
DeepSWE v1.1 长程软件工程评测
↑46.2 66.9
69.7
GLM-5.3 逼近 Fable 5 差距 2.8 分,与 Kimi K3 差距 0.6 分
Z.ai Code Bench High 真实开发环境模拟
31.4%
29.5%
▲ 反超 Claude Opus 4.8 ⚡ Token 效率节省一半(5万 vs 12万)
Agents' Last Exam 反超 Fable 5
GDPval-AA v2 全球第一
1 编程能力:全面逼近 Claude Fable 5,部分反超
28.3
Terminal-Bench 3.0 得分
真实终端环境复杂操作评测
GLM-5.3 得分从 4.6 跃升至 28.3,逼近 Fable 5 的 33.7
66.9
DeepSWE v1.1 得分
长程软件工程评测
从 46.2 提升至 66.9,距离 Fable 5 仅差 2.8 分
31.4%
Z.ai Code Bench High 档准确率
真实开发环境模拟
高于 Claude Opus 4.8 的 29.5%,Token 效率节省一半
反超 + 全球第一
Agents' Last Exam / GDPval-AA v2
两项关键评测
Agents' Last Exam 反超 Fable 5,GDPval-AA v2 拿下全球第一
智谱通过一比一复刻大厂专家完整工作流(计算集群、存储、文档、代码库),让模型在真实环境端到端实操,学会自主发现 Bug、推导分析、验证闭环。
2 安全能力:最强安全模型,挖掘 2436 个漏洞,包括 40 年 DNS 漏洞
2436
累计挖掘漏洞数
中高危漏洞 1097 个
从 GLM-5.2 发布以来,在 269 个开源和商业项目中累计挖出,部分漏洞潜伏 40 多年
18567 封
拦截的 AI 攻击规模
AI Agent "Neo" 攻击事件
两个月内管理 4 台黑客服务器、7 个恶意域名、6 万个邮箱、100+ 攻击脚本
超 1000 万处
DNS 协议漏洞影响范围
互联网底层基建设计缺陷
攻击者通过少量特殊请求放大服务器压力近 8 万倍,可瘫痪全球超 1000 万处公网 DNS 服务
纵深防御
三层风险审查系统
轻量级分类 + 推理监控 + 深度对齐
根据意图和语境风险分级,拦截高危漏洞利用同时放行正常安全防护
对于防守方而言,最好的安全,事故没有发生。
—— 安全圈流传
GLM-5.3 搭建了"纵深防御"风险审查系统:三层防线——轻量级分类模型、推理监控器、深度安全对齐,根据意图和语境风险分级,拦截高危漏洞利用同时放行正常安全防护。
3 技术揭秘:IndexShare、SAO、Slime,后训练三大支柱
IndexShare
2.9 倍
FLOPs 降低
每 4 层共享轻量级 Indexer,1M 上下文下单位 Token FLOPs 降低 2.9 倍,长程强化学习成本可接受
SAO
超过 1000 步
连续训练步数
单轨迹级异步训练,传统方法仅 160 步,解决长程任务训练崩溃问题
Slime
2-3 天
训练时间
训推分离流水线,千亿参数模型强化学习从数周缩短到 2-3 天,快速试错迭代
当预训练参数红利见顶,后训练成为新增长曲线。智谱通过 IndexShare、SAO、Slime 分别从算力成本、算法稳定性、工程规模化定义后训练效率天花板。
编辑判断

GLM-5.3 的发布标志着大模型行业从参数竞赛转向后训练深水区。智谱通过 IndexShare、SAO、Slime 三大技术,在基座模型不变的情况下实现编程和安全能力的飞跃,并挖掘出互联网底层 DNS 协议 40 年历史漏洞,展示了后训练的价值。同时,安全能力成为差异化亮点,尤其是在对抗 AI Agent 攻击和防御大规模漏洞利用方面,GLM-5.3 树立了开源模型的安全标杆。

结论

GLM-5.3 验证了后训练的潜力:当预训练红利消退,极致后训练可以释放巨大能量。智谱不仅在编程能力上逼近顶尖闭源模型,更在安全领域完成从防守到进攻的跨越,甚至参与国家级漏洞修复。这一案例为行业提供了有效的后训练技术路线,也预示着 2026 年大模型竞争将围绕后训练效率与安全能力展开。

后训练是预训练红利见顶后的新增长曲线,GLM-5.3 证明了这条路径的可行性。
综合公开信息整理