7430亿参数旗舰模型发布并宣布两周内开源:编程、智能体与网安能力进入新一轮对比
8月14日,GLM-5.3正式亮相。它将编程与长任务交付作为主攻方向,同时把网络安全能力推到新的测试区间;模型计划在两周内完成安全评估与加固后开源。
8月14日,GLM-5.3正式亮相。它将编程与长任务交付作为主攻方向,同时把网络安全能力推到新的测试区间;模型计划在两周内完成安全评估与加固后开源。
GLM-5.3 的发布信息没有只强调参数规模,而是把比较重点放在“能否完成真实任务”上。公开披露显示,它在多项主流基准中位居已开源或即将开源模型前列,在编程、智能体与网络安全任务上,开始接近海外顶尖模型。
但“第一”需要拆开看。
发布方称 GLM-5.3 在多项主流基准中位列第一,但完整参评名单与统一分数表并未在报道中全部展开。
在编程与智能体任务上被描述为已经逼近海外顶尖模型,具体差距取决于任务与思考预算。
两者在编程和智能体领域各有优势,不是简单的全面碾压关系。
公开信息称 GLM-5.3 在绝大部分基准测试中领先,但不同版本与测试设置仍需单独核对。
注:上方是能力关系卡,不是统一分数刻度;“领先”“接近”均按公开披露口径呈现,不能直接换算为所有场景下的绝对排名。
比“综合第一”更容易复核的,是已经披露具体分数的安全基准。GLM-5.3 在白盒源代码安全测试 CyberGym 上拿到 84.5%,超过 GLM-5.2、Claude Mythos 5 与 GPT-5.6 Sol。
| 模型 | CyberGym | ExploitGym · 2小时 | 相对位置 |
|---|---|---|---|
| GLM-5.3 | 84.5% | 105项 | 本组基准领先 |
| GLM-5.2 | 77.2% | 29项 | 后训练前版本 |
| Claude Mythos 5 | 83.8% | 181项 | ExploitGym领先 |
| GPT-5.6 Sol | 83.6% | 未披露 | CyberGym接近 |
GLM-5.3 准确率;Claude Opus 4.8 为 29.5%。
不到 Claude Opus 4.8 平均输出量的一半。
注:CyberGym 与 ExploitGym 测试对象不同,前者偏白盒代码审查,后者更接近完整漏洞利用;效率数据来自公开披露,报道未给出对应任务集的完整定义。
这组数据传递出的重点不是“输出越长越强”,而是在受控思考预算下,用更少的输出完成更多有效工作。对实际使用者而言,token 效率最终会同时影响响应速度、调用成本与长任务的可持续性。
基准分数解决的是横向比较,真实项目则要面对数据不完整、需求有陷阱、代码会出错等连续问题。GLM-5.3 搭配 ZCode 的两次实测,分别考察了从零创造与陌生系统改造。
注:案例中的代码行数、文件数量、测试结果均为实测记录;它们证明的是特定环境下的任务完成能力,不等同于所有项目都能一次交付。
GLM-5.3 的网络安全表现并非单纯来自更大的参数规模。公开技术说明称,它的基座模型与 GLM-5.2 保持一致,主要通过更长任务环境、更丰富环境类型与更长后训练过程提升能力。
CyberGym 得分 84.5%,高于 GLM-5.2 的 77.2%、Claude Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。
在 ExploitGym 两小时测试中,GLM-5.3 完成 105 项任务,达到 Claude Mythos 5 完成 181 项的约 58%;相比 GLM-5.2 的 29 项已有明显提升。
联合高校与安全团队开展两周评估,发现经初筛、去重后的漏洞 2436 个,其中 1097 个为中高危,涉及 269 个项目,最早可追溯至约 45 年前。
注:漏洞数量是安全评估产出,不代表模型自身“造成”了这些漏洞;模型开源前仍需完成安全加固,以保留防御价值并限制潜在攻击用途。
如果 GLM-5.3 与上一代使用相同基座,那么能力跃迁从何而来?答案更接近后训练 Scaling:不只增加训练样本,而是把模型放进更长、更复杂、更接近真实工作的任务环境里反复训练。
面对大仓库,先分派子任务,再汇总、回查与验证。
通过探针、脚本、像素统计等方式补足不可直接观察的反馈。
引入 effort level,在完成质量、速度与 token 消耗之间调节。
注:这条链路解释的是公开披露的训练方向与实测现象,不意味着后训练可以替代数据质量、工具链和产品工程。
从产品形态看,模型已经上线 ZCode、AutoClaw,并通过 GLM Coding Plan 提供使用;同时在多个 AI 编程与效率工具中开放抢先体验。API 预计随后上线,开源则要等安全评估与加固完成。
两次实测都说明,GLM-5.3 已经能在真实工程现场交付相当完整的结果。但“能交付”与“无需监督”之间仍有距离,尤其是在产品审美与长任务交互上。
因此,现阶段更准确的使用方式不是把它当作“自动外包团队”,而是把它放进有明确验收标准、可回滚、能持续反馈的开发流程里。它擅长把模糊任务拆成可执行步骤,但最终交付是否好看、是否符合产品语境,仍需要人来判断。
GLM-5.3 的真正升级,不是把模型从“会写代码”推到“更会写代码”,而是把后训练变成一套持续操练真实任务的工程系统;下一轮模型竞争,胜负将更多取决于谁能把任务环境、工具反馈与安全边界做得更完整。
GLM-5.3 已在 ZCode、AutoClaw 及 GLM Coding Plan 等入口提供体验,API 将随后上线;模型开源需等待安全评估与加固完成。