◈ 模型发布 · 开源倒计时

7430亿参数旗舰模型发布并宣布两周内开源:编程、智能体与网安能力进入新一轮对比

8月14日,GLM-5.3正式亮相。它将编程与长任务交付作为主攻方向,同时把网络安全能力推到新的测试区间;模型计划在两周内完成安全评估与加固后开源。

8月14日 旗舰模型发布 全文约 5 分钟读完
#GLM-5.3 #AI编程 #智能体 #网络安全
7430亿 模型参数规模
2周内 完成安全评估后开源
5 单任务平均输出 token 左右

⚡ 30 秒速览

  • 发生了什么:7430亿参数的 GLM-5.3 发布,主打编程与智能体任务,并宣布两周内开源。
  • 能力位置:按公开披露口径,它位居已开源或即将开源模型综合表现前列;与 Kimi K3 在编程、智能体领域互有胜负。
  • 真实交付:实测中完成了基于真实地图数据的上海外滩区域 3D 驾驶游戏,并读懂超过 7000 个文件的陌生代码仓库。
  • 安全增量:CyberGym 得分 84.5%,两周红队测试发现 2436 个去重后漏洞,其中 1097 个为中高危。
  • 别忽略短板:审美判断仍需人工打磨,长任务反馈不足,低风险修改有时会带来额外测试与 token 消耗。

01先看结果:它把竞争线抬到了哪里

GLM-5.3 的发布信息没有只强调参数规模,而是把比较重点放在“能否完成真实任务”上。公开披露显示,它在多项主流基准中位居已开源或即将开源模型前列,在编程、智能体与网络安全任务上,开始接近海外顶尖模型。

但“第一”需要拆开看。

综合口径

已开源 / 即将开源模型

发布方称 GLM-5.3 在多项主流基准中位列第一,但完整参评名单与统一分数表并未在报道中全部展开。

接近

Claude Fable 5、GPT-5.6 Sol

在编程与智能体任务上被描述为已经逼近海外顶尖模型,具体差距取决于任务与思考预算。

互有胜负

Kimi K3

两者在编程和智能体领域各有优势,不是简单的全面碾压关系。

多数领先

DeepSeek-V4-Pro-0813

公开信息称 GLM-5.3 在绝大部分基准测试中领先,但不同版本与测试设置仍需单独核对。

注:上方是能力关系卡,不是统一分数刻度;“领先”“接近”均按公开披露口径呈现,不能直接换算为所有场景下的绝对排名。

02为什么可信:可核对的基准与效率

比“综合第一”更容易复核的,是已经披露具体分数的安全基准。GLM-5.3 在白盒源代码安全测试 CyberGym 上拿到 84.5%,超过 GLM-5.2、Claude Mythos 5 与 GPT-5.6 Sol。

模型 CyberGym ExploitGym · 2小时 相对位置
GLM-5.3 84.5% 105项 本组基准领先
GLM-5.2 77.2% 29项 后训练前版本
Claude Mythos 5 83.8% 181项 ExploitGym领先
GPT-5.6 Sol 83.6% 未披露 CyberGym接近

相同高档位思考预算

31.5%

GLM-5.3 准确率;Claude Opus 4.8 为 29.5%。

任务平均输出

≈ 5万 token

不到 Claude Opus 4.8 平均输出量的一半。

注:CyberGym 与 ExploitGym 测试对象不同,前者偏白盒代码审查,后者更接近完整漏洞利用;效率数据来自公开披露,报道未给出对应任务集的完整定义。

这组数据传递出的重点不是“输出越长越强”,而是在受控思考预算下,用更少的输出完成更多有效工作。对实际使用者而言,token 效率最终会同时影响响应速度、调用成本与长任务的可持续性。

03真实开发:从地图游戏到陌生仓库

基准分数解决的是横向比较,真实项目则要面对数据不完整、需求有陷阱、代码会出错等连续问题。GLM-5.3 搭配 ZCode 的两次实测,分别考察了从零创造陌生系统改造

🗺️ 用真实地图数据复刻上海外滩区域约4900行代码

  • 从 Overpass API 拉取8万多个 OSM 节点,先验证数据形态,再开始地图解析、坐标转换与游戏逻辑开发。
  • 最终交付 3D 开放世界驾驶游戏,覆盖数据管线、车辆物理、音效、导航、昼夜循环与存档系统。
  • 需求中埋入“凌晨两点至四点建筑灯光熄灭一半”“地图边缘设置软性阻挡”两条陷阱条款,最终验收全部通过
  • 面对画面无法直接目检的问题,模型自行编写零依赖 PNG 解码器,用像素统计验证水面、标线与夜间灯光是否正确渲染。
  • 针对相机穿模问题,它统计 6300 多栋建筑,定位出约四成轮廓环绕方向与墙面法线约定相反,最终只修改了几行代码。
交付判断:排查路径比“不断改代码”更有价值——先加请求探针,再通过面包屑日志定位问题,体现出较强的工程诊断意识。

🧩 读懂超7000个文件,开发“人格插件”零侵入改造

  • 面对 40 多个顶层包、200 多个工作区项目、7400 多个文件的 DeepSeek Harness 仓库,测试设定为零先验理解
  • 模型派出 4 个并行探索子智能体,分别追查 CLI 入口、插件机制、模型契约与消息通路,再汇总成链路报告。
  • 准确定位插件依赖 YAML 清单逐行登记、模型提供方共同遵循 LlmAdapter 契约,启动失败策略为快速失败。
  • 在不改变原有行为的前提下,新增文言文、东北话与猫语三种人格切换;初版涉及 20 个文件,净增 560 行。
  • 11 条单元测试一次通过;全量回归中 771 个测试文件有 6 个失败,模型撤回改动后确认失败来自本机环境,而非新增代码。
  • 后续复用既有命令机制接入网页端,28 项文档门禁与 937 对双语文档检查全部通过。
交付判断:长板集中在任务拆解、跨包溯源、代码引用与规范遵循;但 3 个探索子智能体合计消耗约 690 万 token,复杂任务的成本仍需关注。

注:案例中的代码行数、文件数量、测试结果均为实测记录;它们证明的是特定环境下的任务完成能力,不等同于所有项目都能一次交付。

04网安能力:后训练带来的意外增量

GLM-5.3 的网络安全表现并非单纯来自更大的参数规模。公开技术说明称,它的基座模型与 GLM-5.2 保持一致,主要通过更长任务环境、更丰富环境类型与更长后训练过程提升能力。

84.5% CyberGym 得分
105项 ExploitGym · 2小时
2436个 两周发现漏洞

白盒代码审查:超过旧版本与两款海外模型

CyberGym 得分 84.5%,高于 GLM-5.2 的 77.2%、Claude Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。

完整漏洞利用:差距缩小,但仍未全面领先

在 ExploitGym 两小时测试中,GLM-5.3 完成 105 项任务,达到 Claude Mythos 5 完成 181 项的约 58%;相比 GLM-5.2 的 29 项已有明显提升。

发布前红队测试:先发现,再限制攻击能力

联合高校与安全团队开展两周评估,发现经初筛、去重后的漏洞 2436 个,其中 1097 个为中高危,涉及 269 个项目,最早可追溯至约 45 年前。

注:漏洞数量是安全评估产出,不代表模型自身“造成”了这些漏洞;模型开源前仍需完成安全加固,以保留防御价值并限制潜在攻击用途。

05为什么能做到:基座不变,任务环境变了

如果 GLM-5.3 与上一代使用相同基座,那么能力跃迁从何而来?答案更接近后训练 Scaling:不只增加训练样本,而是把模型放进更长、更复杂、更接近真实工作的任务环境里反复训练。

能力提升链路
同一基座 GLM-5.2 → GLM-5.3
环境变长 覆盖连续任务
类型变多 代码、工具、安全
能力涌现 交付与网安提升
任务拆解

面对大仓库,先分派子任务,再汇总、回查与验证。

工具调用

通过探针、脚本、像素统计等方式补足不可直接观察的反馈。

成本控制

引入 effort level,在完成质量、速度与 token 消耗之间调节。

注:这条链路解释的是公开披露的训练方向与实测现象,不意味着后训练可以替代数据质量、工具链和产品工程。

从产品形态看,模型已经上线 ZCode、AutoClaw,并通过 GLM Coding Plan 提供使用;同时在多个 AI 编程与效率工具中开放抢先体验。API 预计随后上线,开源则要等安全评估与加固完成。

06一个诚实的注脚:强交付不等于全自动

两次实测都说明,GLM-5.3 已经能在真实工程现场交付相当完整的结果。但“能交付”与“无需监督”之间仍有距离,尤其是在产品审美与长任务交互上。

审美:建筑贴图与道路标线经过四轮反馈仍显简陋 反馈:长任务期间状态提示不足,容易被误认为中断 成本:低风险修改也可能执行完整测试链 监督:用户仍需参与验收与细节打磨

因此,现阶段更准确的使用方式不是把它当作“自动外包团队”,而是把它放进有明确验收标准、可回滚、能持续反馈的开发流程里。它擅长把模糊任务拆成可执行步骤,但最终交付是否好看、是否符合产品语境,仍需要人来判断。

编辑核心判断

GLM-5.3 的真正升级,不是把模型从“会写代码”推到“更会写代码”,而是把后训练变成一套持续操练真实任务的工程系统;下一轮模型竞争,胜负将更多取决于谁能把任务环境、工具反馈与安全边界做得更完整。

现在可以怎么用

GLM-5.3 已在 ZCode、AutoClaw 及 GLM Coding Plan 等入口提供体验,API 将随后上线;模型开源需等待安全评估与加固完成。

体验地址:zcode.z.ai/en

进入 ZCode → 开始体验