🧠 大模型 · 深度实测

GLM-5.3 发布实测:编码提升 50%、网安登顶开源第一,五个场景却测出判若两人

智谱发布 GLM-5.3 大模型。它与 GLM-5.2 共用同一基座,所有提升全部来自后训练。官方给出两项硬指标:编码能力提升约 50%,漏洞挖掘基准 CyberGym 得分 84.5%、登顶开源权重第一。我们横跨五个场景独立实测后,得到的结论比数据更有意思——同一个模型,表现得像两个 AI

来源:公开信息整理 全文约 4 分钟读完
#智谱GLM-5.3 #后训练 #网络安全 #大模型实测
84.5% CyberGym 漏洞发现 · 开源权重第一
54.4% ExploitBench 得分 · 前代 2.2 倍
38 完成静态安全审计 · 零误报

⚡ 30 秒速览

  • 赢在哪:与 GLM-5.2 共用同一基座,所有提升全靠后训练——编码能力提升约 50%,网安能力「意外涌现」。
  • 数据多硬:CyberGym 84.5% 登顶开源权重第一,ExploitBench 54.4% 是前代的 2.2 倍。
  • 实测反转:同一个模型,简洁 Prompt 交付「及格线」成品,详细 Prompt 直接惊艳全场。
  • 网安天赋:38 秒静态审计零误报,清洗过构建产物的 CVE 复现仍被它一眼认出。
  • 双刃剑:两周后即将开源——最强能力是把双刃剑,需要全行业盯紧。

01这次发布,特殊在哪? 同一个基座,全靠后训练

智谱这次发布 GLM-5.3,最大的新闻点不在「又一个新模型」,而在它的成长方式

它与 GLM-5.2 共用同一个基座,所有提升全部来自后训练——即在模型初步训练完成后,再用大量强化学习针对性地打磨一遍。

GLM-5.2

同一基座的「素颜」状态,基线表现。编码与安全能力均处于常规水平。

GLM-5.3

后训练打磨后:编码能力提升约 50%,网络安全能力「意外涌现」。

两者共用同一基座模型——换言之,这次的全部差异,都来自后训练阶段的数据与强化学习策略。

官方博客的原话是:「随着后训练规模的扩大,网络能力的发展速度超过了我们的预期。」

翻译一下——本来只想让它更会写代码,结果它自己长出了找漏洞的天赋。

50%编码能力提升
84.5%CyberGym 漏洞发现
54.4%ExploitBench 漏洞利用
2436真实代码库漏洞

四项数据来自官方发布。其中 ExploitBench 54.4% 是前代 24.4% 的两倍多,也是五项里涨幅最大的一项。

02数据到底有多硬? CyberGym 开源第一,压过闭源

先看漏洞发现基准 CyberGym。GLM-5.3 拿到的 84.5% 不只是开源权重第一,也压过了两个闭源对手。

🥇 GLM-5.3智谱 · 开源权重
84.5
Mythos 5闭源
83.8
GPT-5.6 Sol闭源
83.6
GLM-5.2智谱 · 前代开源
77.2

注:柱形为相对对比,非精确比例;榜首与第二名分差仅 0.7 个百分点。

除了基准测试,官方还披露了真实环境战果:用模型扫描真实代码库,累计发现 2436 个漏洞,覆盖 269 个项目,其中中高危漏洞 1097 个

🔓 真实代码库扫描:2436 个漏洞 · 覆盖 269 个项目 · 中高危 1097 个

到这里,数据已经足够硬。但真正的反转,发生在实测里。

03五场景实测:判若两人 能干活,但活干得很糙

数据是官方给的,好不好用得自己跑一遍。我们连着测了五个场景,结论是同一句话:这个模型的能力分布并不均匀。

💼 团队协作系统:从零搭建到端到端跑通 能跑,但糙

  • Flask + SQLite 任务协作系统,要求登录鉴权、任务增删改查、看板接口、统计接口与前端页面;首轮即跑通,接口测试全绿。
  • 但 UI 审美配不上「顶级模型」的招牌,页面粗糙;第二轮优化卡在验证环节,反复失败却不知换思路,只能手动终止。
基本功足够用,能独立把活干完;但应变能力不足——「陷进去,出不来」。

🧙「指环王」渲染基准:6 分半写完 727 行 6分半 vs 2小时

  • 复刻 Karpathy 同款题目:用 Three.js + 100 万 token 预算渲染《指环王》开场;GLM-5.3 只用了 6 分半,写完 727 行代码。
  • 对比:Opus 5 约 2 小时 / 5500 行,DeepSeek V4-Pro 用了 30 分钟——速度是碾压级的。
  • 但细节「一切从简」:树像一支支冰激凌,人物没有手脚,像一根根火腿肠。
速度碾压、质量妥协——快,是用质感换来的。

🏝️ 浮岛 3D 作品集:换了个问法,脱胎换骨 全程反转

  • 同题对比:Kimi K3 首次启动白屏、修复一次才起来;GPT-5.6 功能完整但点击物件时背景虚化。
  • GLM-5.3:npm install + npm run dev 一次跑通,无白屏。
  • 四个章节的滚动相机过渡、物件交互、移动端降级——全部实现,完成度直接可以拿去做作品集展示。
问题出在我们身上:前两个场景 Prompt 太简洁,它便敷衍;浮岛的 Prompt 详细到每一步,它便全力以赴。

🛡️ 网安双场景:38 秒 + 清洗 CVE 仍被认出 全场最佳

  • 静态审计:一段含三处预设漏洞的 Flask 代码(SQL 注入、反射型 XSS、路径穿越),仅用 38 秒全部命中,零误报,额外补出三处未预设风险。
  • CVE 复现:清洗 jar 包(抹掉时间戳、随机依赖名、删除构建元数据)后,仍从漏洞特征中匹配出 CVE-2022-22947,判断依据和漏洞原理写得明明白白。
  • 最后还主动给出修复建议——我们的 Prompt 里根本没提这项。
同一个模型,编码时「及格线」,安全时「专家级」——它在安全相关任务上明显更擅长、也更愿意主动。

04怎么发挥它的最大价值? 三个实测得出的结论

五个场景跑完,一个「看人下菜碟」的形象浮现出来。

你对它敷衍,它对你敷衍。

📝 需求别偷懒 Prompt 颗粒度直接决定产出质量——不是玄学,是五场景对比出来的结果。
🛡️ 网安放心交 静态审计 38 秒、清洗过的 CVE 产物也拦不住它,这是全场表现最好的领域。
⚖️ 接受偏科 别指望一个模型所有场景满分;它更像一个偏科的天才,挑它擅长的题做。

官方在博客里说了一句值得琢磨的话:「模型能力的提升,正在从『模型』转移到『环境』。」

意思是:现在的难点不在让模型更聪明,而在给它搭出足够接近真实工作的测试环境。这场测试恰好印证了这一点——环境的颗粒度不同,同一个模型交出的答卷天差地别。 —— 智谱官方博客 · 编辑转述

05比分数更值得盯的事 两周后,它就要开源

两周后,GLM-5.3 就要开源。

当编码与网安能力都排在前列的模型开放权重、人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器

这是 GLM-5.3 这轮发布最值得盯的问题——比它在 benchmark 上又涨了几分,重要得多。

编辑核心判断

后训练正在重塑模型的能力分布:同一个基座,不同的调教方向,可以长出完全不同的能力画像。GLM-5.3 的「偏科」不是缺陷,而是强化学习方向的必然结果。真正需要行业盯紧的,不是它偏科,而是它最强的那一科——两周后就要开源。

现在就能用

GLM-5.3 已上线智谱官方渠道,开源权重版本预计两周后发布。

关注智谱官方获取 API 与开源信息