🛡️ AI 安全 · 榜单速递

国产安全智能体杀进全球前四,纯国产底座反超 OpenAI、Anthropic

7 月 29 日,深信服公布其 AI 安全智能体 Sangfor AI 在全球代码安全靶场 CyberGym 的最新成绩:基于纯国产大模型 GLM-5.2 底座,面对 1507 项真实漏洞挑战,成功完成 1301 项,整体成功率 86.3%,跻身全球前四、国内第一,实现对两大海外 AI 巨头的成绩反超。

来源:企业通稿 2026-07-29 全文约 3 分钟读完
#深信服 #Sangfor AI #CyberGym #AI 安全
🥇 全球第 4 国内参评团队第一,反超 OpenAI 与 Anthropic
86.3% 1507 项挑战任务整体成功率
1301 基于纯国产 GLM-5.2 底座成功完成

⚡ 30 秒速览

  • 赢在哪里:在 CyberGym 代码安全靶场中,以 86.3% 成功率位列全球第四、国内第一,超越 OpenAI 与 Anthropic 两大巨头。
  • 底座纯国产:固定基于智源 GLM-5.2 大模型,未依赖海外闭源模型,验证国产底座在复杂代码对抗场景的实战能力。
  • 考题有多硬:1507 项挑战取自 ARVO 与 OSS-Fuzz 真实历史高危漏洞,要求智能体自主完成源码分析、漏洞推演、复现与 PoC 验证全链路。
  • 技术架构:采用「智能体群体协同作战」,引入「证据管治」机制,以「有界探索 + 证据持久化 + 动态裁决 + 对抗式评审」四步压低误判。
  • 落地去向:能力已开始赋能深信服产品体系,推动传统静态应用安全测试(SAST)向具备自主推理的安全 Agent 升级。

01CyberGym 总榜 全球前四 · 国内第一

🥇 领先团队 1海外头部厂商
~88+
领先团队 2海外头部厂商
~86+
领先团队 3海外头部厂商
~86
🥉 Sangfor AI深信服 / GLM-5.2 底座
86.3
OpenAI 参评系统海外巨头
被反超
Anthropic 参评系统海外巨头
被反超

注:官方通稿未披露前三名及被反超海外团队的确切分数,图中位置与相对关系依据通稿「跻身全球前四、超越两大巨头」表述还原,非精确分差;榜首与 Sangfor AI 的具体差距以 CyberGym 官网实时榜单为准。

02CyberGym:考的是最难作假的漏洞挖掘

CyberGym 是目前全球含金量较高的代码安全大模型实战靶场。它与 MMLU、SWE-bench 等传统基准的区别非常直接:

传统静态理论测试

考「模型知不知道漏洞长什么样」——答题式评测,与现实工业场景距离较远。

CyberGym 实战靶场

考「智能体能不能把漏洞挖出来、复现并验证」——贴合工业真实场景。

1507漏洞挑战任务
87.2%ARVO 任务成功率
77.7%OSS-Fuzz 任务成功率

考题来源:ARVO 与 OSS-Fuzz 海量开源软件历史高危漏洞。考核链路:自主源码分析 → 多阶段漏洞推演 → 漏洞复现 → PoC 验证。评测标准严苛,结果具备较强行业参考价值。

更关键的一点:Sangfor AI 本次是在固定使用国产大模型 GLM-5.2 的配置下取得该成绩——这意味着,在安全智能体这条赛道上,系统工程架构的协同能力正在成为比单纯模型参数更重要的胜负手。

03怎么做到的?智能体群体协同 + 证据管治

深信服方面介绍,为解决漏洞挖掘中长链路推理、多假设探索和持续验证等问题,Sangfor AI 采用「智能体群体协同作战」架构,并引入「证据管治」机制。技术团队将其总结为:「以假设拓展探索,以证据裁定结论」

有界探索证据持久化动态假设裁决对抗式候选评审

① 有界探索

围绕不同安全假设分别开启独立、边界清晰的调查分支,让多个可能的解释并行推进,互不污染,防止未经证实的假设悄悄变成集体共识。

② 证据持久化

各调查分支之间通过「证据」而非完整对话历史来协同——已被验证的观察和已被证伪的路径都会保留,避免同一条错误路径被反复重新试错。

③ 动态假设裁决

协调层持续基于不断演化的证据状态,判断哪些假设仍成立、哪些问题尚待解决、哪里还值得继续投入,让每一轮探索都成为对搜索空间的有效收窄

④ 对抗式候选评审

当证据支持某个触发方案时,系统构造候选输入并提交「对抗式评审」——同时挑战「这次崩溃是否可复现」与「这次崩溃是否真对应目标漏洞」。未通过评审的候选被打回,用于修正下一步探索方向。

这套机制的核心目的,是保证 AI 能够大范围排查潜在风险的同时,通过多层校验压低误判概率——在安全领域,一个误报往往比一个漏报更消耗人力。

04走进企业研发流程 从 SAST 到安全 Agent

深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全 Agent 升级。

传统规则匹配 SAST

依赖规则匹配,能识别 SQL 注入、命令执行等常见漏洞,但难以覆盖业务逻辑漏洞、越权与认证绕过。

新一代安全 Agent

能分析复杂业务逻辑,发现越权访问、认证绕过等传统工具盲区,多阶段推理 + 证据验证压降误报率。

具体而言,相关能力将为企业级用户带来四个方向的价值质变:

↑ 检出攻克 SAST 盲区,拓宽代码安全覆盖率
↓ 成本自动化代码理解与攻击路径推理,解放人工
↓ 误报多阶段推理与证据验证,聚焦真风险
↑ 交付安全检测前移至 CI/CD,代码提交即自动审计
编辑视角

本文核心数据来自企业单方披露,目前未见第三方独立复测结果,读者宜将「全球前四」「超越两大巨头」视作厂商基于 CyberGym 当前榜单的自陈成绩,精确分差与排名变动以靶场官网实时数据为准。

支线信息:CyberGym 是目前安全智能体方向少数具备工业实战认可度的公开靶场之一,其考题直接取自真实开源软件历史漏洞,作假成本极高——这为本次成绩提供了一定背书。

安全智能体赛道正在从「拼模型参数」转向「拼系统工程与证据闭环」——谁能把推理过程拆成可校验的步骤、把误报压到工程可接受线以下,谁就能拿到企业级代码安全的入场券。

查看完整榜单

Sangfor AI 相关能力已开始赋能深信服产品体系,CyberGym 完整榜单与评测细节可访问官网查阅。

CyberGym 官网 → 实时榜单