国产安全智能体杀进全球前四,纯国产底座反超 OpenAI、Anthropic
7 月 29 日,深信服公布其 AI 安全智能体 Sangfor AI 在全球代码安全靶场 CyberGym 的最新成绩:基于纯国产大模型 GLM-5.2 底座,面对 1507 项真实漏洞挑战,成功完成 1301 项,整体成功率 86.3%,跻身全球前四、国内第一,实现对两大海外 AI 巨头的成绩反超。
7 月 29 日,深信服公布其 AI 安全智能体 Sangfor AI 在全球代码安全靶场 CyberGym 的最新成绩:基于纯国产大模型 GLM-5.2 底座,面对 1507 项真实漏洞挑战,成功完成 1301 项,整体成功率 86.3%,跻身全球前四、国内第一,实现对两大海外 AI 巨头的成绩反超。
注:官方通稿未披露前三名及被反超海外团队的确切分数,图中位置与相对关系依据通稿「跻身全球前四、超越两大巨头」表述还原,非精确分差;榜首与 Sangfor AI 的具体差距以 CyberGym 官网实时榜单为准。
CyberGym 是目前全球含金量较高的代码安全大模型实战靶场。它与 MMLU、SWE-bench 等传统基准的区别非常直接:
考「模型知不知道漏洞长什么样」——答题式评测,与现实工业场景距离较远。
考「智能体能不能把漏洞挖出来、复现并验证」——贴合工业真实场景。
考题来源:ARVO 与 OSS-Fuzz 海量开源软件历史高危漏洞。考核链路:自主源码分析 → 多阶段漏洞推演 → 漏洞复现 → PoC 验证。评测标准严苛,结果具备较强行业参考价值。
更关键的一点:Sangfor AI 本次是在固定使用国产大模型 GLM-5.2 的配置下取得该成绩——这意味着,在安全智能体这条赛道上,系统工程架构的协同能力正在成为比单纯模型参数更重要的胜负手。
深信服方面介绍,为解决漏洞挖掘中长链路推理、多假设探索和持续验证等问题,Sangfor AI 采用「智能体群体协同作战」架构,并引入「证据管治」机制。技术团队将其总结为:「以假设拓展探索,以证据裁定结论」。
围绕不同安全假设分别开启独立、边界清晰的调查分支,让多个可能的解释并行推进,互不污染,防止未经证实的假设悄悄变成集体共识。
各调查分支之间通过「证据」而非完整对话历史来协同——已被验证的观察和已被证伪的路径都会保留,避免同一条错误路径被反复重新试错。
协调层持续基于不断演化的证据状态,判断哪些假设仍成立、哪些问题尚待解决、哪里还值得继续投入,让每一轮探索都成为对搜索空间的有效收窄。
当证据支持某个触发方案时,系统构造候选输入并提交「对抗式评审」——同时挑战「这次崩溃是否可复现」与「这次崩溃是否真对应目标漏洞」。未通过评审的候选被打回,用于修正下一步探索方向。
这套机制的核心目的,是保证 AI 能够大范围排查潜在风险的同时,通过多层校验压低误判概率——在安全领域,一个误报往往比一个漏报更消耗人力。
深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全 Agent 升级。
依赖规则匹配,能识别 SQL 注入、命令执行等常见漏洞,但难以覆盖业务逻辑漏洞、越权与认证绕过。
能分析复杂业务逻辑,发现越权访问、认证绕过等传统工具盲区,多阶段推理 + 证据验证压降误报率。
具体而言,相关能力将为企业级用户带来四个方向的价值质变:
本文核心数据来自企业单方披露,目前未见第三方独立复测结果,读者宜将「全球前四」「超越两大巨头」视作厂商基于 CyberGym 当前榜单的自陈成绩,精确分差与排名变动以靶场官网实时数据为准。
支线信息:CyberGym 是目前安全智能体方向少数具备工业实战认可度的公开靶场之一,其考题直接取自真实开源软件历史漏洞,作假成本极高——这为本次成绩提供了一定背书。
Sangfor AI 相关能力已开始赋能深信服产品体系,CyberGym 完整榜单与评测细节可访问官网查阅。
CyberGym 官网 → 实时榜单