🛡️ 网络安全 · 模型发布

Google 推出 Gemini 3.5 Flash Cyber:2 小时挖出 RCE 漏洞,小模型反超 Opus

7 月 22 日,Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专攻大规模代码库的漏洞挖掘与修复。在 Google 内部实测中,该模型仅用 2 小时即发现远程代码执行漏洞并生成绕过 ASLR/W^X 的可靠利用代码。

来源:官方发布 2025-07-22 全文约 4 分钟读完
#Gemini3.5FlashCyber #网络安全 #漏洞挖掘 #GoogleDeepMind
2 小时 从启动扫描到产出可利用 RCE 代码
55 V8 引擎独立确认漏洞,领先 Opus 4.6 十九个
5 单次报告最多调用,以低成本逼近大模型

⚡ 30 秒速览

  • 是什么:基于 Gemini 3.5 Flash 微调的网络安全专用模型,定位「轻量、低成本、可高频扫描」。
  • 核心战绩:在 V8 引擎固定调用测试中独立发现 55 个确认漏洞,多于 3.5 Flash 的 47 个、Opus 4.6 的 36 个,其中 10 个为另两个模型均未捕获的独有发现。
  • 怎么做到的:不靠单次大模型重推理,而是多次并行调用扫描海量代码路径,再汇总成单份高质量报告。
  • 谁能用:目前仅对政府及可信合作伙伴开放,通过 CodeMender 平台调用,不公开发布。
  • 为什么重要:AI 找漏洞的速度已快于人类修复速度——攻防不对称正在加剧,防守方需要同等量级的自动化武器。

01小模型 vs 大模型 V8 引擎漏洞发现数对比

在 V8 JavaScript 引擎上以固定调用次数测试,3.5 Flash Cyber 发现的独立确认漏洞数显著领先:

🥇 Gemini 3.5 Flash CyberGoogle DeepMind
55
Gemini 3.5 Flash(主线)Google DeepMind
47
Claude Opus 4.6Anthropic
36

注:柱形按 36–55 区间缩放,非零起点,以放大差异;分差以标注数字为准。3.5 Flash Cyber 较 Opus 4.6 多发现 19 个漏洞,其中 10 个为另两个模型均未捕获的独有发现。Google 同时披露:更新版本的竞品模型因内置安全护栏拒绝执行此类任务,故未列入对比。

02为什么小模型能赢大模型?

漏洞挖掘的难点不在单点推理深度,而在搜索空间广度——一个复杂代码库的执行路径数量是天文级。单次调用大模型会卡在瓶颈上。

传统思路:单次重推理

一次调用大型模型,成本高、延迟大,难以覆盖足够多的代码路径,容易在循环里反复发现同一个问题。

Flash Cyber:多次轻调用

CodeMender 对 3.5 Flash Cyber 最多调用 5 次,每次扫描不同代码路径,子代理各自分析后汇总成单份高质量报告。

这套架构的关键在于成本与速度:单次调用足够便宜,就能塞进频繁扫描、上线前检查、提交扫描流水线等高频场景;而调用次数越多,模型持续发现新代码路径与漏洞的能力越强——Google 称其「不会像基础安全模型那样陷入重复发现的死循环」。

扫描大代码库并行调用 5 次各自分析代码路径汇总单份报告

在 CyberGym 基准(数百个真实软件漏洞)上,该架构以低成本达到了与显著更大模型「有竞争力」的表现。Google 注明:竞品成绩取自各厂商自报分数。

03它到底做到了什么?两个实战案例

⚡ 2 小时攻防:Cloud 漏洞研究团队实测真实生产环境

  • Google Cloud 漏洞研究团队用 3.5 Flash Cyber 主动加固系统,仅 2 小时内完成扫描与验证。
  • 发现公开 API 的远程代码执行漏洞,以及敏感生产服务的内存损坏漏洞
  • 生成 100% 可靠的 RCE 利用代码,绕过 ASLR(地址空间布局随机化)与 W^X(写异或执行)两项标准缓解技术。
意义:从发现到可利用 PoC 的全链路自动化,压缩到了小时级。

🏭 内部代码库全量覆盖已落地

  • 3.5 Flash Cyber 已通过 CodeMender 在 Google 内部代码库中实际运行,持续发现并修复漏洞。
  • 覆盖范围:Chrome、Android、Cloud、Ads、YouTube——Google 几乎所有核心产品线。
  • 外部测试反馈:Wiz 与 Cloud CISO Security Engineering 测试者确认,较主线 3.5 Flash 模型有「显著能力提升」。

04为什么是 Google 做出来了?

答案在数据资产:Google 拥有两大业界级安全数据库——

OSV.dev 漏洞库

覆盖 70 万+ 开源软件漏洞条目,持续更新。

OSS-Fuzz 成果

Google 主导的模糊测试项目,积累 10 年+ 真实漏洞数据。

这让 3.5 Flash Cyber 的训练跳出了合成示例:模型学到的是真实安全工程师如何操作行业标准工具、如何在 Chromium 级别的大型项目里读百万行代码、如何独立完成需要数小时持续深度分析的复杂安全任务。

Google 同时强调,这种能力来自系统工程与数据飞轮的协同——而非单纯堆参数。Big Sleep 团队独立构建的评测(针对 Chrome、Safari 等极复杂代码库)中,3.5 Flash Cyber 显著超过主线 3.5 Flash 与 3.6 Flash。

编辑视角

本文为 Google DeepMind 官方博客发布,所有性能数据均为单方披露,未见独立第三方复测;CyberGym 基准上的竞品成绩明确标注「取自各厂商自报分数」,V8 对比中较新版本的竞品因安全护栏拒绝执行而缺席——读者宜将「反超 Opus」理解为特定约束条件下的相对优势,而非跨模型绝对结论。

同时,模型仅对政府与可信伙伴开放,这种受限发布本身既是对双用途风险的克制,也是 Google 在安全话语权上的卡位。

当 AI 找漏洞的速度开始以小时计、而人类修复仍以天计,攻防不对称的真正变量已不是模型大小,而是谁能把模型塞进 CI/CD 流水线的高频扫描里——网络安全行业的竞争维度,正在从「谁的模型更强」转向「谁的工程闭环更短」。

获取方式

3.5 Flash Cyber 目前通过 CodeMender 以受限试点形式对政府及可信合作伙伴开放;CodeMender 的基础能力也已在 Gemini Enterprise Agent Platform 上向客户开放。

DeepMind 官方介绍页 → 查看接入资格