Google 推出 Gemini 3.5 Flash Cyber:2 小时挖出 RCE 漏洞,小模型反超 Opus
7 月 22 日,Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专攻大规模代码库的漏洞挖掘与修复。在 Google 内部实测中,该模型仅用 2 小时即发现远程代码执行漏洞并生成绕过 ASLR/W^X 的可靠利用代码。
7 月 22 日,Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专攻大规模代码库的漏洞挖掘与修复。在 Google 内部实测中,该模型仅用 2 小时即发现远程代码执行漏洞并生成绕过 ASLR/W^X 的可靠利用代码。
在 V8 JavaScript 引擎上以固定调用次数测试,3.5 Flash Cyber 发现的独立确认漏洞数显著领先:
注:柱形按 36–55 区间缩放,非零起点,以放大差异;分差以标注数字为准。3.5 Flash Cyber 较 Opus 4.6 多发现 19 个漏洞,其中 10 个为另两个模型均未捕获的独有发现。Google 同时披露:更新版本的竞品模型因内置安全护栏拒绝执行此类任务,故未列入对比。
漏洞挖掘的难点不在单点推理深度,而在搜索空间广度——一个复杂代码库的执行路径数量是天文级。单次调用大模型会卡在瓶颈上。
一次调用大型模型,成本高、延迟大,难以覆盖足够多的代码路径,容易在循环里反复发现同一个问题。
CodeMender 对 3.5 Flash Cyber 最多调用 5 次,每次扫描不同代码路径,子代理各自分析后汇总成单份高质量报告。
这套架构的关键在于成本与速度:单次调用足够便宜,就能塞进频繁扫描、上线前检查、提交扫描流水线等高频场景;而调用次数越多,模型持续发现新代码路径与漏洞的能力越强——Google 称其「不会像基础安全模型那样陷入重复发现的死循环」。
在 CyberGym 基准(数百个真实软件漏洞)上,该架构以低成本达到了与显著更大模型「有竞争力」的表现。Google 注明:竞品成绩取自各厂商自报分数。
答案在数据资产:Google 拥有两大业界级安全数据库——
覆盖 70 万+ 开源软件漏洞条目,持续更新。
Google 主导的模糊测试项目,积累 10 年+ 真实漏洞数据。
这让 3.5 Flash Cyber 的训练跳出了合成示例:模型学到的是真实安全工程师如何操作行业标准工具、如何在 Chromium 级别的大型项目里读百万行代码、如何独立完成需要数小时持续深度分析的复杂安全任务。
Google 同时强调,这种能力来自系统工程与数据飞轮的协同——而非单纯堆参数。Big Sleep 团队独立构建的评测(针对 Chrome、Safari 等极复杂代码库)中,3.5 Flash Cyber 显著超过主线 3.5 Flash 与 3.6 Flash。
本文为 Google DeepMind 官方博客发布,所有性能数据均为单方披露,未见独立第三方复测;CyberGym 基准上的竞品成绩明确标注「取自各厂商自报分数」,V8 对比中较新版本的竞品因安全护栏拒绝执行而缺席——读者宜将「反超 Opus」理解为特定约束条件下的相对优势,而非跨模型绝对结论。
同时,模型仅对政府与可信伙伴开放,这种受限发布本身既是对双用途风险的克制,也是 Google 在安全话语权上的卡位。
3.5 Flash Cyber 目前通过 CodeMender 以受限试点形式对政府及可信合作伙伴开放;CodeMender 的基础能力也已在 Gemini Enterprise Agent Platform 上向客户开放。
DeepMind 官方介绍页 → 查看接入资格