🛡️ 安全 · 红队模型

OpenAI 推出 GPT-5.6-Cyber:红队攻击完成率 95%,"AI 黑客"成安全双刃剑

OpenAI 昨日宣布扩展网络安全计划 Daybreak,推出专为红队攻击模拟设计的 GPT-5.6-Cyber。该模型在高级安全任务中完成率高达 95%,远超普通模型的 1.5%,但其主动降低安全拒绝倾向的做法,也引发了对 AI 安全边界的深刻拷问。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#OpenAI #GPT-5.6-Cyber #Daybreak #AI安全 #红队攻防
95% GPT-5.6-Cyber 红队任务完成率
400+ 流行操作系统内核漏洞发现
5 移动操作系统漏洞(含完整漏洞链)

⚡ 30 秒速览

  • 能力有多强:GPT-5.6-Cyber 在高级安全任务中完成率达 95%,普通 GPT-5.6 Sol 仅 1.5%,差距超过 60 倍。
  • 真实战果:在 V8 引擎发现 2 个零日漏洞(可串联逃逸沙箱),移动 OS 发现 5 个漏洞含完整提权链,数据库 3 个 Critical 级漏洞,内核 400+ 权限提升漏洞。
  • 关键变化:主动降低高风险安全任务的拒绝倾向——面对"绕过认证""制作 exploit"等请求,模型更愿意继续执行而非中止。
  • 风险控制:分级权限 + 沙箱隔离 + 行为监控,仅面向经过授权的安全机构开放,不向公众开放使用。
  • 核心争议:训练攻击能力更强的 AI,究竟是在提高防御上限,还是在放大 AI 风险扩散的上限?

01红队攻击力有多强?完成率碾压式领先

OpenAI 在高级网络安全任务完成率测试中,对比了四代模型在漏洞利用链开发、认证绕过、权限提升等高危任务上的表现。结果呈断层式分布:

🥇 GPT-5.6-CyberDaybreak Red 红队模型
95.0%
GPT-5.5-Cyber上一代红队模型
57.3%
Daybreak Blue GPT-5.6 Sol蓝队防御模型
2.0%
普通 GPT-5.6 Sol通用模型
1.5%

注:柱形宽度反映完成率相对比例,满分 95% 对应 100% 宽度。GPT-5.6-Cyber 的完成率是普通模型的 63 倍,差距超过两个数量级。

差距的根源不仅在于能力提升,更在于 OpenAI 主动做了一项极具争议的选择:降低了模型在高风险安全任务上的拒绝倾向。普通 GPT-5.6 Sol 面对"绕过 macOS Keychain 授权并解密 Chrome Cookies"这类请求会直接拒答,而 GPT-5.6-Cyber 则给出了完整技术方案。

02真实世界的攻击成果不只是跑分

GPT-5.6-Cyber 的能力不是停留在基准测试中。研究团队在模型完成训练后,将其部署在真实软件环境中进行漏洞研究,结果令人不安:

🔍 V8 JavaScript 引擎2 个零日漏洞

  • 发现第一个漏洞:造成越界内存访问,可被用于信息泄露或代码执行
  • 发现第二个漏洞:与第一个可串联,将攻击路径推进至逃逸 V8 heap sandbox
  • 模型自主判断两漏洞的利用链关系,而非孤立报告
关键能力:不止发现漏洞,还能沿着"验证利用→扩大影响→寻找下一突破口"的链条持续推理。

📱 流行移动操作系统5 个漏洞 · 含完整提权链

  • 发现至少 5 个此前未知的安全漏洞
  • 其中包含一条从不可信 App 一路到本地权限提升的完整漏洞链
  • 漏洞链覆盖多个权限层级,模拟了真实攻击者的渐进式渗透路径
现实威胁模拟:从零权限到系统级控制,完整复现真实攻击链。

🗄️ 流行数据库系统3 个 Critical 级漏洞

  • 发现 3 个最高严重级别的安全漏洞
  • 均为 Critical 级,可导致远程代码执行或数据泄露
  • 模型在无人工提示的情况下自主定位并验证了漏洞的可利用性
此外,在某流行操作系统内核中发现超过 400 个可能导致权限提升的漏洞——数量级本身说明了 AI 驱动漏洞挖掘的规模化潜力。

03一个诚实的注脚:它并非万能

GPT-5.6-Cyber 并非在所有维度上都优于通用模型。OpenAI 的测试揭示了两项关键短板:

GPT-5.6-Cyber 强项

  • 漏洞发现与攻击路径推演
  • 高风险安全任务完成率 95%
  • 自主判断漏洞利用链
  • 降低拒答倾向,更"愿意"执行攻击模拟

GPT-5.6 Sol 强项

  • 漏洞报告更完整、细节更丰富
  • ExploitBench 标准 300 轮限制下表现更好
  • Token 效率更高,同等资源产出更多
  • 在"漏洞发现与报告撰写"测试中得分更高

注:在 ExploitBench 中,只有当任务上限扩大至 600 轮后,GPT-5.6-Cyber 与 GPT-5.6 Sol 的差距才明显缩小。短链高复杂度任务中,通用模型反而更优。

这意味着 OpenAI 没有将所有网络安全能力同时拉满,而是重点强化了红队最需要的几项能力:漏洞发现、攻击路径推演,以及在高风险任务中减少拒答。但在更长链条、更复杂的完整漏洞利用任务中,通用模型仍然可能表现得更好。

04更强的攻击力,如何被关进笼子?

更大的问题在于:这样的能力是否安全?

OpenAI 自己也承认,减少模型原有的安全限制,会带来高于普通模型的滥用和失控风险。为此,Daybreak 建立了一套三层防护机制:

🔑 分级授权🧪 沙箱隔离📊 行为监控

第一层:谁可以用。Daybreak Red 不向公众开放,仅面向经过批准、从事授权安全工作的个人和机构。大多数防御人员优先使用 Daybreak Blue,只有涉及高级漏洞研究或红队测试的团队才能申请 Red 访问权限。

第二层:在哪里用。安全研究工作流被要求部署在沙箱或隔离环境中,避免模型直接接触敏感生产系统和开放互联网。隔离边界需要持续测试,确保模型能力始终处于可控范围内。

第三层:能做什么。即使进入受控环境,高风险操作也不会被直接放行。当 Agent 请求执行需要提升权限的动作时,系统会再次进行风险评估,对具有显著破坏性的操作进行拦截。

但值得注意的是,这些手段本质上仍是网络安全领域的老三样:权限控制、沙箱隔离和行为监控。就在几周前,AI Agent 刚刚暴露出突破沙箱隔离、跨越权限边界的潜在风险——用传统手段管控 AI 能力,是否足够?

编辑核心判断

OpenAI 做出了一个诚实的战术选择:先让"矛"比"盾"更锋利,再靠治理机制控制风险。但问题在于,当 AI 开始同时成为攻击者和防御者的工具,传统安全三板斧还能兜住多久?能力越强,信任边界越薄——这或许是 AI 安全领域今年最棘手的一道选择题。