OpenAI 推出 GPT-5.6-Cyber:红队攻击完成率 95%,"AI 黑客"成安全双刃剑
OpenAI 昨日宣布扩展网络安全计划 Daybreak,推出专为红队攻击模拟设计的 GPT-5.6-Cyber。该模型在高级安全任务中完成率高达 95%,远超普通模型的 1.5%,但其主动降低安全拒绝倾向的做法,也引发了对 AI 安全边界的深刻拷问。
OpenAI 昨日宣布扩展网络安全计划 Daybreak,推出专为红队攻击模拟设计的 GPT-5.6-Cyber。该模型在高级安全任务中完成率高达 95%,远超普通模型的 1.5%,但其主动降低安全拒绝倾向的做法,也引发了对 AI 安全边界的深刻拷问。
OpenAI 在高级网络安全任务完成率测试中,对比了四代模型在漏洞利用链开发、认证绕过、权限提升等高危任务上的表现。结果呈断层式分布:
注:柱形宽度反映完成率相对比例,满分 95% 对应 100% 宽度。GPT-5.6-Cyber 的完成率是普通模型的 63 倍,差距超过两个数量级。
差距的根源不仅在于能力提升,更在于 OpenAI 主动做了一项极具争议的选择:降低了模型在高风险安全任务上的拒绝倾向。普通 GPT-5.6 Sol 面对"绕过 macOS Keychain 授权并解密 Chrome Cookies"这类请求会直接拒答,而 GPT-5.6-Cyber 则给出了完整技术方案。
GPT-5.6-Cyber 的能力不是停留在基准测试中。研究团队在模型完成训练后,将其部署在真实软件环境中进行漏洞研究,结果令人不安:
GPT-5.6-Cyber 并非在所有维度上都优于通用模型。OpenAI 的测试揭示了两项关键短板:
注:在 ExploitBench 中,只有当任务上限扩大至 600 轮后,GPT-5.6-Cyber 与 GPT-5.6 Sol 的差距才明显缩小。短链高复杂度任务中,通用模型反而更优。
这意味着 OpenAI 没有将所有网络安全能力同时拉满,而是重点强化了红队最需要的几项能力:漏洞发现、攻击路径推演,以及在高风险任务中减少拒答。但在更长链条、更复杂的完整漏洞利用任务中,通用模型仍然可能表现得更好。
更大的问题在于:这样的能力是否安全?
OpenAI 自己也承认,减少模型原有的安全限制,会带来高于普通模型的滥用和失控风险。为此,Daybreak 建立了一套三层防护机制:
第一层:谁可以用。Daybreak Red 不向公众开放,仅面向经过批准、从事授权安全工作的个人和机构。大多数防御人员优先使用 Daybreak Blue,只有涉及高级漏洞研究或红队测试的团队才能申请 Red 访问权限。
第二层:在哪里用。安全研究工作流被要求部署在沙箱或隔离环境中,避免模型直接接触敏感生产系统和开放互联网。隔离边界需要持续测试,确保模型能力始终处于可控范围内。
第三层:能做什么。即使进入受控环境,高风险操作也不会被直接放行。当 Agent 请求执行需要提升权限的动作时,系统会再次进行风险评估,对具有显著破坏性的操作进行拦截。
但值得注意的是,这些手段本质上仍是网络安全领域的老三样:权限控制、沙箱隔离和行为监控。就在几周前,AI Agent 刚刚暴露出突破沙箱隔离、跨越权限边界的潜在风险——用传统手段管控 AI 能力,是否足够?
OpenAI 做出了一个诚实的战术选择:先让"矛"比"盾"更锋利,再靠治理机制控制风险。但问题在于,当 AI 开始同时成为攻击者和防御者的工具,传统安全三板斧还能兜住多久?能力越强,信任边界越薄——这或许是 AI 安全领域今年最棘手的一道选择题。