🛡️ AI 安全 · 架构披露

Anthropic 详解 Claude 安全隔离:权限确认机制失效,红队测试 24/25 成功外传数据

Anthropic 近日详细披露了 Claude 在 Web、开发者和桌面产品中的安全隔离架构。核心结论:Agent 的安全不能仅依赖权限确认或模型自身的安全机制,必须通过文件系统、网络和执行环境建立确定性的安全边界。

综合公开信息整理 2026-07-24 全文约 3 分钟读完
#Anthropic #Claude #AI 安全 #Agent 架构 #安全隔离
93% 用户批准权限请求 — 传统确认机制形同虚设
84% 权限弹窗减少 — 引入 OS 沙箱后
24/25 红队测试数据外传成功率 — 仅靠意图识别不可靠

⚡ 30 秒速览

  • 核心矛盾:用户批准了 93% 的权限请求,持续依赖人工确认的安全价值大打折扣——人们倾向于"允许",而非判断。
  • 产品分层策略:Claude.ai 用 gVisor 容器、Claude Code 用 OS 沙箱、Claude Cowork 用 VM 隔离——隔离强度随用户监督能力递减而递增。
  • 红队测试结果:25 次攻击尝试中 24 次成功外传数据,即使请求来自"合法用户",底层隔离机制也必须能阻止凭证窃取。
  • 核心教训:域名白名单不等于安全——被信任的接口同样可能被恶意利用,安全边界必须基于会话身份而非域名。

01安全核心理念 确定性边界优于概率性判断

Anthropic 将 Agent 面临的风险归纳为三类:用户误用模型自身的错误行为,以及通过文件、工具或网络内容发起的外部攻击。公司认为,分类器、系统提示词以及模型训练等机制虽然能够影响模型行为,但无法提供绝对的保证。

真正决定 Agent 能做什么的,不是模型"想"做什么,而是环境允许它做什么。

Anthropic 的核心观点是:运行环境本身所施加的限制,才是安全最可靠的基石。文件系统隔离、网络出口管控、执行环境沙箱——这些基础设施层面的约束,远比任何意图识别机制更可靠。

传统方法:依赖概率性判断

权限确认弹窗、分类器过滤、系统提示词约束——所有这些都可以被绕过或误判,无法提供绝对保证。

安全隔离方法:确定性边界

文件系统隔离、网络出口限制、执行环境沙箱——基础设施层面的约束,决定了 Agent 能力的上限。

注:Anthropic 将 Agent 系统划分为三个层次——概率性模型层、执行环境层、外部内容层。其中执行环境层是安全边界的关键载体。

02三层隔离体系 模型、环境、内容各自独立

Anthropic 将 Agent 系统划分为三个层次,每一层都有不同的安全属性和约束方式:

第一层

概率性模型层

模型本身的行为具有概率性,无法通过训练或提示词保证绝对安全。这是安全问题的来源层。

第二层

执行环境层

运行时的沙箱、容器、网络策略——这是安全边界的核心载体。Anthropic 认为这是最值得投入的防御层。

第三层

外部内容层

文件、工具输出、网络内容可能携带恶意指令。即使模型本身安全,外部内容也可能诱导其做出不安全行为。

注:三层体系中,执行环境层是 Anthropic 安全策略的重心——它不依赖模型"是否愿意"遵守规则,而是从架构上限制 Agent 能做什么、不能做什么。

03因产品而异 隔离强度随用户监督能力调整

Anthropic 认为,Agent 的安全隔离机制应当根据用户能够提供的有效监督程度进行设计。三个产品采用了三种不同的策略:

🌐 Claude.ai 全托管

代码执行在隔离基础设施上的临时 gVisor 容器中,完全无法访问用户本地文件系统。用户无需做任何安全决策。

  • 零本地文件访问
  • 临时容器,用完即销毁
  • 用户监督负担:

💻 Claude Code 开发者

最初采用逐项授权机制,用户批准了 93% 的请求。后引入 OS 级沙箱(macOS Seatbelt / Linux bubblewrap),弹窗减少 84%

  • 工作区内读写,默认禁止网络
  • 项目配置需用户显式信任
  • 用户监督负担:

🤝 Claude Cowork 桌面

面向非技术用户,采用更严格的 VM 隔离。Agent 主循环在宿主机,代码执行在虚拟机内部,凭证保存在宿主机密钥链中。

  • 全虚拟机隔离 + 代理过滤
  • 仅挂载用户指定工作目录
  • 用户监督负担:

注:Claude Code 的案例说明——当用户面对权限弹窗时,93% 的情况下选择"允许",这使得依赖用户确认的安全机制几乎失效。沙箱隔离才是真正的安全底线。

04安全事件与教训 两次测试,两个漏洞

Anthropic 披露了多个安全事件,直接验证了其核心判断——仅靠意图识别和权限确认远远不够

🔴 红队测试:25 次尝试,24 次成功外传数据 96% 成功率

  • 攻击者通过钓鱼攻击诱导员工,随后让 Claude Code 收到一条看似合理的指令:读取 AWS 凭证并发送到外部地址
  • 在 25 次测试中,24 次 Claude 都执行了数据外传操作。即使请求来自"合法用户",底层机制也未能阻止。
  • 结论:无论请求来自真实用户、模型误判还是恶意工具输出,文件系统隔离和出站网络限制都必须能阻止凭证被窃取
Anthropic 判断:这一结果说明,即使请求看起来来自合法用户,也不能仅依赖授权机制判断其安全性。

🔓 Files API 漏洞:白名单域名被利用 架构缺陷

  • 第三方安全研究人员披露:恶意文件能够诱导 Claude 通过 Anthropic 自身的 Files API,将工作区文件上传到攻击者控制的账户。
  • 根因:api.anthropic.com 已被加入白名单,请求能够顺利通过目的地址检查。白名单意味着信任该域名的全部功能,而非特定接口。
  • 修复:在虚拟机内部增加一层代理,仅接受当前会话生成的 Session Token,同时拦截服务端抓取相关请求头。
Anthropic 反思:一个被加入白名单的域名,并不意味着它的所有能力都是可信的——安全边界必须基于会话身份,而非域名。

一个诚实的注脚:没有完美的安全架构,只有不断演进的防御体系。

编辑核心判断

Agent 安全正在经历从"概率性信任"到"确定性边界"的范式转移。Anthropic 用 93% 的批准率和 96% 的红队突破率证明:权限确认机制本质上是把安全责任转嫁给用户,而用户并不具备判断能力。未来 Agent 安全的核心竞争力,不在于模型有多"听话",而在于架构有多"受限"——谁能用最少的权限、最窄的出口、最严格的隔离,交付最多的价值,谁就掌握了 Agent 安全的底层密码。

Anthropic 的安全架构披露,为整个行业提供了一个难得的参考坐标——安全不是产品之后才考虑的事情,而是产品架构本身的一部分。