Anthropic 详解 Claude 安全隔离:权限确认机制失效,红队测试 24/25 成功外传数据
Anthropic 近日详细披露了 Claude 在 Web、开发者和桌面产品中的安全隔离架构。核心结论:Agent 的安全不能仅依赖权限确认或模型自身的安全机制,必须通过文件系统、网络和执行环境建立确定性的安全边界。
Anthropic 近日详细披露了 Claude 在 Web、开发者和桌面产品中的安全隔离架构。核心结论:Agent 的安全不能仅依赖权限确认或模型自身的安全机制,必须通过文件系统、网络和执行环境建立确定性的安全边界。
Anthropic 将 Agent 面临的风险归纳为三类:用户误用、模型自身的错误行为,以及通过文件、工具或网络内容发起的外部攻击。公司认为,分类器、系统提示词以及模型训练等机制虽然能够影响模型行为,但无法提供绝对的保证。
真正决定 Agent 能做什么的,不是模型"想"做什么,而是环境允许它做什么。
Anthropic 的核心观点是:运行环境本身所施加的限制,才是安全最可靠的基石。文件系统隔离、网络出口管控、执行环境沙箱——这些基础设施层面的约束,远比任何意图识别机制更可靠。
权限确认弹窗、分类器过滤、系统提示词约束——所有这些都可以被绕过或误判,无法提供绝对保证。
文件系统隔离、网络出口限制、执行环境沙箱——基础设施层面的约束,决定了 Agent 能力的上限。
注:Anthropic 将 Agent 系统划分为三个层次——概率性模型层、执行环境层、外部内容层。其中执行环境层是安全边界的关键载体。
Anthropic 将 Agent 系统划分为三个层次,每一层都有不同的安全属性和约束方式:
模型本身的行为具有概率性,无法通过训练或提示词保证绝对安全。这是安全问题的来源层。
运行时的沙箱、容器、网络策略——这是安全边界的核心载体。Anthropic 认为这是最值得投入的防御层。
文件、工具输出、网络内容可能携带恶意指令。即使模型本身安全,外部内容也可能诱导其做出不安全行为。
注:三层体系中,执行环境层是 Anthropic 安全策略的重心——它不依赖模型"是否愿意"遵守规则,而是从架构上限制 Agent 能做什么、不能做什么。
Anthropic 认为,Agent 的安全隔离机制应当根据用户能够提供的有效监督程度进行设计。三个产品采用了三种不同的策略:
代码执行在隔离基础设施上的临时 gVisor 容器中,完全无法访问用户本地文件系统。用户无需做任何安全决策。
最初采用逐项授权机制,用户批准了 93% 的请求。后引入 OS 级沙箱(macOS Seatbelt / Linux bubblewrap),弹窗减少 84%。
面向非技术用户,采用更严格的 VM 隔离。Agent 主循环在宿主机,代码执行在虚拟机内部,凭证保存在宿主机密钥链中。
注:Claude Code 的案例说明——当用户面对权限弹窗时,93% 的情况下选择"允许",这使得依赖用户确认的安全机制几乎失效。沙箱隔离才是真正的安全底线。
Anthropic 披露了多个安全事件,直接验证了其核心判断——仅靠意图识别和权限确认远远不够。
一个诚实的注脚:没有完美的安全架构,只有不断演进的防御体系。
Agent 安全正在经历从"概率性信任"到"确定性边界"的范式转移。Anthropic 用 93% 的批准率和 96% 的红队突破率证明:权限确认机制本质上是把安全责任转嫁给用户,而用户并不具备判断能力。未来 Agent 安全的核心竞争力,不在于模型有多"听话",而在于架构有多"受限"——谁能用最少的权限、最窄的出口、最严格的隔离,交付最多的价值,谁就掌握了 Agent 安全的底层密码。
Anthropic 的安全架构披露,为整个行业提供了一个难得的参考坐标——安全不是产品之后才考虑的事情,而是产品架构本身的一部分。