🛡️ Agent 安全 · 前沿实践

Agent 安全进入"系统控制"时代:五层闭环防御体系破解动态失控风险

vivoAI 安全工程师张栋在 AICon 深圳大会提出基于系统控制论的 Agent 安全防御体系,将 Agent 视为"目标—状态—行动—环境—反馈"的动态系统,构建感知—判断—控制—恢复—进化五层闭环,应对 Agent 从内容生成走向自主规划后的复杂系统失控风险。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Agent 安全 #系统控制论 #AI 安全防御 #AICon 深圳
5 层 闭环防御体系
感知→判断→控制→恢复→进化
6 项 核心工程痛点
从观测到评价的全链路挑战
3 大 落地收益
框架·架构·经验

⚡ 30 秒速览

  • 核心变化:Agent 安全已从"单点风险"演变为"复杂系统失控",传统静态规则防御失效。
  • 解题框架:基于系统控制论,将 Agent 抽象为动态系统,构建五层闭环防御体系。
  • 关键洞察:同一底座模型搭载不同安全框架,风险控制效果差距明显——系统工程能力正在超越单点检测。
  • 落地情况:该体系已在 vivo 手机端和 PC 端 Agent 项目中完成验证,通过 Red Team 持续校准。

01为什么 Agent 安全发生了本质变化

当 Agent 从"内容生成"走向"自主规划、工具调用、跨系统执行",风险的性质也随之改变。它不再只是模型单次输出错误,而是由模型、工具、权限、环境和反馈共同形成的复杂系统失控。

一个诚实的对比:

传统安全防御

面向内容生成场景,风险集中在单次模型输出,以静态规则、权限控制、内容审核为主。

Agent 时代的安全挑战

面向任务规划、工具调用与长期运行,风险来自多步骤错误累积、目标漂移与链式放大。

核心区别:传统安全防的是"单点错误",Agent 安全要防的是"系统失控"。

02传统方案的能力边界

静态规则、权限控制、内容审核和单点检测,在多步骤任务、目标漂移、错误累积及链式风险面前,暴露了明显的局限。

📋 一个典型场景:多步骤任务中的链式风险 传统方案失效

  • 任务:"分析公司 Q3 财报,生成摘要 PPT 并发送给管理层。"——涉及数据库查询、图表生成、邮件发送等多个步骤。
  • 传统做法:每一步独立做权限检查与内容审核,但无法感知步骤之间的上下文依赖目标漂移
  • 实际风险:Agent 在分析过程中发现数据异常,自主决定额外访问另一个内部系统——静态规则无法处理这种动态的上下文变化,导致越权执行或任务中断
本质问题:规则数量随任务复杂度指数膨胀,且无法覆盖"在过程中逐渐形成"的复合风险。

传统方案不是没用,而是它的设计假设——风险是静态的、可预定义的——在 Agent 时代已经不成立。

03五层闭环防御体系 基于系统控制论的设计

张栋提出将 Agent 抽象为"目标—状态—行动—环境—反馈"的动态系统,并构建覆盖"感知—判断—控制—恢复—进化"的完整闭环。

感知 判断 控制 恢复 进化
五层闭环:从风险状态建模到策略持续优化,形成可观测、可判断、可控制、可审计、可恢复的安全闭环。
① 感知

风险状态建模,统一观测 Agent 的意图、规划链路与环境状态。

② 判断

动态授权与执行前校验,在上下文变化中实时评估风险。

③ 控制

过程监测与行为约束,对执行中的异常进行实时干预。

④ 恢复

异常中断与回滚撤销,确保不可逆操作有补偿机制。

⑤ 进化

基于 Red Team 验证与线上数据持续优化策略,形成自适应能力。

该体系已在 vivo 手机端和 PC 端 Agent 项目中转化为安全需求、架构机制与测试用例,通过 Red Team 持续校准。

04工程中的真实权衡

理论框架与工程系统之间存在落差。控制论能够提供统一视角,但落地时仍需结合具体业务定义状态变量、风险阈值和控制动作。

📱

手机端 Agent:安全控制与用户体验的平衡

"过度确认会降低任务流畅度,控制过弱又可能导致越权执行。"——在手机端,每多一次确认弹窗,用户流失率就上升一截。工程团队通过动态授权阈值,在低频高风险操作上做严格校验,高频低风险操作上做轻量提示。

💻

PC 端 Agent:复杂任务链中的恢复机制

"恢复机制比阻断机制更难建设。"——Agent 已经修改文件、发送信息或调用外部系统后,仅靠拦截无法解决问题。需要事务记录、结果校验与回滚补偿机制,这在多步骤任务中尤为复杂。

⚖️

安全效果的度量困境

"安全效果缺乏成熟评价标准。"——目前难以同时量化风险降低程度、误拦截率、任务成功率和控制成本,需要通过 Red Team、回归测试及线上数据持续校准,形成动态评价体系。

六个工程痛点:系统状态难以完整观测、安全与体验权衡、静态规则膨胀、恢复机制建设困难、理论模型与工程落差、安全效果评价标准缺失。

编辑核心判断

Agent 安全正在从"单点防御"走向"系统控制"。当模型能力逐渐成为行业共识,真正的竞争力将来自围绕模型构建的可规模化智能系统——而安全体系的工程化能力,决定了这个系统能走多远。

现场聆听完整分享

张栋将在 AICon 人工智能开发与应用大会 · 深圳站(8 月 21 日—22 日)发表完整演讲,深入拆解五层防御体系的工程实现与 Red Team 验证细节。

AICon 深圳站 → 报名通道

大会还设有 AI Infra、推理工程、多模态技术等 10 个专题论坛,50+ 头部企业技术负责人到会分享。