Agent 安全进入"系统控制"时代:五层闭环防御体系破解动态失控风险
vivoAI 安全工程师张栋在 AICon 深圳大会提出基于系统控制论的 Agent 安全防御体系,将 Agent 视为"目标—状态—行动—环境—反馈"的动态系统,构建感知—判断—控制—恢复—进化五层闭环,应对 Agent 从内容生成走向自主规划后的复杂系统失控风险。
感知→判断→控制→恢复→进化
从观测到评价的全链路挑战
框架·架构·经验
vivoAI 安全工程师张栋在 AICon 深圳大会提出基于系统控制论的 Agent 安全防御体系,将 Agent 视为"目标—状态—行动—环境—反馈"的动态系统,构建感知—判断—控制—恢复—进化五层闭环,应对 Agent 从内容生成走向自主规划后的复杂系统失控风险。
当 Agent 从"内容生成"走向"自主规划、工具调用、跨系统执行",风险的性质也随之改变。它不再只是模型单次输出错误,而是由模型、工具、权限、环境和反馈共同形成的复杂系统失控。
一个诚实的对比:
面向内容生成场景,风险集中在单次模型输出,以静态规则、权限控制、内容审核为主。
面向任务规划、工具调用与长期运行,风险来自多步骤错误累积、目标漂移与链式放大。
核心区别:传统安全防的是"单点错误",Agent 安全要防的是"系统失控"。
静态规则、权限控制、内容审核和单点检测,在多步骤任务、目标漂移、错误累积及链式风险面前,暴露了明显的局限。
传统方案不是没用,而是它的设计假设——风险是静态的、可预定义的——在 Agent 时代已经不成立。
张栋提出将 Agent 抽象为"目标—状态—行动—环境—反馈"的动态系统,并构建覆盖"感知—判断—控制—恢复—进化"的完整闭环。
风险状态建模,统一观测 Agent 的意图、规划链路与环境状态。
动态授权与执行前校验,在上下文变化中实时评估风险。
过程监测与行为约束,对执行中的异常进行实时干预。
异常中断与回滚撤销,确保不可逆操作有补偿机制。
基于 Red Team 验证与线上数据持续优化策略,形成自适应能力。
该体系已在 vivo 手机端和 PC 端 Agent 项目中转化为安全需求、架构机制与测试用例,通过 Red Team 持续校准。
理论框架与工程系统之间存在落差。控制论能够提供统一视角,但落地时仍需结合具体业务定义状态变量、风险阈值和控制动作。
"过度确认会降低任务流畅度,控制过弱又可能导致越权执行。"——在手机端,每多一次确认弹窗,用户流失率就上升一截。工程团队通过动态授权阈值,在低频高风险操作上做严格校验,高频低风险操作上做轻量提示。
"恢复机制比阻断机制更难建设。"——Agent 已经修改文件、发送信息或调用外部系统后,仅靠拦截无法解决问题。需要事务记录、结果校验与回滚补偿机制,这在多步骤任务中尤为复杂。
"安全效果缺乏成熟评价标准。"——目前难以同时量化风险降低程度、误拦截率、任务成功率和控制成本,需要通过 Red Team、回归测试及线上数据持续校准,形成动态评价体系。
六个工程痛点:系统状态难以完整观测、安全与体验权衡、静态规则膨胀、恢复机制建设困难、理论模型与工程落差、安全效果评价标准缺失。
Agent 安全正在从"单点防御"走向"系统控制"。当模型能力逐渐成为行业共识,真正的竞争力将来自围绕模型构建的可规模化智能系统——而安全体系的工程化能力,决定了这个系统能走多远。
张栋将在 AICon 人工智能开发与应用大会 · 深圳站(8 月 21 日—22 日)发表完整演讲,深入拆解五层防御体系的工程实现与 Red Team 验证细节。
AICon 深圳站 → 报名通道大会还设有 AI Infra、推理工程、多模态技术等 10 个专题论坛,50+ 头部企业技术负责人到会分享。