Agent安全进入"行为失控"时刻:Human in the loop不再是解药,而是安慰剂
腾讯、百度、Cloudflare 三位安全专家在 AICon 直播中达成共识——Agent 的行动能力让风险从"内容对不对"升级为"行为可不可控",而多数企业仍在用"闭着眼睛点确认"的 human in the loop 自我安慰。安全机制正面临三次换轨。
腾讯、百度、Cloudflare 三位安全专家在 AICon 直播中达成共识——Agent 的行动能力让风险从"内容对不对"升级为"行为可不可控",而多数企业仍在用"闭着眼睛点确认"的 human in the loop 自我安慰。安全机制正面临三次换轨。
去年行业还在讨论"模型安全"——主要防的是模型说错话、生成有害内容。但今年,话题几乎一夜之间全变成了Agent 安全。发生了什么?
三位专家的答案,指向同一个变量:行动能力。
像一台自动售货机:输入输出固定,攻击面是某个写死的环节,相对可控。最坏的结果是"说错话"。
像一个拿到公司工牌的新员工:会自己判断、找工具、联系人、操作环境。最坏的结果是"删库、转账、泄露数据"。
注:对比基于张栋(腾讯)在直播中的定义——传统 AI 是业务流中的一个环节,Agent 本身就是业务流,掌控了全生命周期。
Cloudflare 的刘旭用一个具体场景说明问题:"年初 OpenClaw 爆火,Agent 从 demo 走向台前。它不再只是一个大脑,它有了手和脚,有了自己的 channel,可以接入 MCP 进入公司内网获取能力。原来盗个 ChatGPT 账户最多偷点 token,现在可以直接操控你的账户、窃取个人信息。"
百度智能云安全架构师林道正则给出了历史视角:"2000 年 PC 安全爆发,2012 年手机安全爆发——每当一个新时代开始大范围推广,安全问题就会集中爆发。Agent 这一波,对实际软件环境产生了真实影响,范围更广,影响更深。"
但最关键的变量,是张栋概括的三个字:行动能力。
张栋(腾讯专家工程师、AI Agent 安全负责人)指出:"去年我们防的是'Agent 说错话',那只是内容层的轻微影响;今年 Agent 有了工具、记忆和执行权限,执行与行动之间,可能已经没有人在把关了。安全的本质发生了第一次换轨:从'内容对不对',到'行为可不可控'。这不是量的增加,是质的换轨。"
注:林道正总结 Agent 的三要素——身份(能规约它能做什么)、思考(大模型+harness 的智能涌现)、行动(基于工具和自主编码的行为)。
很多人觉得提示词注入已经讲了两年,"听着像老生常谈"。但三位专家一致认为:它仍然是头号风险,而且破坏力正在指数级增长。
张栋用一个比喻总结了工具风险的根源:
他进一步拆解了问题的三个层面:过度授权、没有最小权限、调用不可审计。危险的从来不是工具本身,是赋予的权限远超任务真正需要。
林道正在直播中给出了一个经典判断:"安全的方法论是不变的,三板斧——可视、可管、可追溯。"变的是细节,但框架依然有效。
张栋将其翻译成三个落地动作:
第一,先看得见。先别急着上防御,做资产盘点:这个 Agent 有哪些身份、能调哪些工具、能碰哪些数据、有几条对外通道。看不见风险面,防护优先级就是空话。
第二,收得住。权限一律从最小开始——能只读就别给写,能临时 token 就别给长期。再配一条"保底策略":哪怕全部防御失效,也不能让 Agent 变成黑客为所欲为的地方。
第三,留得下痕。输入、调用、产出,全链路打日志。Agent 的威胁不只来自外部,也来自内部。可审计本身就是最好的威慑——真出了事,能追到具体的人、具体的动作。
注:以上"三步法"源自张栋对林道正"三板斧"的落地解读,经三位专家在直播中共同认可。
但责任归谁?这是企业最头疼的问题。
研发觉得安全是安全团队的事,安全觉得业务最了解场景,业务觉得平台应该保底。最后留下一片真空——而真空,恰恰是风险最爱待的地方。
谁痛谁牵头——最坏结果落在谁身上,谁就是第一责任人。业务保用途和数据边界,安全定规则和红线,平台保运行时和基础设施。
刘旭补充了一个关键视角:"安全团队的角色也变了。原来布好 WAF、布好 DDoS 就完事了。现在提示词注入根本不是 DDoS 攻击,安全团队必须和业务团队高度配合,共同探讨方案。"
企业最真实的顾虑是:如果限制太多,Agent 会不会失去价值?
张栋用一个比喻回应了这个问题:
护栏思维的核心是风险分级:低风险的查询、总结,大胆放开;高风险的动作(改数据、对外发送、花钱),必须留 human in the loop。但这里的"human in the loop"需要被重新定义——
因为,它正在成为 Agent 安全里最大的"安慰剂"。
林道正和刘旭分别从两个角度给出了落地建议:
林道正(百度):"让影响可回滚。你错也可以,删我数据?我有备份。同时用 AI 来降噪,降低人做判断的工作量。最近比较火的 loop engineering 就是一种自进化思路——不断自省、优化、再自省。"
刘旭(Cloudflare):"既然人没法 in the loop,就把 action 能产生的影响降到最低。接入内网就开最小权限,生成的东西放在沙箱环境里,周期性跟正确的东西做对比。如果发现总是在做坏事情,就封掉。"
一个诚实的注脚:
林道正坦言,"每个产品不可能一开始就想得比较全面,如果都做到完美、安全全覆盖、权限收敛特别好才落地,那可能就很难落地了。"渐进式管理是现实选择——先防住最不能接受的后果,再慢慢收敛。
Agent 安全正在经历第三次换轨——从"一次性验收"到"持续的数据飞轮"。传统软件能靠一次渗透测试、跑一遍安全基线就验收上线;但 Agent 不行,它没有"验收那一天",只有"持续对抗的每一天"。明确场景、定义评测集、用攻击用例横向纵向补全、持续评测、形成飞轮——这才是 Agent 时代安全的真正基线。而所有方法论的起点,是承认一件事:human in the loop 不是终点,而是起点。
以上内容整理自 AICon 全球人工智能开发与应用大会 2026 深圳站的前期直播圆桌,完整讨论覆盖 Agent 安全准入基线、MCP 认证、影子 Agent 治理等更多议题。
关注 AICon 2026 深圳站 · Agent 安全专题