🛡️ 具身智能 · 安全论文

黑盒攻击让导航机器人走偏:AdvNav 测出视觉语言导航最高 87.30% 攻击成功率

香港科技大学(广州)团队提出 AdvNav:不读取模型参数、不获取梯度,只观察导航行为,就能优化针对视觉输入的扰动。论文已被 ACM Multimedia 2026 录用。

论文解读 视觉语言导航 黑盒安全测试
#AdvNav #具身智能 #视觉语言导航 #AI安全
87.30% 最高攻击成功率
3种配置 覆盖传统与大模型导航系统
0 内部参数与梯度访问

Hero 数字只呈现结论性信息;具体模型、数据集与消融结果放在正文中展开。

⚡ 30 秒速览

  • 发生了什么:AdvNav 用黑盒方式攻击视觉语言导航系统,验证机器人可能因轻微视觉扰动而持续走偏。
  • 测到了什么:在 R2R 数据集上,HAMT 攻击成功率为 49.70%;MapGPT 搭配不同视觉骨干时达到 65.96%87.30%
  • 为什么可信:框架同时利用轨迹级表现、动作级奖励和轨迹偏离信息,并结合自适应扰动与遗传算法。
  • 扰动长什么样:论文观察到的扰动更像低频的雾霾或灰尘,不一定显眼,却会持续削弱环境结构线索。
  • 需要保留的边界:结果来自特定数据集和模型配置,不能直接等同于真实机器人在开放环境中的故障率。

01先看问题:机器人为什么会“信错自己的眼睛”?

医院配送、仓库搬运和家庭服务机器人,都在逐渐从“按固定地图行驶”转向视觉语言导航(VLN):它们需要看懂画面、理解人类指令,再结合此前走过的路,连续决定下一步动作。系统的判断链条越长,视觉输入出现偏差后,后续决策就越可能被一起带偏。

真正脆弱的,可能不是腿,而是眼睛。

01 / INPUT

像素被当成事实

光照、遮挡、污渍或人为扰动,都可能改变机器人对场景的理解。

02 / DECISION

错误进入连续决策

一次动作偏差未必立即失败,却可能改变后续路径与观察结果。

03 / OUTCOME

小错放大成偏航

最终表现为导航误差升高、路径效率下降,甚至走错楼层。

这条链路展示的是风险传播过程,不代表每次视觉扰动都会导致任务失败。

过去的导航研究更多关注“干净环境里能不能走得准”,而 AdvNav 追问的是另一件事:当输入被轻微改变、模型又不允许被拆开检查时,它究竟还能不能可靠完成任务?

02为什么可信:它没有打开模型的“脑子”

AdvNav 的设定接近真实封闭产品:攻击者无法访问模型参数和梯度,只能在机器人看到的图像上叠加扰动,再观察它如何行动。问题因此从“根据梯度改图像”,变成了“根据行为判断下一步怎么改”。

反馈 01

轨迹级表现

结合 SPL 与导航误差 NE,判断整条路径是否更低效、更偏离目标。

反馈 02

动作级奖励

观察每个时间步选择正确动作与错误动作的倾向,补足最终结果滞后的问题。

反馈 03

轨迹偏离

判断机器人是否已经离开参考轨迹,优先保留真正造成行为变化的候选扰动。

SPL 越低通常代表路径效率越差;NE 越高代表最终位置离目标越远。两类指标从不同层面描述导航受损程度。

自适应扰动强度 根据每轮反馈调整扰动幅度,避免固定步长无效或过度。
遗传算法优化结构 让噪声形态在有限查询预算内持续筛选和进化。
相对攻击收益 比较候选扰动与上一轮结果,决定是否更新累计扰动。

“查询预算”可理解为系统允许攻击者观察模型行为、反复试探的次数;预算越有限,优化难度越高。

这也是 VLN 黑盒攻击比普通图像分类更难的原因:分类模型通常一次输入就给出答案,而导航系统要处理视觉、语言和历史轨迹,且任务反馈往往要到整段路线结束后才出现。

03它到底能做到什么?R2R 定量实验

论文在经典 R2R 数据集上测试了两类导航系统:基于 Transformer 的 HAMT,以及基于大语言模型的 MapGPT。结果显示,攻击并不局限于某一种视觉感知或决策范式。

MapGPT + GPT-4V 闭源视觉骨干
87.30%
MapGPT + Qwen3-VL 开源视觉骨干
65.96%
HAMT Transformer 架构
49.70%

柱形按 0%—100% 的完整区间绘制;攻击成功率指扰动导致导航任务被成功破坏的比例,不是机器人原本的导航成功率。

HAMT:平均攻击率 49.70% 11 个场景

  • 在 11 个场景上进行测试,部分特定场景的攻击成功率达到 100%
  • 攻击同时伴随导航效率下降和最终误差上升,说明影响不是单个动作失误,而是路径层面的持续偏移。
实验判断:AdvNav 不依赖某个特定场景布局或指令模板,也能保持较稳定的黑盒攻击效果。

MapGPT:大模型导航也未能避开视觉软肋 最高 87.30%

  • 搭配 Qwen3-VL 时,攻击成功率为 65.96%;搭配 GPT-4V 时升至 87.30%
  • 这表明推理能力增强,并不自动意味着输入受到扰动后仍然稳健。
实验判断:AdvNav 更像一个通用压力测试框架,而不是只针对某个底层视觉模块的攻击技巧。

04为什么有效:它把“看不见的偏差”变成了行为信号

AdvNav 的关键不在于制造一张肉眼夸张的错误图片,而在于把导航系统的连续行为拆开观察:整条轨迹有没有偏、每一步动作有没有变、最终是否离开参考路线。多粒度反馈让攻击者不必等到任务结束,才知道这一轮尝试是否有价值。

实验设置攻击成功率相对变化
随机扰动 23.40% 基线
移除动作级奖励 下降 17.02 个百分点
移除轨迹级表现 下降 2.13 个百分点
移除结构进化 38.30% 明显下降
移除强度更新 26.60% 明显下降

消融实验用于观察删去某个组件后的性能变化;“下降 17.02 个百分点”是相对完整 AdvNav 的变化,不等同于下降 17.02%。

可视化结果还提供了一个重要线索:AdvNav 找到的扰动具有更低的 LPIPS 感知距离。简单说,它在视觉上更接近原图,呈现为类似镜头雾气或灰尘的低频、相干亮度变化,不容易被普通预处理直接抹掉。

显眼的高频噪声

容易被察觉,也更可能被常规图像预处理削弱;对连续导航的影响未必稳定。

低频相干扰动

与原始画面更相似,却可能持续降低结构线索的对比度,让路径判断逐步发生漂移。

LPIPS 越接近 0,代表扰动图像与原图在感知上越相似;原文强调了相对优势,但未在报道中给出完整数值表。

一个诚实的注脚:这项工作证明的是“系统存在可被黑盒利用的视觉脆弱性”,不是证明所有真实机器人都会以同样比例失效。

编辑核心判断

AdvNav 的攻击成功率很高,但实验仍主要建立在 R2R 数据集、特定模型配置与仿真式评测之上;现实部署中的摄像头成像、查询限制、环境变化和安全冗余,都会改变最终风险。

具身智能的安全门槛,应从“能不能到达”改成“在输入被动手脚时,仍能否可靠到达”。

06如何继续复核?

这篇工作适合从三个角度继续阅读:攻击反馈如何构造、不同模型为何出现差异,以及扰动能否迁移到真实摄像头和开放环境。完整论文可按题目检索。

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

论文方向:黑盒对抗攻击 · 视觉语言导航 · 具身智能鲁棒性。