🤖 具身智能 · 顶会精读
IJCAI 2026 提出的 AC²-VLA 架构,用动作反向调度计算,推理加速 1.79 倍且成功率不降
针对 VLM 骨干网络运行缓慢导致的机器人高延迟难题,最新研究提出“动作上下文自适应计算”框架 AC²-VLA。通过以机器人的动作状态而非视觉画面作为调度指挥官,将理论计算量降至 29.4%,实现同类最优的 1.79 倍端到端加速。
来源:综合公开论文与学术报道•
2026-01•
全文约 3 分钟读完
#IJCAI2026
#具身智能
#VLA模型
#模型加速
#自适应计算
1.79倍
实际推理速度提升(SOTA)
29.4%
FLOPs 计算量(相比原始模型)
76.8%
平均任务成功率(超未压缩基线)
⚡ 30 秒速览
- 部署痛点:机械臂每动一下需停顿两三秒,传统 VLA 逐帧全量运行庞大视觉语言骨干,无法满足实时控制需求。
- 思路转变:指出传统“视觉剪枝”走偏了——视觉复杂度不等于控制难度,机器人的动作状态才是指挥算力分配的最佳信号。
- 三大机制:同一 Router 统一调度认知缓存复用、视觉 Token 剪枝、Transformer 动态层跳过。
- 训练巧思:放弃离散稀疏的任务成功率信号,采用 Dense 策略自蒸馏,兼顾性能与跨模型迁移能力。
- 实测效果:SIMPLER 仿真基准下成功率高达 76.8%(超越基线 74.8%),在特定缓存阈值下更把成功率推至 87.1%。
01错位矛盾 为什么传统的“看视觉算算力”走偏了?
机器人要走进车间与家庭,速度是硬指标。以往高效 VLA 尝试从视觉侧裁剪计算(如剪枝视觉 Token、复用前帧),但忽略了一个核心矛盾:
传统视觉驱动剪枝
以视觉复杂度决定计算量:机械臂接近目标的精细微操阶段画面简单,却被误判为“不重要”而降低计算,导致夹取失败。
AC²-VLA 动作驱动调度
以动作控制难度决定计算量:微操关键期全力计算,大范围快移阶段削减算力,真正贴近具身控制本质。
VLA 的最终产出是动作序列。将动作上下文(Action Context)作为指挥信号,控制模型的思维深度,才是高效推理的正确路径。
02三位一体 统一 Router 调度的三大提速武器
系统将视觉观测、语言指令与上一时刻动作组合为动作先验向量,输入统一路由器(Router),动态调度三套机制:
🧠 认知缓存复用 Cognition Caching
- 当运动状态连续且视觉状态匹配时,发起了缓存复用请求。
- 直接跳过庞大的 VLM 骨干网络计算,将缓存特征直送 action head 生成动作。
优势:减少高频视觉噪声带来的动作抖动,实现平滑控制。
🔍 视觉 Token 剪枝 Token Pruning
- Router 为每个视觉 Token 实时打分,剔除无关区域。
- 接近目标时聚焦夹爪周边,大范围移动时适度降低局部权重。
⚡ Transformer 动态层跳过 Layer Skipping
- 按动作阶段调用不同深度的网络,并非固定跳过特定层。
- 接触阶段与移动阶段调用的网络层序号完全自适应调整。
03训练巧思 为何不直接用“任务成功率”来训练 Router?
直观上看,似乎可以用任务成功率作为强化学习信号。但研究团队指出了这一路线的缺陷:
成功率是高度稀疏、后验的信号,无法实时反馈到每个控制时间步;且依赖具体任务成功率会导致模型失去泛化性,换一个 backbone 就需重新调参。
🎯 解法:稠密策略自蒸馏(Self-Distillation)
- Teacher 模型:采用未稀疏化的稠密模型(Dense Policy)。
- Student 模型:稀疏化后的模型模仿 Teacher 的动作输出与骨干特征表示。
- 结果:无需重新为新任务调参,换用不同 VLA 底座仅需走一遍蒸馏即可迁移。
04实测硬核表现 SIMPLER 仿真基准成绩
在 Google Robot Visual Matching 设定下,AC²-VLA 展现出“算力大减,性能反升”的表现:
AC²-VLA (τ=0.2)最佳缓存配置
87.1%
注:数据源于 SIMPLER 高保真仿真基准下 Google Robot 任务集。抽屉拉开(Drawer Opening)任务成功率由 71.8% 升至 80.6%。
29.4%FLOPs 理论计算量
1.79x实际端到端提速
+12.3%最高成功率提升
关于理论计算量(29.4%)与实际加速(1.79x)的差异:实测开销包含了 Router 本身运算、Token 剪枝时的内存移动以及缓存查询与命中开销,端到端加速才是真正落地参考指标。
05行业视角
编辑核心判断
AC²-VLA 的核心突破在于范式转换:将“动作”从模型的输出终点,重构为算力调度的指挥信号。将 7B 量级 VLA 模型压至端侧流畅运行,是具身智能走向真实工厂与家庭的关键突破。
📄论文与预印本
该成果已入选 IJCAI 2026,相关论文已在 ArXiv 公开。
arXiv:2601.19634