📄 综述论文 · 具身智能

人类视频到机器人动作之间,缺一座桥——IJCAI 2026 综述首次统一四条技术路线

清华大学、香港科技大学与微软亚洲研究院联合发布综述论文,提出一个统一框架:过去两年人类视频驱动机器人学习的四条技术路线,本质都是在人与机器之间搭同一座「表示桥梁」,只是桥墩位置不同。

综合公开信息整理 IJCAI 2026 前夕 全文约 3 分钟读完
#IJCAI 2026 #具身智能 #人类视频 #世界模型
4 条路线 首次被统一为同一框架
1.36亿+ HowTo100M 人类视频片段
3600h+ Ego4D 第一视角视频

⚡ 30 秒速览

  • 核心判断:四条路线(潜在动作 / 显式2D / 显式3D / 世界模型)本质是同一件事——监督信号加在哪一层。
  • 最受关注:世界模型路线。但一作冯志远坦承「效果没有理论分析里那么强」。
  • 三个未解难题:视频语义切分、本体与视角差异、评测基准可能失真。
  • 冯志远判断:现阶段学轨迹收益高于学物理规律,轨迹能把模型从四五十分拉到七八十分。
  • 对产业:人类数据不会取代真机数据——预训练 + 本体匹配,两阶段分工。

01机器人的数据困境

大模型时代,数据规模决定能力上限——互联网文本近乎无限,GPT 才跑得通。但机器人学不来这套:每一条训练数据,都要真实机器人执行一次动作,再把轨迹记录下来。成本高、效率低,数据还强耦合于特定硬件。

Open X-Embodiment、DROID 这些大规模机器人数据集,放在机器学习的尺度上看,仍然算是小数据

于是研究者把目光转向人类视频。

机器人演示数据

真实执行、成本高、强耦合硬件。换一款机器人,数据往往要重新收集。

人类视频

近乎无限、获取成本低、覆盖场景丰富。戴个智能眼镜出门走一圈,所有人都能成为数据来源。

但人类视频不能直接喂给机器人。论文列出三重不兼容:没有可执行的动作标签,没有本体感知信息(关节角度、末端执行器状态),人手运动与机器人控制接口根本不兼容。

这构成了整篇论文要回答的问题:人类视频进入训练流程之后,到底应该变成什么?

02四条路线,一座桥

过去两年,各团队用不同方式让机器人从人类视频学习,看起来各走各路。论文的判断是:它们本质都在做同一件事——在人类视频和机器人动作之间选一个中间表示层,搭一座桥。区别在于桥墩打在哪里。

路线 1🥷 潜在动作:把动作压缩进隐空间

不直接标注动作,让模型自己从视频里「发现」动作。代表工作 LAPA(ICLR 2025)。

  • 监督信号加在隐空间,模型自主学习潜在动作表示
  • 2024 年底到 2025 年上半年引发大量跟进
局限:解释性差。冯志远:「监督信号加在隐空间,中间训到什么阶段,只能看训练 loss。」

路线 2👁️ 显式 2D:在图像平面上标出动作

直接在视频画面上提取可见线索:手部关键点、bounding box、点轨迹、2D pose。代表工作 ATMMagma

  • ATM 用密集点轨迹作为类动作监督信号
  • Magma 将轨迹渲染成「Trace-of-Mark」视觉提示
局限:现实是三维的,2D 缺深度、遮挡易失效。论文里更多扮演辅助监督角色。

路线 3🦾 显式 3D:还原到手部三维轨迹

从视频恢复手部三维运动轨迹,用 MANO 模型作为「标准语言」。代表工作 EgoVLAH-RDTVITRA

  • 对齐质量高,直接提供机器人控制所需的坐标系表示
  • 被冯志远视为 VLA 训练中「100% 需要的辅助监督」
局限:3D 标注成本高,野外视频重建精度不及 2D 监督。

路线 4🌍 世界模型:先预测未来,再反推动作

让模型学会预测环境未来变化,而不是直接预测动作。代表工作 GR-1GR-2(3800 万视频片段预训练)、WAM

  • WAM 范式:世界模型骨干 + action expert 解码轨迹
  • 故事逻辑最自洽:天然适配大规模视频、训练范式成熟
局限:效果未达理论预期。视觉 token 计算成本高,知识蒸馏到动作预测仍是开放问题。

03监督信号加在哪一层?

把四条路线排在一起,会发现它们只有一个本质差别:监督信号加在哪一层。用冯志远的话说,这四种路线都是一种监督的表征,都是在搭桥,只是选了不同的桥墩位置。

人类视频中间表示层(桥墩)机器人动作

正因为本质是同一类东西,它们可以叠加使用,而不是互斥竞争。目前业界认为比较合理的组合:VLA 训练中 3D 轨迹监督是必选项,2D 轨迹作为补充;世界模型路线则视情况叠加像素级或 latent 级监督。

那么,哪条路离未来更近?

04三个还没解决的难题

论文第五节列出的开放挑战,是整篇论文最有冲击力的部分。

✂️ 难题一:零散视频怎么切成有效训练片段?数据治理

  • YouTube 教程旁白与操作动作对齐松散,Ego4D 等第一视角视频未经剪辑,含大量视角切换和离题片段
  • 同样的视觉过渡可能对应不同动作意图,模糊性会破坏学习信号
  • 当前大多基于固定时间窗口切割,论文建议以操作阶段和物体状态变化为边界

🧩 难题二:本体差异 + 视角差异,怎么同时解决?核心瓶颈

  • 人手高自由度 → 低自由度机械臂是欠约束问题,不同人类动作可能对应同一机器人指令
  • 机器人用固定中心视角,网络视频以第三人称为主,第一视角也会转头、遮挡
  • 可能方向:以交互结果为锚点的表示方式(如物体状态变化),而非视角相关外观特征

📏 难题三:评测基准可能根本测不出真实能力最警觉

  • LIBERO、CALVIN、SIMPLER 等基准的任务多样性,远不及真实人类视频覆盖范围
  • 在基准上刷出的提升,可能是 benchmark 特有的,不能回答「是否真正提升了泛化」
  • 建议:追踪不同机器人数据预算下的迁移效率,量化视角/本体鲁棒性

相比给已有方法贴分类标签,指出评测体系本身可能存在系统性偏差,需要更多勇气。

05关于人类视频的四个判断

论文之外,一作冯志远围绕数据价值、技术路线与产业布局给出了他的判断。

人类数据会取代机器人真实数据吗?
不会,两阶段分工。先用大量人类数据做预训练,学习通用操作能力;再用机器人数据做 post training,让模型适配具体本体。机器人数据的角色从「承担所有训练」变为「负责最后一步本体匹配」。
最大的技术鸿沟是什么?
本体差异。人和机械臂的运动空间不兼容。但未来灵巧手 + 头戴相机,会让 mapping 本身变得更简单——不是完全解决映射,而是通过硬件设计降低转换成本
最看好哪条路线?
世界模型。研究逻辑更完整:先预测未来状态,再反推动作轨迹,轨迹更收敛。而且视频生成已是被验证的成熟方向。但「效果没有理论分析里那么强」,Recipe 尚未收敛
学动作轨迹,还是学背后的物理规律?
现阶段学轨迹收益更高。轨迹信息能把模型从四五十分拉到七八十分;物理规律建模(摩擦力、接触力)是模型达到高水平后才需要的。真正到具身 AGI 阶段物理一定不可缺,但现在距离那个阶段还有一段距离
编辑核心判断

具身智能的「GPT-3.5 时刻」还很远。世界模型的故事最完整,但 Recipe 尚未收敛——VLA+RL 能做出漂亮的 demo,却做不通真正的泛化。现阶段优先级很明确:先学会动作轨迹,再谈物理规律。

论文在哪看

该综述论文已被 IJCAI 2026 接收,会议期间可通过官方议程获取全文。

IJCAI 2026 官方议程 → 关注论文发布