📄 综述论文 · 具身智能
人类视频到机器人动作之间,缺一座桥——IJCAI 2026 综述首次统一四条技术路线
清华大学、香港科技大学与微软亚洲研究院联合发布综述论文,提出一个统一框架:过去两年人类视频驱动机器人学习的四条技术路线,本质都是在人与机器之间搭同一座「表示桥梁」,只是桥墩位置不同。
综合公开信息整理•
IJCAI 2026 前夕•
全文约 3 分钟读完
#IJCAI 2026
#具身智能
#人类视频
#世界模型
4 条路线
首次被统一为同一框架
1.36亿+
HowTo100M 人类视频片段
3600h+
Ego4D 第一视角视频
⚡ 30 秒速览
- 核心判断:四条路线(潜在动作 / 显式2D / 显式3D / 世界模型)本质是同一件事——监督信号加在哪一层。
- 最受关注:世界模型路线。但一作冯志远坦承「效果没有理论分析里那么强」。
- 三个未解难题:视频语义切分、本体与视角差异、评测基准可能失真。
- 冯志远判断:现阶段学轨迹收益高于学物理规律,轨迹能把模型从四五十分拉到七八十分。
- 对产业:人类数据不会取代真机数据——预训练 + 本体匹配,两阶段分工。
01机器人的数据困境
大模型时代,数据规模决定能力上限——互联网文本近乎无限,GPT 才跑得通。但机器人学不来这套:每一条训练数据,都要真实机器人执行一次动作,再把轨迹记录下来。成本高、效率低,数据还强耦合于特定硬件。
Open X-Embodiment、DROID 这些大规模机器人数据集,放在机器学习的尺度上看,仍然算是小数据。
于是研究者把目光转向人类视频。
机器人演示数据
真实执行、成本高、强耦合硬件。换一款机器人,数据往往要重新收集。
人类视频
近乎无限、获取成本低、覆盖场景丰富。戴个智能眼镜出门走一圈,所有人都能成为数据来源。
但人类视频不能直接喂给机器人。论文列出三重不兼容:没有可执行的动作标签,没有本体感知信息(关节角度、末端执行器状态),人手运动与机器人控制接口根本不兼容。
这构成了整篇论文要回答的问题:人类视频进入训练流程之后,到底应该变成什么?
02四条路线,一座桥
过去两年,各团队用不同方式让机器人从人类视频学习,看起来各走各路。论文的判断是:它们本质都在做同一件事——在人类视频和机器人动作之间选一个中间表示层,搭一座桥。区别在于桥墩打在哪里。
路线 1🥷 潜在动作:把动作压缩进隐空间
不直接标注动作,让模型自己从视频里「发现」动作。代表工作 LAPA(ICLR 2025)。
- 监督信号加在隐空间,模型自主学习潜在动作表示
- 2024 年底到 2025 年上半年引发大量跟进
局限:解释性差。冯志远:「监督信号加在隐空间,中间训到什么阶段,只能看训练 loss。」
路线 2👁️ 显式 2D:在图像平面上标出动作
直接在视频画面上提取可见线索:手部关键点、bounding box、点轨迹、2D pose。代表工作 ATM、Magma。
- ATM 用密集点轨迹作为类动作监督信号
- Magma 将轨迹渲染成「Trace-of-Mark」视觉提示
局限:现实是三维的,2D 缺深度、遮挡易失效。论文里更多扮演辅助监督角色。
路线 3🦾 显式 3D:还原到手部三维轨迹
从视频恢复手部三维运动轨迹,用 MANO 模型作为「标准语言」。代表工作 EgoVLA、H-RDT、VITRA。
- 对齐质量高,直接提供机器人控制所需的坐标系表示
- 被冯志远视为 VLA 训练中「100% 需要的辅助监督」
局限:3D 标注成本高,野外视频重建精度不及 2D 监督。
路线 4🌍 世界模型:先预测未来,再反推动作
让模型学会预测环境未来变化,而不是直接预测动作。代表工作 GR-1、GR-2(3800 万视频片段预训练)、WAM。
- WAM 范式:世界模型骨干 + action expert 解码轨迹
- 故事逻辑最自洽:天然适配大规模视频、训练范式成熟
局限:效果未达理论预期。视觉 token 计算成本高,知识蒸馏到动作预测仍是开放问题。
03监督信号加在哪一层?
把四条路线排在一起,会发现它们只有一个本质差别:监督信号加在哪一层。用冯志远的话说,这四种路线都是一种监督的表征,都是在搭桥,只是选了不同的桥墩位置。
人类视频→中间表示层(桥墩)→机器人动作
正因为本质是同一类东西,它们可以叠加使用,而不是互斥竞争。目前业界认为比较合理的组合:VLA 训练中 3D 轨迹监督是必选项,2D 轨迹作为补充;世界模型路线则视情况叠加像素级或 latent 级监督。
那么,哪条路离未来更近?
04三个还没解决的难题
论文第五节列出的开放挑战,是整篇论文最有冲击力的部分。
✂️ 难题一:零散视频怎么切成有效训练片段?数据治理
- YouTube 教程旁白与操作动作对齐松散,Ego4D 等第一视角视频未经剪辑,含大量视角切换和离题片段
- 同样的视觉过渡可能对应不同动作意图,模糊性会破坏学习信号
- 当前大多基于固定时间窗口切割,论文建议以操作阶段和物体状态变化为边界
🧩 难题二:本体差异 + 视角差异,怎么同时解决?核心瓶颈
- 人手高自由度 → 低自由度机械臂是欠约束问题,不同人类动作可能对应同一机器人指令
- 机器人用固定中心视角,网络视频以第三人称为主,第一视角也会转头、遮挡
- 可能方向:以交互结果为锚点的表示方式(如物体状态变化),而非视角相关外观特征
📏 难题三:评测基准可能根本测不出真实能力最警觉
- LIBERO、CALVIN、SIMPLER 等基准的任务多样性,远不及真实人类视频覆盖范围
- 在基准上刷出的提升,可能是 benchmark 特有的,不能回答「是否真正提升了泛化」
- 建议:追踪不同机器人数据预算下的迁移效率,量化视角/本体鲁棒性
相比给已有方法贴分类标签,指出评测体系本身可能存在系统性偏差,需要更多勇气。
05关于人类视频的四个判断
论文之外,一作冯志远围绕数据价值、技术路线与产业布局给出了他的判断。
人类数据会取代机器人真实数据吗?
不会,两阶段分工。先用大量人类数据做预训练,学习通用操作能力;再用机器人数据做 post training,让模型适配具体本体。机器人数据的角色从「承担所有训练」变为「负责最后一步本体匹配」。
最大的技术鸿沟是什么?
本体差异。人和机械臂的运动空间不兼容。但未来灵巧手 + 头戴相机,会让 mapping 本身变得更简单——不是完全解决映射,而是通过硬件设计降低转换成本。
最看好哪条路线?
世界模型。研究逻辑更完整:先预测未来状态,再反推动作轨迹,轨迹更收敛。而且视频生成已是被验证的成熟方向。但「效果没有理论分析里那么强」,Recipe 尚未收敛。
学动作轨迹,还是学背后的物理规律?
现阶段学轨迹收益更高。轨迹信息能把模型从四五十分拉到七八十分;物理规律建模(摩擦力、接触力)是模型达到高水平后才需要的。真正到具身 AGI 阶段物理一定不可缺,但现在距离那个阶段还有一段距离。
编辑核心判断
具身智能的「GPT-3.5 时刻」还很远。世界模型的故事最完整,但 Recipe 尚未收敛——VLA+RL 能做出漂亮的 demo,却做不通真正的泛化。现阶段优先级很明确:先学会动作轨迹,再谈物理规律。