🤖 具身智能 · RSS 2026 演讲实录

具身智能需要一次『脑内搜索』革命:不用百万小时视频,15 小时 3D 数据胜过 500 小时训练

RSS 2026 悉尼,斯坦福大学李飞飞实验室的黄文龙给出一个反直觉的路线:机器人能力的扩展,不该靠「把动作录下来背下来」,而该靠在 3D 大脑里把「万一」先演一遍。他提出的 Point-World 让机器人在零演示下预测物理演变——2D 预训练 + 15 小时 3D 微调,效果反超 500 小时训练。

来源:公开报道 2026-07-23 全文约 4 分钟读完
#具身智能 #Point-World #世界模型 #RSS 2026 #反事实推理
15 小时 3D 交互数据微调,反超 500 小时训练
3500 小时 Joy 数据集重标注为仿真级 3D 点云
100,000× AlphaGo:移除搜索后所需的数据补偿

注:数字条均引自演讲幻灯片与公开论文数据,其中「反超 500 小时」来自作者在演讲中预告的未发表结论。

⚡ 30 秒速览

  • 裂缝:物理世界数据有「时空不可逆性」——文本可被瞬间复制亿万次,机械臂抓一次杯子就要消耗真实秒数;长尾效应让穷举注定失败。
  • 解法:抛弃对演示数据的「死记硬背」,转向反事实推理——在 3D 点云流空间里,让机器人先「脑内试错」。
  • 成果:Point-World,零样本真实世界模拟器——刚体、布料、流体通吃,无需物体分割,能隐式识别关节结构。
  • 数字:2D 视频预训练 + 仅 15 小时 3D 交互数据微调,环境动力学预测反超 500 小时训练。
  • 终局:把新行为「编译」进已有模型,机器人踏上「递归自我改进」之路——一生的持续学习。

01数据崇拜的裂缝 物理世界的数据,不能复制粘贴

大语言模型靠「读遍互联网文本」拼出了通往智能的通途。这种由 Scaling Law 带来的暴力美学,让具身智能行业在过去两年里陷入一种盲目的数据崇拜:人们坚信,只要像训练大模型一样喂下数百万小时视频,机械臂就能在物理世界中无所不能。

但物理世界的数据有一个根本特性——时空不可逆。文本可以被瞬间复制亿万次,机械臂抓一次杯子,却必须实打实地消耗掉那几秒;更致命的是长尾效应:摩擦、形变、流体……人类不可能靠穷举法,收集齐机器人将要面对的所有场景。

一句话:把大模型的 Scaling Law 原样搬进物理世界,坐标系从一开始就错了。

旧范式 · 演示学习

行业共识是:只要能演示出来的行为,策略就能学会。但这也是天花板——没有演示过的新问题,策略不会创造解法。

新范式 · 反事实推理

拥有一条标准任务轨迹后,模型评估:「如果我采取一组完全不同的动作,结果会怎样?」在想象中试错,而不是在现实中堆数据。

这套逻辑并非空谈。AI 史上最著名的一步棋,早就演示过它的威力。

02证据:那一步棋,与那只袜子

100,000×

出自 AlphaGo 论文:如果移除测试时的搜索过程,模型需要增加 10 万倍数据量,才能维持同等性能。AlphaGo 著名的「第 37 手」从未出现在人类棋谱中,它靠搜索与推演判断为最优解。黄文龙的推断很直接:如果机器人学比围棋和编程更难,反事实推理与搜索就不可或缺。

🧦 翻袜子:一个说不出、写不出的动作

  • 来自 Physical Intelligence 的演示:不是灵巧手,只是普通平行夹爪——一只夹爪伸进袜筒,另一只配合捏拉,把袜子由内而外翻过来。
  • 这个动作难以用语言或代码精确描述,必须看视频才能理解。
  • 人类可能从未在训练数据里见过「翻袜子」,却能即兴创造解法——这就是独创性。
  • 机器人缺失的,恰恰是这种自主获取新行为的能力。
黄文龙由此发问:如果机器人只依赖互联网规模的数据或自身历史数据,它可能永远无法跨越某些能力的鸿沟。

03Point-World:能「脑内试错」的 3D 大脑

如果搜索是答案,该在什么空间里搜索?黄文龙先排除了两个选项:语言与代码空间,2021 年就试过——能拆解任务步骤,但遇到翻袜子这类底层物理交互,语言完全无法描述细节;动作空间也不可行——机器人形态各异,夹爪长度、指尖材质各不相同,很难建立统一的低级动作空间。

他给出的答案:基于机器人几何结构的 3D 空间。

🗣️ 语言与代码空间

能拆解任务步骤,但描述不了物理细节。

🦾 动作空间

形态各异,没有统一的低级动作空间。

🧊 3D 几何空间

从每个连杆采样点,把观测与动作统一成「3D 点云流」。

注:三个方框为演讲中对比的三种候选空间;结论是 3D 几何空间最适合作为反事实推理的载体。

具体做法:给定 RGB-D 输入与机器人的 URDF 描述文件,从每个连杆采样点、计算正运动学,把场景观测与机器人动作全部统一进「3D 点云流」。训练出的 Transformer 模型,本质上是一个零样本真实世界模拟器

💧 布料与流体 无需分割

可变形物体隐式建模,不需要预先做物体分割。

🧊 刚体动力学 零样本

推、拉、堆叠等刚体交互,直接由点云流预测。

🚪 关节结构 隐式识别

能发现冰箱门的运动关节,无需人工标注。

👁️ 遮挡推理 物理常识

第一人称看不到盒子背面,仍能推断接触几何。

注:「零样本」指模型在目标环境与机械臂上没有训练过;作者展示其在完全没见过的环境与机械臂上仍保持高物理保真度。

04最关键的数字:15 小时 > 500 小时

行业默认 3D 数据是稀缺品。团队的解法是:用先进的视觉几何模型,对大规模交互数据(Joy 数据集)重新标注,生成仿真级精度的深度信息与相机位姿,总计约 3500 小时

但真正惊人的,是下面这组对比。

500 小时 3D 训练
基线
15 小时 3D 微调 + 2D 预训练
反超

注:柱形为示意,非等比例缩放;对比结论来自作者在演讲中预告的未发表工作,尚未经过同行评审。

更值得注意的是方法本身:先用近乎无限的 2D 视频预训练拿到通用视觉先验,再用极少量 3D 交互数据「点睛」。这暗示物理世界稀缺昂贵的交互数据,可以被互联网规模的 2D 数据大幅撬动——这正是「15 小时胜过 500 小时」的底层逻辑。

05终局:从「背答案」到「会解题」

黄文龙把通往人类水平物理交互的路径,拆成了两步:

1
前提条件

获得关于行为与动力学的通用先验——也就是世界模型。

2
关键步骤

把先验在物理世界落地,通过反事实推断与搜索不断探索、获取新行为,并编译进已有模型。

世界模型先验物理世界落地反事实搜索新行为涌现编译进模型递归自我改进

真正的学习应当伴随机器人的一生。行业习惯把目光放在「更多数据 → 更好的零样本泛化」上,但这不是全貌。

两条路线正在并行:英伟达 Cosmos 3 试图用全模态定义具身生态的「安卓系统」;斯坦福团队则在底层逻辑上,提供一套绕过算力与数据封锁的「进化算法」。一个在定义生态,一个在改写学习方式本身。
编辑核心判断

具身智能的下半场,比的或许不再是「谁录得更多」,而是「谁能先在 3D 大脑里,把『万一』演上一千万遍」。

诚实注脚:15 小时反超 500 小时,来自演讲中预告的未发表工作,未经同行评审;零样本模拟器也还没有在真实产线上接受物理世界的终审。当数据采集车还在路上奔波时,这场发生在想象空间里的搜索竞赛,已经悄悄改写了下一代的胜负手。

行动入口

VoxPoser 与 ReKep 的项目主页可自行查阅;Point-World 论文尚未公开,建议把 RSS 2026「Data-Centric Robotics」Workshop 的后续论文释放,加入你的关注清单。

关键词:Point-World · 反事实机器人学 · 3D 世界模型