🤖 具身智能 · 技术首发

李飞飞 World Labs 首发 R2S2R:用世界模型打通机器人仿真-真机训练闭环

7 月 28 日,李飞飞创立的 World Labs 发布机器人训练闭环引擎 R2S2R(真实-仿真-真机)首批成果。该引擎用生成式世界建模系统把真实机器人任务重建为高保真可交互仿真环境,让机器人策略完全基于仿真数据训练后直接迁移真机执行,并在 5 种不同真机平台上完成线缆插拔、双臂装箱、试管转移等任务的虚实一致性验证。

来源:World Labs 官方技术博客 2025-07-29 全文约 4 分钟读完
#WorldLabs #李飞飞 #具身智能 #世界模型 #Sim-to-Real
5 种真机平台完成虚实一致性验证
0 真实世界训练数据,策略全靠仿真训练
3 交互物体:刚性、关节、可变形

⚡ 30 秒速览

  • 做了什么:推出 R2S2R 引擎,分 Real-to-Sim(真实转仿真)与 Sim-to-Real(仿真转真机)两环节,用世界模型把真实任务重建为可交互数字世界。
  • 凭什么信:同一开环动作序列在仿真与真机中执行,观测结果、物体轨迹、任务结果高度一致;闭环策略在临界成功与失败边界的行为也能复现。
  • 谁在背后:World Labs 与 7 月 21 日收购的机器人仿真创企 SceniX 联合打造。
  • 解决什么瓶颈:机器人长期卡在数据采集贵、真机测试成本高、泛化差——R2S2R 用虚拟环境数据补真实数据的缺口。
  • 深层信号:李飞飞判断,释放机器人领域的 Scaling Law,靠的不是堆真机数据,而是靠环境建模创造可交互数字世界。

01R2S2R 是什么 两个环节构成训练闭环

R2S2R 的全称是 Real-to-Sim-to-Real,它把机器人训练拆成两个对齐环节,构成一个可以反复迭代的闭环:

真实任务采集Real-to-Sim 重建仿真训练评估Sim-to-Real 迁移真机执行

Real-to-Sim:真实转仿真

把机器人本体、传感器、环境、物体与任务演示数据,重建为一个可交互虚拟世界——保留视觉信息,还原决定任务成败的物理交互过程。

Sim-to-Real:仿真转真机

在仿真中训练新策略、主动搜索失效场景、生成针对性数据优化策略,再把通过筛选的策略投入高成本真机测试。

关键区别在于:传统仿真器靠人工搭建虚拟环境,而 R2S2R 用世界模型技术,从真实机器人任务出发重建与现实高度一致的数字世界——不仅还原视觉,也模拟物理反馈和动态变化。

真实环境并不会提供完整干净的测量数据。物体的形状、重量、摩擦力可能存在不确定性;相机和机器人硬件可能与设计参数产生偏差;线缆、包装材料等柔性物体的形变,难以用简单模型完整还原。这正是 Real-to-Sim 要啃的硬骨头。

02它到底能做什么 五台真机 · 一致性验证

World Labs 在 5 种不同真机平台上验证了 R2S2R 的虚实对齐能力,覆盖刚性物体、关节结构与可变形物体三类交互对象:

YAM 机械臂线缆滑动 / 布线 / 插拔
ALOHA 双臂线缆插入 / 立方体交接 / 装箱
RB-Y1 双臂电源线围绕冰箱布线
Flexiv 机械臂严格公差下试管转移
xArm 机械臂标记物 / 铅笔分拣

🧵 柔性线缆插入:ALOHA 双臂开环对齐验证

  • 机器人在线缆发生形变和持续接触的情况下,完成抓取线缆末端并插入孔洞的操作。
  • 同一开环动作序列在仿真与真机中执行,观测结果、物体运动轨迹与任务结果高度一致
意义:验证仿真环境对复杂柔性物体交互过程的还原能力——这是传统仿真器最难处理的物体类型。

📦 双臂装箱:ALOHA零真实训练数据

  • 机器人策略完全基于仿真数据训练,不使用任何真实世界训练数据。
  • 训练完成后直接从虚实对齐仿真环境迁移至真实 ALOHA 机器人,完成双臂装箱操作。
  • 额外测试了光照扰动条件下的鲁棒性——改变视觉环境后,同一策略仍能稳定运行。
意义:证明仿真训练的策略具备对真实环境变化的适应能力,而非只在实验室固定条件下成立。

⚖️ 临界行为复现:立方体交接任务闭环策略评估

  • 正常情况下策略在立方体中心区域完成抓取;接近泛化边界时,机械臂会尝试靠近边缘抓取,几乎导致失败但最终完成。
  • 这种"接近失败但仍成功"的临界行为,在仿真与真机中均复现,并获得一致任务结果。
  • 失败测试同样能还原对应的失败行为与最终结果。
意义:仿真不仅复现成功状态,也能捕捉影响策略表现的临界条件与失效情况——这是规模化评估的前提。

03为什么可信 虚实对齐的验证逻辑

World Labs 提出,一个有价值的仿真系统不需要完全复现真实世界的成功率,但必须支持与现实一致的决策逻辑——能识别策略成功与失败的位置,判断不同策略优劣,并预测训练阶段的改进能否迁移到真实硬件。

验证方式很直接:在仿真与真实环境中执行匹配的开环交互任务,直接对比观测结果、物体响应与最终任务表现。实验覆盖不同策略架构、训练配置,以及训练集内位置(ID)与训练集外未知位置(OOD)两类场景。

传统机器人评估

被动等待真机暴露故障,迭代慢、成本高,覆盖范围有限——这是机器人基础模型研发的主要瓶颈。

R2S2R 规模化评估

在数千种可控仿真条件下主动搜索模型失效场景,真机测试前筛掉大量检查点,只把最有潜力的策略投入高成本硬件测试。

结果显示:仿真环境中表现更好的策略,在真实硬件测试中同样表现更优。仿真能保持不同策略之间的相对排名,跟踪训练过程中的性能提升与停滞阶段,并呈现与真实环境相似的成功区域和失败区域分布。

04为什么是 World Labs 做出来了

李飞飞的判断很清晰:要释放机器人领域的 Scaling Law,靠的不是堆真机数据,而是通过环境建模创造可交互数字世界,用虚拟环境生成的数据补充真实世界中昂贵且难以获取的训练和评估数据。

与大语言模型依靠互联网海量数据快速迭代不同,机器人训练长期面临数据瓶颈——真实环境交互数据采集成本高、难以规模化获取,还受场景、安全和硬件条件限制。这条路径走不通。

World Labs 的解法是世界模型:开发一套新的生成式世界建模系统,能生成高保真视觉效果、精准几何结构以及符合现实规律的物理和动力学表现。这套系统与 7 月 21 日收购的机器人仿真创企 SceniX 的能力形成互补。

World Labs 此前提出,仿真器是世界模型体系中的关键环节,能让智能体在虚拟世界中完成行动、学习和评估。R2S2R 的实验结果进一步验证了这一判断。

编辑视角 · 阅读提示

本文核心事实与案例均来自 World Labs 官方技术博客,属企业单方披露,未见第三方独立复测。文中的"高度一致""相同行为复现"等表述,读者宜理解为研发团队自评口径。案例以视频截图与开环 / 闭环动作对比呈现,尚未公开可复现的量化指标库。

剥离宣传色彩后,技术路线本身值得认真对待:仿真器从"辅助工具"转向"基础设施",本质是把机器人研发的瓶颈从 数据采集 转移到 环境建模保真度 上——后者若成立,机器人训练才有可能复现大模型的 Scaling Law 曲线。

判断:具身智能的下一轮竞争,不在谁拥有更多真机,而在谁能把"世界模型"做成可工程化复用的仿真基础设施——这是从 Demo 走向产业化的必经一关。

深入了解

R2S2R 首批成果的完整技术博客与案例视频,发布于 World Labs 官方渠道。

World Labs 官网 → 技术博客