李飞飞 World Labs 首发 R2S2R:用世界模型打通机器人仿真-真机训练闭环
7 月 28 日,李飞飞创立的 World Labs 发布机器人训练闭环引擎 R2S2R(真实-仿真-真机)首批成果。该引擎用生成式世界建模系统把真实机器人任务重建为高保真可交互仿真环境,让机器人策略完全基于仿真数据训练后直接迁移真机执行,并在 5 种不同真机平台上完成线缆插拔、双臂装箱、试管转移等任务的虚实一致性验证。
7 月 28 日,李飞飞创立的 World Labs 发布机器人训练闭环引擎 R2S2R(真实-仿真-真机)首批成果。该引擎用生成式世界建模系统把真实机器人任务重建为高保真可交互仿真环境,让机器人策略完全基于仿真数据训练后直接迁移真机执行,并在 5 种不同真机平台上完成线缆插拔、双臂装箱、试管转移等任务的虚实一致性验证。
R2S2R 的全称是 Real-to-Sim-to-Real,它把机器人训练拆成两个对齐环节,构成一个可以反复迭代的闭环:
把机器人本体、传感器、环境、物体与任务演示数据,重建为一个可交互虚拟世界——保留视觉信息,还原决定任务成败的物理交互过程。
在仿真中训练新策略、主动搜索失效场景、生成针对性数据优化策略,再把通过筛选的策略投入高成本真机测试。
关键区别在于:传统仿真器靠人工搭建虚拟环境,而 R2S2R 用世界模型技术,从真实机器人任务出发重建与现实高度一致的数字世界——不仅还原视觉,也模拟物理反馈和动态变化。
真实环境并不会提供完整干净的测量数据。物体的形状、重量、摩擦力可能存在不确定性;相机和机器人硬件可能与设计参数产生偏差;线缆、包装材料等柔性物体的形变,难以用简单模型完整还原。这正是 Real-to-Sim 要啃的硬骨头。
World Labs 在 5 种不同真机平台上验证了 R2S2R 的虚实对齐能力,覆盖刚性物体、关节结构与可变形物体三类交互对象:
World Labs 提出,一个有价值的仿真系统不需要完全复现真实世界的成功率,但必须支持与现实一致的决策逻辑——能识别策略成功与失败的位置,判断不同策略优劣,并预测训练阶段的改进能否迁移到真实硬件。
验证方式很直接:在仿真与真实环境中执行匹配的开环交互任务,直接对比观测结果、物体响应与最终任务表现。实验覆盖不同策略架构、训练配置,以及训练集内位置(ID)与训练集外未知位置(OOD)两类场景。
被动等待真机暴露故障,迭代慢、成本高,覆盖范围有限——这是机器人基础模型研发的主要瓶颈。
在数千种可控仿真条件下主动搜索模型失效场景,真机测试前筛掉大量检查点,只把最有潜力的策略投入高成本硬件测试。
结果显示:仿真环境中表现更好的策略,在真实硬件测试中同样表现更优。仿真能保持不同策略之间的相对排名,跟踪训练过程中的性能提升与停滞阶段,并呈现与真实环境相似的成功区域和失败区域分布。
李飞飞的判断很清晰:要释放机器人领域的 Scaling Law,靠的不是堆真机数据,而是通过环境建模创造可交互数字世界,用虚拟环境生成的数据补充真实世界中昂贵且难以获取的训练和评估数据。
与大语言模型依靠互联网海量数据快速迭代不同,机器人训练长期面临数据瓶颈——真实环境交互数据采集成本高、难以规模化获取,还受场景、安全和硬件条件限制。这条路径走不通。
World Labs 的解法是世界模型:开发一套新的生成式世界建模系统,能生成高保真视觉效果、精准几何结构以及符合现实规律的物理和动力学表现。这套系统与 7 月 21 日收购的机器人仿真创企 SceniX 的能力形成互补。
World Labs 此前提出,仿真器是世界模型体系中的关键环节,能让智能体在虚拟世界中完成行动、学习和评估。R2S2R 的实验结果进一步验证了这一判断。
本文核心事实与案例均来自 World Labs 官方技术博客,属企业单方披露,未见第三方独立复测。文中的"高度一致""相同行为复现"等表述,读者宜理解为研发团队自评口径。案例以视频截图与开环 / 闭环动作对比呈现,尚未公开可复现的量化指标库。
剥离宣传色彩后,技术路线本身值得认真对待:仿真器从"辅助工具"转向"基础设施",本质是把机器人研发的瓶颈从 数据采集 转移到 环境建模保真度 上——后者若成立,机器人训练才有可能复现大模型的 Scaling Law 曲线。
判断:具身智能的下一轮竞争,不在谁拥有更多真机,而在谁能把"世界模型"做成可工程化复用的仿真基础设施——这是从 Demo 走向产业化的必经一关。
R2S2R 首批成果的完整技术博客与案例视频,发布于 World Labs 官方渠道。
World Labs 官网 → 技术博客