🚪 具身智能 · 机器人操控

一段视频,教会机器人开门穿门:Video2DoorTraversal 打通 Real-to-Sim-to-Real

对机器人来说,推门不是「推」那么简单——它需要同时解决定位、接触、协调与穿越四个难题。纽娲机器人联合上海交通大学、山东大学发布 Video2DoorTraversal:用一段普通 RGB 视频生成可交互的「数字门」DoorTwin,在仿真中练好策略,再回真机执行。五扇门、175 次实测,成功 169 次,平均成功率 96.57%

来源:综合公开信息整理 2026-08 全文约 4 分钟读完
#Video2DoorTraversal #具身智能 #Real-to-Sim-to-Real #轮足机器人
96.57% 五扇真实门 · 175 次实测平均成功率
80.95% 三扇结构相似未见门 · 零样本成功率
≈13s 平均完成开门+穿越 · 机载本地推理

⚡ 30 秒速览

  • 一条主线:一段普通 RGB 视频 → 重建可交互的「数字门」DoorTwin → 纯仿真训练 → 真机端到端执行。
  • 硬核成绩:五扇门各测 35 次、共 175 次,成功 169 次,平均成功率 96.57%。
  • 迁移证据:三扇结构相似但训练未见的门,零样本成功率 80.95%,无需新增轨迹或额外训练。
  • 迁移密钥:仿真中刻意改变位姿、摩擦、阻尼、相机噪声,只保留扰动下依然成功的轨迹作为训练数据。
  • 诚实边界:当前覆盖推门场景;拉门、更多把手机制与更丰富的门体结构,被论文列为后续方向。

01一扇门,为什么这么难

人过一扇门,近乎零思考。机器人过一扇门,却是一次把感知、移动、操作、控制高压拧在一起的综合考试:先锁定把手的空间位姿,靠近并完成接触,在门体开始移动的瞬间协调好底盘、机械臂与夹爪,还要避开门框干涉,连续穿过狭窄通道。任何一环脱节,整段动作就在门前停摆。

更要命的是:门根本不是标准件。

门板尺寸、铰链方向、把手形态、安装位置、开启阻力,处处在变。常见方案要么依赖预先建好的门资产,要么临时扫描建模,要么为每扇门人工设计任务——每换一扇门,都要重新「伺候」一遍。这正是新框架试图抹掉的工作量。

175总测试次数
169成功次数
5主实验门
35每扇测试

五扇门主实验,每扇门单独采集一段 RGB 视频,在论文指定的轮足移动操作平台上各测 35 次,合计 175 次、成功 169 次。数据来自论文评测协议,不构成对通用开门能力的推断。

02从一段视频,到一扇「能动」的门

Video2DoorTraversal 的第一步,是把一扇真实门「搬」进仿真,生成一个名为 DoorTwin 的数字孪生。系统从单段 RGB 视频中恢复带真实尺度的几何信息与相机运动,识别门板、把手与铰链关系,输出同时包含关节结构、碰撞几何和外观纹理的可交互资产。

这扇数字门,既得「像」,还得「能动」。

视觉上逼近真实,物理上能被抓住、转动和推开——两个条件缺一个,机器人在仿真里的练习就无法迁移到真机上。

单段 RGB 视频恢复真实尺度识别门板/把手/铰链生成 DoorTwin视觉校验

系统会从参考视角反复核对轮廓、比例、把手类型、铰链方向与部件位置,并持续修正生成结果,直到数字门在视觉与物理两个层面都「过关」。

03把「现场试错」搬进仿真

DoorTwin 建好后,仿真闭环代理把开门任务拆成一组参数化技能:接近、抓取、转动把手、推门、穿越。在模拟器里反复执行,失败一次,就根据碰撞、接触、把手旋转与门体开启状态分析原因,在邻近参数空间继续搜索;只有通过任务、碰撞与运动学三重验证的轨迹,才会进入训练集。

换句话说:真机上的试错,被整体搬进了仿真。

训练还刻意加扰——机器人与门的初始位姿随机变化,铰链摩擦、开门阻尼、相机外参随机变化,深度图被叠加多种噪声。只有扰动之下依然成功的轨迹,才够格成为策略的「教材」。

① 拆解

把开门任务变为参数化技能集,逐项执行

② 执行

在模拟器内反复尝试,记录每一步状态

③ 筛选

任务、碰撞、运动学三重验证逐条把关

④ 留存

只保留扰动下依然成功的轨迹作训练数据

真机执行时,策略 ArticuACT 融合前视与腕部双视角深度图及机器人状态,协同输出底盘、机械臂与夹爪指令,并预测接触、把手转动与门体开启进度。

04两个数字,两种含义

96.57% 与 80.95%,对应的是两个不同层级的承诺。

96.57% · 五扇门的「端到端」

五扇真实门、175 次实测的平均成功率。它说明「单段视频 → 仿真训练 → 真机执行」这条链路,在论文限定条件下是走得通的。

80.95% · 未见门的「零样本」

三扇结构相似、训练中从未见过的门上的零样本成功率。它说明策略具备初步的跨门迁移能力,而非死记某一扇门的动作序列。

但别把 96.57% 读成「通用开门」。

论文把边界划得很清楚:目前验证的是推门场景;拉门、更多把手机制与更丰富的门体结构,都被列为后续方向。每扇目标门也分别需要一段视频作为输入——它压缩的是重建与适配成本,不是「拍一次视频解决所有门」。

── 论文划定的边界 ──

  • 实验平台:论文指定的轮足移动操作平台
  • 输入方式:每扇目标门各采集一段 RGB 视频
  • 覆盖场景:推门(含把手抓取、转动、穿越)
  • 迁移范围:零样本仅验证于结构相似的门
  • 单次耗时:接近到穿越平均约 13 秒,视觉与策略推理均在机载本地完成

以上边界均以论文公开表述为准,不构成对通用开门或成熟商用产品的推断。

05从「过门」到「通行」

门,只是开放人类环境里最常见的通行设施之一。

对纽娲机器人来说,这件事的真正坐标要大得多。

纽娲把具身智能定义为机器人在开放人类环境中的持续通行与任务完成——他们更愿意把它描述成「具身智能与自动驾驶的交集」。在公司级的架构里,WorldWeaver 负责把真实场景数据组织成三维资产,SimWeaver 提供物理仿真能力,WTM(世界通行模型)则把空间理解、任务判断、导航与具身操作统一进同一个智能底座。

WorldWeaver · 数据组织层

真实场景 → 可复用的三维资产

SimWeaver · 物理仿真层

三维资产 → 可交互的训练与评测场

WTM · 世界通行模型

空间理解 + 任务判断 + 导航 + 具身操作

Video2DoorTraversal 正是这条路径上的一块拼图:真实场景进入数字环境,机器人在仿真中积累经验,再回到真实任务里接受检验。它验证的不只是一扇门——而是「真实世界可被数字化重演」这一前提。

诚实注脚:DoorTwin 与论文仿真管线的技术细节已公开,但它与 WorldWeaver、SimWeaver、WTM 是否已形成统一工程闭环,仍待纽娲更多技术披露确认。
编辑核心判断

单段视频生成「可交互数字门」,压缩的是整个行业最贵的一环——场景适配成本。当新场景的开销从「工程师带扫描设备进场」变成「随手拍一段视频 + 一次仿真训练」,具身智能才真正摸到了规模化的门把手。接下来的关键不在门里:能不能把「拍视频 → 仿真 → 迁移」这条链路复制到门以外的更多设施与本体,才是这项技术从论文走进产品的真正考题。

研究入口

论文以 arXiv 预印本形式公开,项目站提供演示视频与补充材料。

📄论文

Video2DoorTraversal: Push Door Traversal via Simulated Door Twins

🧪arXiv v1

2608.20251v1

🌐项目页面

video2doortraversal.github.io

🏗️研究团队

纽娲机器人 · 上海交通大学 · 山东大学