📄论文
Video2DoorTraversal: Push Door Traversal via Simulated Door Twins
🧪arXiv v1
2608.20251v1
🌐项目页面
video2doortraversal.github.io
🏗️研究团队
纽娲机器人 · 上海交通大学 · 山东大学
对机器人来说,推门不是「推」那么简单——它需要同时解决定位、接触、协调与穿越四个难题。纽娲机器人联合上海交通大学、山东大学发布 Video2DoorTraversal:用一段普通 RGB 视频生成可交互的「数字门」DoorTwin,在仿真中练好策略,再回真机执行。五扇门、175 次实测,成功 169 次,平均成功率 96.57%。
人过一扇门,近乎零思考。机器人过一扇门,却是一次把感知、移动、操作、控制高压拧在一起的综合考试:先锁定把手的空间位姿,靠近并完成接触,在门体开始移动的瞬间协调好底盘、机械臂与夹爪,还要避开门框干涉,连续穿过狭窄通道。任何一环脱节,整段动作就在门前停摆。
更要命的是:门根本不是标准件。
门板尺寸、铰链方向、把手形态、安装位置、开启阻力,处处在变。常见方案要么依赖预先建好的门资产,要么临时扫描建模,要么为每扇门人工设计任务——每换一扇门,都要重新「伺候」一遍。这正是新框架试图抹掉的工作量。
五扇门主实验,每扇门单独采集一段 RGB 视频,在论文指定的轮足移动操作平台上各测 35 次,合计 175 次、成功 169 次。数据来自论文评测协议,不构成对通用开门能力的推断。
Video2DoorTraversal 的第一步,是把一扇真实门「搬」进仿真,生成一个名为 DoorTwin 的数字孪生。系统从单段 RGB 视频中恢复带真实尺度的几何信息与相机运动,识别门板、把手与铰链关系,输出同时包含关节结构、碰撞几何和外观纹理的可交互资产。
这扇数字门,既得「像」,还得「能动」。
视觉上逼近真实,物理上能被抓住、转动和推开——两个条件缺一个,机器人在仿真里的练习就无法迁移到真机上。
系统会从参考视角反复核对轮廓、比例、把手类型、铰链方向与部件位置,并持续修正生成结果,直到数字门在视觉与物理两个层面都「过关」。
DoorTwin 建好后,仿真闭环代理把开门任务拆成一组参数化技能:接近、抓取、转动把手、推门、穿越。在模拟器里反复执行,失败一次,就根据碰撞、接触、把手旋转与门体开启状态分析原因,在邻近参数空间继续搜索;只有通过任务、碰撞与运动学三重验证的轨迹,才会进入训练集。
换句话说:真机上的试错,被整体搬进了仿真。
训练还刻意加扰——机器人与门的初始位姿随机变化,铰链摩擦、开门阻尼、相机外参随机变化,深度图被叠加多种噪声。只有扰动之下依然成功的轨迹,才够格成为策略的「教材」。
把开门任务变为参数化技能集,逐项执行
在模拟器内反复尝试,记录每一步状态
任务、碰撞、运动学三重验证逐条把关
只保留扰动下依然成功的轨迹作训练数据
真机执行时,策略 ArticuACT 融合前视与腕部双视角深度图及机器人状态,协同输出底盘、机械臂与夹爪指令,并预测接触、把手转动与门体开启进度。
96.57% 与 80.95%,对应的是两个不同层级的承诺。
五扇真实门、175 次实测的平均成功率。它说明「单段视频 → 仿真训练 → 真机执行」这条链路,在论文限定条件下是走得通的。
三扇结构相似、训练中从未见过的门上的零样本成功率。它说明策略具备初步的跨门迁移能力,而非死记某一扇门的动作序列。
但别把 96.57% 读成「通用开门」。
论文把边界划得很清楚:目前验证的是推门场景;拉门、更多把手机制与更丰富的门体结构,都被列为后续方向。每扇目标门也分别需要一段视频作为输入——它压缩的是重建与适配成本,不是「拍一次视频解决所有门」。
以上边界均以论文公开表述为准,不构成对通用开门或成熟商用产品的推断。
门,只是开放人类环境里最常见的通行设施之一。
对纽娲机器人来说,这件事的真正坐标要大得多。
纽娲把具身智能定义为机器人在开放人类环境中的持续通行与任务完成——他们更愿意把它描述成「具身智能与自动驾驶的交集」。在公司级的架构里,WorldWeaver 负责把真实场景数据组织成三维资产,SimWeaver 提供物理仿真能力,WTM(世界通行模型)则把空间理解、任务判断、导航与具身操作统一进同一个智能底座。
真实场景 → 可复用的三维资产
三维资产 → 可交互的训练与评测场
空间理解 + 任务判断 + 导航 + 具身操作
Video2DoorTraversal 正是这条路径上的一块拼图:真实场景进入数字环境,机器人在仿真中积累经验,再回到真实任务里接受检验。它验证的不只是一扇门——而是「真实世界可被数字化重演」这一前提。
单段视频生成「可交互数字门」,压缩的是整个行业最贵的一环——场景适配成本。当新场景的开销从「工程师带扫描设备进场」变成「随手拍一段视频 + 一次仿真训练」,具身智能才真正摸到了规模化的门把手。接下来的关键不在门里:能不能把「拍视频 → 仿真 → 迁移」这条链路复制到门以外的更多设施与本体,才是这项技术从论文走进产品的真正考题。
论文以 arXiv 预印本形式公开,项目站提供演示视频与补充材料。
Video2DoorTraversal: Push Door Traversal via Simulated Door Twins
2608.20251v1
video2doortraversal.github.io
纽娲机器人 · 上海交通大学 · 山东大学