李飞飞、Yilun Du 联手新作:机器人不必建大脑,直接借用视频模型即可
十多位顶尖学者联合发表论文,提出 MVA 方法:把动作翻译成视频模型「听得懂」的像素语言,仅用 15 小时微调数据,就让机器人从单臂操作零样本泛化到未见过的双臂机器人上。
十多位顶尖学者联合发表论文,提出 MVA 方法:把动作翻译成视频模型「听得懂」的像素语言,仅用 15 小时微调数据,就让机器人从单臂操作零样本泛化到未见过的双臂机器人上。
这篇论文的结论直接且大胆:机器人也许根本不需要自己专属的基座模型。今天各厂商拼命卷的「机器人大脑基模」,以及靠一个基模撑起几十亿估值的创业公司,都在被这个结论挑战。
按论文的逻辑,机器人不仅不需要自己的专属大模型,甚至不需要重训已有的视频生成模型——只需要找对接口,就能直接利用日趋成熟的视频生成模型完成物理推理与动作规划。
直接输出关节角度、末端位移等底层控制信号。换一台机械臂,同样的数值意味着完全不同的姿态,模型立刻失效。每次部署都需要重新采集数据、重新训练。
把动作翻译成像素遮罩轨迹——视频模型天生就懂的语言。指令与本体解耦,换机器人只需换一份 URDF 说明书,模型本身无需重训。
注:MVA 直接使用阿里开源视频生成模型 Wan2.2(140 亿参数),仅通过 LoRA 微调适配,未从零训练任何新模型。同一套模型既可做世界模拟(正向),也可做动作生成(逆向)。
MVA 的思路出乎意料地朴素:为什么不让视频模型用自己的母语来理解动作? 拆开来看,核心只有三步。
用 Meta 的 SAM 模型将视频中的机器人和操作物体从画面中分割出来,得到它们在每一帧中的区域(mask)。随着时间连续变化,这些区域自然形成两条运动轨迹——一条记录机器人如何移动,一条记录物体如何变化。没有角度,没有坐标,只有色块在画面里游走。
遮住物体轨迹,只留机械臂轨迹 → 模型推演世界会如何变化(世界模拟器)。遮住机械臂轨迹,只留物体轨迹 → 模型反推机械臂该怎么动(动作生成器)。同一模型、同一套参数,只取决于你遮住哪条颜色——像是做完形填空,同一篇文章挖不同的空。
MVA 没有从零训练任何东西,直接站在阿里开源视频生成模型 Wan2.2 的肩膀上。Wan2.2 相当于那个看过一万部纪录片的「人」,物理直觉早已到位。MVA 仅用 LoRA 轻量微调,花了 15 小时数据就教会它看懂色块语言。不动大脑本身,避免把已有的物理直觉冲洗掉。
注:LoRA(Low-Rank Adaptation)是一种高效的模型微调手段,只更新少量参数即可适配新任务,大幅降低训练成本与数据需求。
方法听起来简单,但效果出人意料。论文用两组关键数据证明了 MVA 的有效性。
注:LPIPS(Learned Perceptual Image Patch Similarity)衡量生成画面与真实画面的感知差异,数值越低表示预测越准确。MVA 的误差仅为对比方法的约 1/4。完全不告诉模型该怎么动的纯视频生成方法几乎全线崩溃。
训练时只用了一款单臂机器人的数据,测试时突然换上训练阶段从未出现过的双臂机器人。对比方法 Ctrl-World 当场失灵,而 MVA 照样输出了靠谱的预测。这一结果直接指向了产业界最头疼的痛点:跨本体泛化。
注:所谓「零样本泛化」指模型在测试时从未见过目标机器人,没有任何微调或适配,直接进行推理。这是具身智能领域最难攻克的关卡之一。
当学术圈还在讨论 MVA 的完形填空设计有多巧妙时,产业界人士的视线落在了另一个细节上:URDF 文件。
URDF(Unified Robot Description Format)是机器人行业通用的「说明书」,记录着一台机械臂有几个关节、每个关节能转多大角度、连杆有多长。每一款商用机械臂都会附带自己的 URDF 文件。
正运动学(FK):已知每个关节转了多少度,反推末端位置。逆运动学(IK):已知末端目标位置,反推每个关节该转多少度。MVA 先想清楚末端该到什么地方去,再借助 URDF 通过逆运动学反算出这台特定机器该怎么摆关节——指令通用了,执行方式各自适配。
这一层看似多余的中转,恰恰是它能够换机型不换脑子的真正原因。市面上大多数方法直接输出关节角度,图像进去、角度数字出来,换一台机器就失效。MVA 多加了一层,泛化能力直接上了一个台阶。
值得注意的是,李琳鑫团队走的其实是另一条技术路线——受 Yann LeCun 影响的隐空间世界模型。但谈到 MVA,他直言两条路线在 URDF 这一层是相通的。路线之争走到足够深处,答案未必是二选一。
MVA 试图证明,机器人不需要一套专属的动作语言,只要找准一个接口,把动作翻译成视频模型早就懂的那套像素语言。这个想法背后藏着一层很深的判断:具身智能往前走的路,或许不在于把机器人专属的模型越练越大,而在于想办法把已经很强的视觉大模型直接借过来用。当学术圈最有分量的一批人,和产业界正在悄悄发生的架构变化,不约而同地指向了同一个方向——这条路,值得再多看几眼。
论文标题:Masked Visual Actions for Unified World Modeling
作者包括李飞飞、吴佳俊、张吕民、Yilun Du、Gordon Wetzstein、黄文龙等
搜索论文标题即可在 arxiv 获取完整内容与开源代码。