🏆 论文 · 具身智能

李飞飞、Yilun Du 联手新作:机器人不必建大脑,直接借用视频模型即可

十多位顶尖学者联合发表论文,提出 MVA 方法:把动作翻译成视频模型「听得懂」的像素语言,仅用 15 小时微调数据,就让机器人从单臂操作零样本泛化到未见过的双臂机器人上。

综合公开信息整理 2026-07-24 全文约 4 分钟读完
#李飞飞 #Yilun Du #MVA #具身智能 #世界模型
🥇 零样本泛化 单臂训练 → 双臂测试,未经见过的机器人
15h 微调数据量,仅用 LoRA 轻量适配
0.0945 LPIPS 预测误差,领先第二名约 4 倍

⚡ 30 秒速览

  • 谁做的:李飞飞、吴佳俊、张吕民、Yilun Du、Gordon Wetzstein、黄文龙等十多位斯坦福、哈佛、MIT 顶尖学者联合署名,两条具身智能路线代表人物罕见同框。
  • 核心观点:机器人不需要自己专属的大模型,也不必重训视频生成模型,只需找对接口,直接「借用」已有的视频模型即可。
  • 方法本质:用 SAM 把机器人和物体分割成运动色块,遮住其中一条轨迹让模型「完形填空」——同一模型既做世界模拟,又做动作生成。
  • 效果硬指标:LPIPS 0.0945 vs 对比方法 0.362;单臂数据训练,双臂机器人零样本泛化成功。
  • 产业意义:引入 URDF 文件 + 逆运动学解算,让指令与机器人本体解耦,换机械臂不再需要重新训练。

01核心发现 机器人不需要专属大模型

这篇论文的结论直接且大胆:机器人也许根本不需要自己专属的基座模型。今天各厂商拼命卷的「机器人大脑基模」,以及靠一个基模撑起几十亿估值的创业公司,都在被这个结论挑战。

按论文的逻辑,机器人不仅不需要自己的专属大模型,甚至不需要重训已有的视频生成模型——只需要找对接口,就能直接利用日趋成熟的视频生成模型完成物理推理与动作规划。

两种路线,两种答案。

传统方式:让机器人学「外语」

直接输出关节角度、末端位移等底层控制信号。换一台机械臂,同样的数值意味着完全不同的姿态,模型立刻失效。每次部署都需要重新采集数据、重新训练。

MVA 方式:用视频模型的「母语」对话

把动作翻译成像素遮罩轨迹——视频模型天生就懂的语言。指令与本体解耦,换机器人只需换一份 URDF 说明书,模型本身无需重训。

0额外基座模型训练
15小时微调数据
140亿参数(Wan2.2)
1套模型做两件事

注:MVA 直接使用阿里开源视频生成模型 Wan2.2(140 亿参数),仅通过 LoRA 微调适配,未从零训练任何新模型。同一套模型既可做世界模拟(正向),也可做动作生成(逆向)。

02方法:把动作翻译成像素语言 MVA 三步

MVA 的思路出乎意料地朴素:为什么不让视频模型用自己的母语来理解动作? 拆开来看,核心只有三步。

1

把动作变成「涂了颜色的录像」

用 Meta 的 SAM 模型将视频中的机器人和操作物体从画面中分割出来,得到它们在每一帧中的区域(mask)。随着时间连续变化,这些区域自然形成两条运动轨迹——一条记录机器人如何移动,一条记录物体如何变化。没有角度,没有坐标,只有色块在画面里游走。

2

遮住一条轨迹,让模型「完形填空」

遮住物体轨迹,只留机械臂轨迹 → 模型推演世界会如何变化(世界模拟器)。遮住机械臂轨迹,只留物体轨迹 → 模型反推机械臂该怎么动(动作生成器)。同一模型、同一套参数,只取决于你遮住哪条颜色——像是做完形填空,同一篇文章挖不同的空。

3

站在现成模型肩膀上,15 小时学会

MVA 没有从零训练任何东西,直接站在阿里开源视频生成模型 Wan2.2 的肩膀上。Wan2.2 相当于那个看过一万部纪录片的「人」,物理直觉早已到位。MVA 仅用 LoRA 轻量微调,花了 15 小时数据就教会它看懂色块语言。不动大脑本身,避免把已有的物理直觉冲洗掉。

注:LoRA(Low-Rank Adaptation)是一种高效的模型微调手段,只更新少量参数即可适配新任务,大幅降低训练成本与数据需求。

03效果数据 精度领先 4 倍,跨本体零样本泛化

方法听起来简单,但效果出人意料。论文用两组关键数据证明了 MVA 的有效性。

第一组:同款机器人上的碾压式领先。
LPIPS 预测误差 ↓
0.0945
MVA 方法,数值越低越好
🥇 第一
LPIPS 预测误差 ↓
0.362
Ctrl-World 对比方法
对比基线

注:LPIPS(Learned Perceptual Image Patch Similarity)衡量生成画面与真实画面的感知差异,数值越低表示预测越准确。MVA 的误差仅为对比方法的约 1/4。完全不告诉模型该怎么动的纯视频生成方法几乎全线崩溃。

第二组:换一台完全没见过的机械臂,照样能用。

训练时只用了一款单臂机器人的数据,测试时突然换上训练阶段从未出现过的双臂机器人。对比方法 Ctrl-World 当场失灵,而 MVA 照样输出了靠谱的预测。这一结果直接指向了产业界最头疼的痛点:跨本体泛化。

泛化测试
✓ 成功
MVA:单臂训练 → 双臂测试,零样本泛化
泛化测试
✗ 失败
Ctrl-World:换机器人后直接失效

注:所谓「零样本泛化」指模型在测试时从未见过目标机器人,没有任何微调或适配,直接进行推理。这是具身智能领域最难攻克的关卡之一。

04产业视角 「URDF 才是关键」

当学术圈还在讨论 MVA 的完形填空设计有多巧妙时,产业界人士的视线落在了另一个细节上:URDF 文件。

URDF(Unified Robot Description Format)是机器人行业通用的「说明书」,记录着一台机械臂有几个关节、每个关节能转多大角度、连杆有多长。每一款商用机械臂都会附带自己的 URDF 文件。

有了这份说明书,两件重要的事变得可以计算。

正运动学(FK):已知每个关节转了多少度,反推末端位置。逆运动学(IK):已知末端目标位置,反推每个关节该转多少度。MVA 先想清楚末端该到什么地方去,再借助 URDF 通过逆运动学反算出这台特定机器该怎么摆关节——指令通用了,执行方式各自适配。

这一层看似多余的中转,恰恰是它能够换机型不换脑子的真正原因。市面上大多数方法直接输出关节角度,图像进去、角度数字出来,换一台机器就失效。MVA 多加了一层,泛化能力直接上了一个台阶。

📌 产业界声音
「这篇文章的核心不在于模型训得好,而在于泛化性的增强。以前大家没有办法解决这种异构机械手的识别与迁移,它解决了这个问题……我们核心的点也是在 URDF 的导入和 IK/FK 的解算上。这个点上大家是可以结合的,思路上甚至一定程度是相通的。」
—— 李琳鑫,韦特嘉机器人 CTO & 联创,长期从事世界模型与 AI 视觉在物流仓储的落地工作

值得注意的是,李琳鑫团队走的其实是另一条技术路线——受 Yann LeCun 影响的隐空间世界模型。但谈到 MVA,他直言两条路线在 URDF 这一层是相通的。路线之争走到足够深处,答案未必是二选一。

编辑核心判断

MVA 试图证明,机器人不需要一套专属的动作语言,只要找准一个接口,把动作翻译成视频模型早就懂的那套像素语言。这个想法背后藏着一层很深的判断:具身智能往前走的路,或许不在于把机器人专属的模型越练越大,而在于想办法把已经很强的视觉大模型直接借过来用。当学术圈最有分量的一批人,和产业界正在悄悄发生的架构变化,不约而同地指向了同一个方向——这条路,值得再多看几眼。

论文已公开上线

论文标题:Masked Visual Actions for Unified World Modeling
作者包括李飞飞、吴佳俊、张吕民、Yilun Du、Gordon Wetzstein、黄文龙等
搜索论文标题即可在 arxiv 获取完整内容与开源代码。

搜索论文标题 → 获取全文