World Action Model

北大、NTU等推出世界动作模型ω-0:居家任务成功率81.8%,重塑人形机器人居家作业模式

ω-0通过隐空间预测与全身协同的查询表征,打破了人形机器人“先移动后操作”的分步式困局,使“边移动边操作”成为可能,是推动人形机器人从实验室演示走向家庭生活化服务的关键拐点。

破局之道:从“先走后做”到“边走边做”

传统人形机器人系统普遍采用“分步走”策略:先移动到目标位置站稳,再启动机械臂执行操作。这种模式在结构化的工厂流水线上尚可应付,但在充满变量的家庭环境中,连续作业时频繁出现动作卡顿、接触中断甚至失去平衡的问题。

传统“停-动-停”

移动 停稳 操作
✕ 卡顿 / 接触中断 ✕ 失衡敏感

ω-0“连续流动”

移动 操作 调整姿态 继续

隐空间统一查询表征

家庭场景技术复杂度:高。桌面堆满杂物、地面散落玩具、取物需绕行、擦桌需随擦拭范围动态调整站位——家庭环境的非结构化特性对全身协同提出了极高要求。

关键实测数据:11项高难度任务全面领先基线模型

81.8%

跨区域物品收纳、高低位杂物清理、床上衣物拾取等11项高难度居家复合场景实测

ω-0 Omni 81.8% ★
ω-0 Ego 79.1%
π-0.5 低于 ω-0
EgoVLA 低于 ω-0
GR00T-N1.7 低于 ω-0
ψ-0 低于 ω-0

技术核心:查询表征 + 三阶段递进训练

ω-0摒弃了耗时的video-to-action逆向转换,构建统一的查询表征架构:未来视觉特征提供任务进度和场景演变的宏观指引,动作分支直接生成全身动作潜在指令,实现从感知到控制的高效映射。

视频查询
未来特征预测
动作潜在指令
全身动作VLM
阶段1
人机隐变量融合
阶段2
真实场景微调
阶段3
该阶段模型借鉴V-JEPA先进技术思路,融合视觉、语言、机器人本体多维数据,通过视频查询预判未来环境特征,将场景动态变化信息注入动作表征体系。 —— 研发团队 · 技术方法说明

数据底座:开源ω-HOME数据集降低示范依赖

ω-HOME数据集面向视觉-语言-动作(VLA)全流程训练,每条轨迹均同步采集语言指令、多视角画面、本体状态、全身运动轨迹。

40.3h
真实环境数据
真实世界家庭数据集
4827
任务轨迹
语言/多视角/本体/全身
24
任务类型
覆盖居家主流操作

行业坐标:人形机器人VLA模型竞赛升温

全球人形机器人VLA模型进展对比——家庭全身协同能力成为新的分水岭。

模型 能力侧重 家庭全身协同
Google RT-2 桌面操作
π-0 通用多形态 ▲ 有限
NVIDIA GR00T 仿真迁移 ▲ 有限
ω-0 移动 + 操作 ● 强

行业正从“仿人形态竞赛”转向“真实任务能力竞赛”。工厂与结构化环境已无法满足人形机器人的价值验证需求,家庭场景正在成为新一代模型能力的试金石。

前景与局限:81.8%是起点,不是终点

81.8%的成功率证明了技术方向的有效性,但距离一个能真正融入家庭、长期自主运行的机器人仍有很长的路。当前测试仍是阶段性的,长时程任务、极端场景、安全可靠性等维度需要持续验证。

起点 100%
81.8%
长时程任务 极端场景 安全可靠性
“当机器人学会在移动中操作、在操作中调整姿态,才有了从‘实验室演示’走向‘生活化服务’的可能。” —— 行业观察
编辑判断

这是一项在人形机器人VLA模型领域具有明确技术辨识度的研究成果。ω-0的核心价值不在于单项指标的提升,而在于从架构层面重新定义了移动与操作的耦合方式:将“先走后做”改为“边走边做”,并配合三阶段训练体系和开源数据底座形成完整技术闭环。81.8%的成功率在同类家庭场景基线中具备较强说服力,但需要关注数据集规模(40.3小时)相对有限、测试任务覆盖面及长时程稳定性等后续验证问题。整体来看,ω-0指向了“全身智能”这一正确方向,其开源策略也有助于推动行业整体进展。

ω-0以隐空间预测和全身协同架构,在家庭场景实测中取得了领先主流基线的成功率,为行业提供了从“分步规划”转向“整体协同”的清晰技术路径。它不代表人形机器人家庭落地的终点,但标志着“实验室演示”与“生活化服务”之间的鸿沟正在被切实跨越。