World Action Model
ω-0通过隐空间预测与全身协同的查询表征,打破了人形机器人“先移动后操作”的分步式困局,使“边移动边操作”成为可能,是推动人形机器人从实验室演示走向家庭生活化服务的关键拐点。
传统人形机器人系统普遍采用“分步走”策略:先移动到目标位置站稳,再启动机械臂执行操作。这种模式在结构化的工厂流水线上尚可应付,但在充满变量的家庭环境中,连续作业时频繁出现动作卡顿、接触中断甚至失去平衡的问题。
隐空间统一查询表征
家庭场景技术复杂度:高。桌面堆满杂物、地面散落玩具、取物需绕行、擦桌需随擦拭范围动态调整站位——家庭环境的非结构化特性对全身协同提出了极高要求。
跨区域物品收纳、高低位杂物清理、床上衣物拾取等11项高难度居家复合场景实测
ω-0摒弃了耗时的video-to-action逆向转换,构建统一的查询表征架构:未来视觉特征提供任务进度和场景演变的宏观指引,动作分支直接生成全身动作潜在指令,实现从感知到控制的高效映射。
ω-HOME数据集面向视觉-语言-动作(VLA)全流程训练,每条轨迹均同步采集语言指令、多视角画面、本体状态、全身运动轨迹。
全球人形机器人VLA模型进展对比——家庭全身协同能力成为新的分水岭。
| 模型 | 能力侧重 | 家庭全身协同 |
|---|---|---|
| Google RT-2 | 桌面操作 | — |
| π-0 | 通用多形态 | ▲ 有限 |
| NVIDIA GR00T | 仿真迁移 | ▲ 有限 |
| ω-0 | 移动 + 操作 | ● 强 |
行业正从“仿人形态竞赛”转向“真实任务能力竞赛”。工厂与结构化环境已无法满足人形机器人的价值验证需求,家庭场景正在成为新一代模型能力的试金石。
81.8%的成功率证明了技术方向的有效性,但距离一个能真正融入家庭、长期自主运行的机器人仍有很长的路。当前测试仍是阶段性的,长时程任务、极端场景、安全可靠性等维度需要持续验证。
这是一项在人形机器人VLA模型领域具有明确技术辨识度的研究成果。ω-0的核心价值不在于单项指标的提升,而在于从架构层面重新定义了移动与操作的耦合方式:将“先走后做”改为“边走边做”,并配合三阶段训练体系和开源数据底座形成完整技术闭环。81.8%的成功率在同类家庭场景基线中具备较强说服力,但需要关注数据集规模(40.3小时)相对有限、测试任务覆盖面及长时程稳定性等后续验证问题。整体来看,ω-0指向了“全身智能”这一正确方向,其开源策略也有助于推动行业整体进展。