🤖 具身智能 · 技术路线
生数科技提出通用世界模型五级路线,Motubrain 以 96.1 分登顶 RoboTwin 2.0
8 月 19 日,生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军在 WRC 2026 上发布通用世界模型五级发展路线(L1–L5),首次为行业定义了从「世界生成」到「世界组织者」的进化路径。其世界动作模型 Motubrain 在 RoboTwin 2.0 基准测试中以 96.1 分 位居榜首,推理速度提升约 10 倍,仅需 50–100 条 人类示范即可适配新机器人本体。
综合公开信息整理•
2026-08-19•
全文约 4 分钟读完
#生数科技
#通用世界模型
#五级路线
#Motubrain
#RoboTwin 2.0
L1 → L5
五级进化路线 · 从生成到组织
96.1 分
RoboTwin 2.0 榜首
10×
推理速度提升
50–100 条
新本体适配所需示范数据
⚡ 30 秒速览
- 五级路线:L1 世界生成 → L2 与世界交互 → L3 在世界中行动 → L4 自主世界智能体 → L5 世界组织者,逐级递进,生数科技已覆盖前三个层级。
- 关键数据:Motubrain 在 RoboTwin 2.0 达 96.1 分,推理速度较前代 Motus 提升约 10 倍,新本体仅需 50–100 条人类示范数据。
- 技术架构:MoT(Mixture-of-Transformers)为不同模态配置专属参数,以共享注意力实现跨模态交互,将理解、预测与行动统一建模。
- 开源实践:Motus 于 2025 年 12 月全面开源,Vidu 系列覆盖 L1–L2,评测流程与执行快照公开可查。
01五级路线 从世界生成到世界组织者
朱军将通用世界模型的能力演进划分为五个层级,每一级都建立在前一级的基础之上。「没有对世界演化规律的学习和预测,就难以形成稳定、连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习与长期规划。」
L1
世界生成模型学习生成连贯的世界演化过程,视频是典型载体。2024 年推出 Vidu 完成初步实践。
✅ 已实现
L2
与世界交互模型接收实时输入,根据语音、控制信号持续改变后续内容。2026 年 7 月 Vidu S1 实现实时交互。
✅ 已实现
L3
在世界中行动环境理解、未来预测与动作生成统一,模型直接生成机器人可执行动作。Motus 开源,Motubrain 登顶 RoboTwin 2.0。
✅ 已实现
L4
自主世界智能体模型围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
🔄 进行中
L5
世界组织者统筹机器人、数字智能体、人类、工具及其他资源,完成复杂任务分配与多智能体协作。
🎯 目标
注:L1–L3 已有具体技术实践与产品落地;L4–L5 为远期目标方向,需突破六项关键挑战。层级之间并非产品割裂,而是模型自主性持续提升的过程。
02构建通用世界模型的三大要素 数据 · 架构 · 算力
朱军指出,通用世界模型仍然依赖大模型的三个基本要素,但每个维度都有其独特的挑战与路径。
📊
数据:多层金字塔
从海量网络视频起步,逐层扩展至特定领域视频、第一视角人类视频、带动作记录的示范,以及真实机器人交互数据。越底层规模越大,越顶层越直接关联任务。「不完美数据」同样有价值——失败尝试与恢复过程包含有效的学习信号。
合成数据贯穿各层
失败数据也是信号
🧩
架构:MoT 统一多模态
MoT(Mixture-of-Transformers)为图像、视频、语言、动作等不同模态配置专属参数,以共享注意力实现跨模态交互。Motubrain 基于此架构将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,提升异构数据利用效率。
跨模态共享注意力
统一建模
⚡
算力:训练与实时兼顾
离线视频生成可容忍等待,但实时交互和机器人控制必须在环境变化之前完成预测与决策。训练基础设施、推理加速、模型蒸馏与高效注意力机制,是通用世界模型走向实际应用的关键支撑。
推理加速 10×
模型蒸馏
注:三大要素相互耦合——数据质量影响架构设计,架构效率决定算力需求,算力能力又反过来约束数据规模与模型复杂度。
03从视频到物理行动 Vidu → Motus → Motubrain
生数科技的研发路径覆盖了 L1 到 L3,每一步都有可验证的产品与基准成绩。
🎬 Vidu 系列 · 世界生成与实时交互 L1 → L2
- Vidu(2024):视频生成大模型,持续提升视频质量、时序一致性与世界动态建模能力,完成 L1 阶段实践。
- Vidu S1(2026.07):进入实时交互阶段,用户可通过语音实时介入生成过程,持续影响后续内容,模型根据外部输入动态演化世界。
从「一次生成」到「持续互动」,Vidu 系列完成了通用世界模型前两个层级的产品闭环。
🤖 Motus → Motubrain · 从视觉推演到物理决策 L3 · RoboTwin 2.0 榜首 96.1
- Motus(2025.12):全面开源的世界动作模型,为后续统一架构奠定基础。
- Motubrain(2026.04):将环境理解、世界状态预测与动作轨迹生成统一到同一模型中,推理速度提升约 10 倍,适配新机器人本体仅需 50–100 条 人类示范数据。
- 在 RoboTwin 2.0 基准测试中达到 96.1 分,位居榜首。已在银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出长程任务与多形态泛化能力。
Motubrain 证明了统一建模架构在真实物理世界中的可行性与效率优势,是 L3 层级的关键里程碑。
04迈向 L4 / L5 的六项关键挑战
当前 L1–L3 已有具体实践,但距离更高阶的自主世界智能体仍有差距。朱军团队明确了六个必须突破的方向:
2
世界动作模型在更复杂、开放环境中的稳定性与泛化能力。
注:六项挑战并非独立,而是相互耦合——没有长期记忆就无法持续学习,没有目标形成就难以主动探索。生数科技将同步强化 L1–L3 并补齐上述能力。
一个诚实的注脚:L4 和 L5 目前仍是行业级的远期目标,并非短期内可量产的能力。但六项挑战的定义本身,已经为技术演进提供了清晰的坐标。
编辑核心判断
通用世界模型五级路线的价值,不在于 L4/L5 何时实现,而在于它第一次为行业提供了可对标的进化坐标系——当每个团队都能定位自己处在哪个层级,技术竞争就从「谁更会讲故事」变成了「谁能在某一级上做出可验证的工程突破」。