🤖 具身智能 · 技术路线

生数科技提出通用世界模型五级路线,Motubrain 以 96.1 分登顶 RoboTwin 2.0

8 月 19 日,生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军在 WRC 2026 上发布通用世界模型五级发展路线(L1–L5),首次为行业定义了从「世界生成」到「世界组织者」的进化路径。其世界动作模型 Motubrain 在 RoboTwin 2.0 基准测试中以 96.1 分 位居榜首,推理速度提升约 10 倍,仅需 50–100 条 人类示范即可适配新机器人本体。

综合公开信息整理 2026-08-19 全文约 4 分钟读完
#生数科技 #通用世界模型 #五级路线 #Motubrain #RoboTwin 2.0
L1 → L5 五级进化路线 · 从生成到组织
96.1 RoboTwin 2.0 榜首
10× 推理速度提升
50–100 新本体适配所需示范数据

⚡ 30 秒速览

  • 五级路线:L1 世界生成 → L2 与世界交互 → L3 在世界中行动 → L4 自主世界智能体 → L5 世界组织者,逐级递进,生数科技已覆盖前三个层级。
  • 关键数据:Motubrain 在 RoboTwin 2.0 达 96.1 分,推理速度较前代 Motus 提升约 10 倍,新本体仅需 50–100 条人类示范数据。
  • 技术架构:MoT(Mixture-of-Transformers)为不同模态配置专属参数,以共享注意力实现跨模态交互,将理解、预测与行动统一建模。
  • 开源实践:Motus 于 2025 年 12 月全面开源,Vidu 系列覆盖 L1–L2,评测流程与执行快照公开可查。

01五级路线 从世界生成到世界组织者

朱军将通用世界模型的能力演进划分为五个层级,每一级都建立在前一级的基础之上。「没有对世界演化规律的学习和预测,就难以形成稳定、连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习与长期规划。」

L1
世界生成模型学习生成连贯的世界演化过程,视频是典型载体。2024 年推出 Vidu 完成初步实践。
✅ 已实现
L2
与世界交互模型接收实时输入,根据语音、控制信号持续改变后续内容。2026 年 7 月 Vidu S1 实现实时交互。
✅ 已实现
L3
在世界中行动环境理解、未来预测与动作生成统一,模型直接生成机器人可执行动作。Motus 开源,Motubrain 登顶 RoboTwin 2.0。
✅ 已实现
L4
自主世界智能体模型围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
🔄 进行中
L5
世界组织者统筹机器人、数字智能体、人类、工具及其他资源,完成复杂任务分配与多智能体协作。
🎯 目标

注:L1–L3 已有具体技术实践与产品落地;L4–L5 为远期目标方向,需突破六项关键挑战。层级之间并非产品割裂,而是模型自主性持续提升的过程。

02构建通用世界模型的三大要素 数据 · 架构 · 算力

朱军指出,通用世界模型仍然依赖大模型的三个基本要素,但每个维度都有其独特的挑战与路径。

📊

数据:多层金字塔

从海量网络视频起步,逐层扩展至特定领域视频、第一视角人类视频、带动作记录的示范,以及真实机器人交互数据。越底层规模越大,越顶层越直接关联任务。「不完美数据」同样有价值——失败尝试与恢复过程包含有效的学习信号。

合成数据贯穿各层 失败数据也是信号
🧩

架构:MoT 统一多模态

MoT(Mixture-of-Transformers)为图像、视频、语言、动作等不同模态配置专属参数,以共享注意力实现跨模态交互。Motubrain 基于此架构将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,提升异构数据利用效率。

跨模态共享注意力 统一建模

算力:训练与实时兼顾

离线视频生成可容忍等待,但实时交互和机器人控制必须在环境变化之前完成预测与决策。训练基础设施、推理加速、模型蒸馏与高效注意力机制,是通用世界模型走向实际应用的关键支撑。

推理加速 10× 模型蒸馏

注:三大要素相互耦合——数据质量影响架构设计,架构效率决定算力需求,算力能力又反过来约束数据规模与模型复杂度。

03从视频到物理行动 Vidu → Motus → Motubrain

生数科技的研发路径覆盖了 L1 到 L3,每一步都有可验证的产品与基准成绩。

🎬 Vidu 系列 · 世界生成与实时交互 L1 → L2

  • Vidu(2024):视频生成大模型,持续提升视频质量、时序一致性与世界动态建模能力,完成 L1 阶段实践。
  • Vidu S1(2026.07):进入实时交互阶段,用户可通过语音实时介入生成过程,持续影响后续内容,模型根据外部输入动态演化世界。
从「一次生成」到「持续互动」,Vidu 系列完成了通用世界模型前两个层级的产品闭环。

🤖 Motus → Motubrain · 从视觉推演到物理决策 L3 · RoboTwin 2.0 榜首 96.1

  • Motus(2025.12):全面开源的世界动作模型,为后续统一架构奠定基础。
  • Motubrain(2026.04):将环境理解、世界状态预测与动作轨迹生成统一到同一模型中,推理速度提升约 10 倍,适配新机器人本体仅需 50–100 条 人类示范数据。
  • RoboTwin 2.0 基准测试中达到 96.1 分,位居榜首。已在银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出长程任务与多形态泛化能力。
Motubrain 证明了统一建模架构在真实物理世界中的可行性与效率优势,是 L3 层级的关键里程碑。

04迈向 L4 / L5 的六项关键挑战

当前 L1–L3 已有具体实践,但距离更高阶的自主世界智能体仍有差距。朱军团队明确了六个必须突破的方向:

1

视频生成质量与可控性、时空一致性仍需持续提升。

2

世界动作模型在更复杂、开放环境中的稳定性与泛化能力

3

目标形成——模型能自主设定并理解长期目标。

4

主动探索——在未知环境中自主获取新信息。

5

持续学习——从真实反馈中不断更新自身模型。

6

长期记忆——跨任务、跨场景的经验积累与调用。

注:六项挑战并非独立,而是相互耦合——没有长期记忆就无法持续学习,没有目标形成就难以主动探索。生数科技将同步强化 L1–L3 并补齐上述能力。

一个诚实的注脚:L4 和 L5 目前仍是行业级的远期目标,并非短期内可量产的能力。但六项挑战的定义本身,已经为技术演进提供了清晰的坐标。

编辑核心判断

通用世界模型五级路线的价值,不在于 L4/L5 何时实现,而在于它第一次为行业提供了可对标的进化坐标系——当每个团队都能定位自己处在哪个层级,技术竞争就从「谁更会讲故事」变成了「谁能在某一级上做出可验证的工程突破」。

了解更多

生数科技已公开 Motus 开源仓库与 Motubrain 技术报告,详细技术解析与五级路线完整论述可在官网查阅。

shengshu.com → 技术报告