生数科技朱军定义通用世界模型五级路线图:从视频生成到世界组织者,当前落地至L3

通用世界模型不是生成器、模拟器或策略模型的简单拼接,而是理解、预测、行动三种能力耦合的闭环反馈系统,生数科技以五级路线图为框架,当前技术实践已覆盖至第三级

通用世界模型的第一性原理:三种能力的闭环耦合

"通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。"

—— 朱军 · 生数科技创始人兼首席科学家
理解世界
预测未来
采取行动

朱军以人学骑车、学开车的过程作类比:大脑并非死记硬背动作,而是在与外部世界持续互动中建立关于世界如何运转的内部模型。映射到机器上,通用世界模型需要三项彼此关联的能力——理解世界(看懂环境、判断状态)、预测未来(预判接下来发生什么、不同动作带来什么结果)、采取行动(影响环境并用真实反馈修正理解与预测)。

三项核心能力 理解世界、预测未来、采取行动 三者不是割裂模块,而是在同一闭环反馈系统中耦合运行

数据金字塔与MoT架构:底层支撑

通用世界模型终究是大模型,算力、算法和数据三件套绕不开。数据层面,朱军给出了一个多层金字塔结构:最底层铺海量网络视频,往上依次是领域视频、第一视角人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据——越往上数据越稀缺、成本越高,但与任务动作和物理结果的联系也越直接。

真实机器人交互数据
带动作示范
第一视角视频
领域视频
海量网络视频
模态A
模态B
模态C
共享注意力 跨模态交互

生数科技的答案是MoT架构——Mixture-of-Transformers。不同模态各配专属参数,再用共享注意力打通跨模态交互,环境理解、状态预测、动作生成就都能在同一个模型里跑。基于此架构,世界动作模型Motubrain把理解和预测跟行动装进一个模型,不再按模块切开各管一段。

五级路线图:从世界生成到世界组织者

模型对世界理解越深、与世界交互越强、自主性越高,所处的层级就越高。生数科技将通用世界模型分为五级,当前研发和落地覆盖至第三级。

L5 世界组织者 调度机器人、数字智能体、人、工具
L4 自主世界智能体 围着长期目标主动感知、拆解任务、持续规划行动
L3 在世界中行动 跨进物理世界,统一理解、预测与动作生成 ● 当前落地
L2 与世界交互 接住实时输入,持续互动
L1 世界生成 生成连贯的世界演化过程

Motubrain落地数据:L1到L3的实证

Motubrain是生数科技目前最能打的一张牌,在L1到L3有了相对具体的技术实践。不过,视频模型的生成质量、可控性、时空一致性仍有待提高,世界动作模型在更复杂开放的真实环境中的稳定性、泛化能力、执行效率也需要优化。

~10倍
推理速度提升
(相对Motus)
50-100条
人类示范数据
完成本体适配
96.1分
RoboTwin 2.0
基准测试榜首
近10种
已验证
机器人本体

通往L4/L5的六项关键挑战

从L3走向L4和L5,朱军指出了六项关键挑战,涉及评测体系、物理规律学习、记忆机制、在线学习、高效部署和安全性。

联合评测体系 覆盖跨界能力
真实物理规律学习 接触/摩擦/干预
持久可修订的记忆 随时间更新修正
在线学习与自我进化 真实交互中提升
高效闭环部署 延迟与资源约束
安全性与可控性 可控安全边界

"当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。"

—— 朱军 · 生数科技创始人兼首席科学家