通用世界模型不是生成器、模拟器或策略模型的简单拼接,而是理解、预测、行动三种能力耦合的闭环反馈系统,生数科技以五级路线图为框架,当前技术实践已覆盖至第三级
"通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。"
—— 朱军 · 生数科技创始人兼首席科学家
朱军以人学骑车、学开车的过程作类比:大脑并非死记硬背动作,而是在与外部世界持续互动中建立关于世界如何运转的内部模型。映射到机器上,通用世界模型需要三项彼此关联的能力——理解世界(看懂环境、判断状态)、预测未来(预判接下来发生什么、不同动作带来什么结果)、采取行动(影响环境并用真实反馈修正理解与预测)。
通用世界模型终究是大模型,算力、算法和数据三件套绕不开。数据层面,朱军给出了一个多层金字塔结构:最底层铺海量网络视频,往上依次是领域视频、第一视角人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据——越往上数据越稀缺、成本越高,但与任务动作和物理结果的联系也越直接。
生数科技的答案是MoT架构——Mixture-of-Transformers。不同模态各配专属参数,再用共享注意力打通跨模态交互,环境理解、状态预测、动作生成就都能在同一个模型里跑。基于此架构,世界动作模型Motubrain把理解和预测跟行动装进一个模型,不再按模块切开各管一段。
模型对世界理解越深、与世界交互越强、自主性越高,所处的层级就越高。生数科技将通用世界模型分为五级,当前研发和落地覆盖至第三级。
Motubrain是生数科技目前最能打的一张牌,在L1到L3有了相对具体的技术实践。不过,视频模型的生成质量、可控性、时空一致性仍有待提高,世界动作模型在更复杂开放的真实环境中的稳定性、泛化能力、执行效率也需要优化。
从L3走向L4和L5,朱军指出了六项关键挑战,涉及评测体系、物理规律学习、记忆机制、在线学习、高效部署和安全性。
"当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。"
—— 朱军 · 生数科技创始人兼首席科学家