🧠 世界模型 · 技术突破

原生全模态世界模型登顶WBench Navi榜:IQ 140的AI,为何仍不够格进入物理世界?

8月19日,世界机器人大会(WRC 2026)期间,智象未来(HiDream.ai)创始人兼CEO梅涛宣布:原生全模态交互式世界模型 HiDream-O1-World 首次参评即登顶 WBench Navi分榜榜首。模型 IQ 已接近 140,但梅涛直言——「高IQ不代表全能」,从理解世界到改变世界,AI 还有关键一公里要走。

综合公开信息整理 2026-08-22 全文约 4 分钟读完
#智象未来 #HiDream-O1-World #原生全模态 #WBench #世界模型
🥇 Navi 榜首 WBench 权威榜单 · 首次参评即登顶
139 IQ 接近 140,年初为 130
近千万 小时 视频训练数据积累

⚡ 30 秒速览

  • 核心事件:智象未来发布原生全模态交互式世界模型 HiDream-O1-World,基于自研 UiT 架构,首评即登顶 WBench Navi 分榜。
  • 关键矛盾:模型 IQ 已接近 140,但梅涛指出「高 IQ 不代表全能」——考试型 AI 与物理世界执行之间仍有巨大鸿沟。
  • 技术突破:长时程时空一致性与物理一致性,支持漫游、编辑、交互三项核心能力,可还原真实空间与风格化世界。
  • 产业闭环:数据 → 世界模型 → 智能体 → 具身本体 → 反馈,世界模型作为认知中枢驱动 Physical AI 飞轮。
  • 落地场景:AI 互动影游、具身智能仿真训练、3D 场景生成,已与诺亦腾机器人等伙伴展开合作。

01高IQ不等于全能 考试型AI vs 物理世界执行

梅涛在演讲中分享了一组数据:2026 年初,顶级大模型 IQ 水平约 130,相当于中科大少年班天才;到如今,这一数字已接近 140。进步不可谓不快。

但数据只是故事的一半。

「就像孩子成绩好不代表综合能力强一样,一个在考试中表现优异的模型,不等于能在真实物理世界中长期、稳定、可靠地完成任务。」梅涛在演讲中强调。这正是 Physical AI 之所以重要的根本原因——从理解世界到改变世界,中间隔着物理执行这道坎。

传统大模型(考试型)

强在对世界的理解、对知识的压缩和推理。擅长答题、写作、代码生成,但输出与真实物理执行之间存在距离。

原生全模态世界模型

同时具备对世界状态的完整表达、对物理规律和因果关系的推演,以及对世界的重构与交互能力。三位一体。

梅涛将 AI 能力演进概括为三条路线——大语言模型(理解世界)、多模态模型(生成与预测)、具身交互模型(行动于世界)。过去各自独立演进,今天正在加速走向融合。而真正的世界模型,需要同时站在三条线的交汇点上。

130年初 IQ 水平
→ 140当前 IQ 水平
3技术路线融合
1真正的世界模型

注:IQ 数据为梅涛演讲中援引的公开评测结果,反映大模型在标准化测试中的推理能力,不代表物理世界执行能力。

02从DiT到UiT 原生全模态架构的三大核心能力

HiDream-O1-World 的核心是自研 UiT(Unified Transformer)架构,它突破了传统 DiT 架构在长时程交互中的瓶颈。关键创新在于:长时程时空一致性物理一致性——让模型在长时间交互中「记住」已探索的场景结构,并在复杂交互中保持物理合理性。

三项核心能力,定义了什么是「原生全模态」:

漫游
编辑
交互
时空一致性
物理一致性

注:能力维度基于公开技术资料整理,相对值为模型自述能力表现,实际效果以具体场景测试为准。

在底层数据方面,智象未来已积累 近千万小时 视频数据,覆盖互联网先验数据、仿真物理试错数据、真实交互数据三大类,为世界模型提供充足的训练燃料。

支持文本、图像及交互式操控等多模态输入,同时兼容多种主体与风格化场景——从高度还原真实空间,到二次元卡通、3A 游戏渲染风格,均可生成。

03三个落地场景 从虚拟世界到物理世界的桥梁

HiDream-O1-World 正在打开全新的产业应用空间。以下三个场景,代表了从「模拟世界」到「交互世界」的典型路径:

🎮 AI互动影游 叙事革命

  • 用户成为叙事的主动参与者,而非被动观看者。世界模型实时响应玩家的操作与选择,驱动剧情走向。
  • 长时程时空一致性确保玩家在游戏世界中探索过的区域、触发的事件能被模型「记住」,保持叙事逻辑自洽。
  • 风格化场景支持让同一故事框架可呈现写实、卡通、水墨等不同视觉风格,适配多元受众。
关键价值:将线性叙事升级为「活的世界」,用户每一次交互都在创造独一无二的体验路径。

🤖 具身智能仿真训练 数据飞轮

  • 世界模型可搭建高保真虚拟训练底座,让机器人在仿真环境中先学习,再在真实环境中操练。
  • 与诺亦腾机器人的合作案例:利用原生全模态大模型对真实采集的人体动作数据进行增强处理,生成大量符合物理约束的视频——同一动作在不同背景、场景、肤色下保持一致。
  • 大幅降低真实数据采集成本和压力,加速具身智能的迭代周期。
关键价值:用「数据增强」破解真实数据稀缺难题,让仿真训练逼近物理真实。

🏗️ 3D场景生成 效率革命

  • 创作者可高效生成结构完整的3D空间,从室内设计到城市街景,大幅缩短从创意到成品的迭代路径。
  • 支持交互式编辑:用户可以用自然语言或简单操作对已生成的场景进行修改、增删、风格变换。
  • 物理一致性确保场景中的物体关系、光照、碰撞等符合真实物理规律,可直接用于专业工作流。
关键价值:将3D内容创作从「手工建模」推向「智能生成+交互编辑」,门槛大幅降低。

04数据·模型·智能体·具身 连接物理世界的闭环飞轮

梅涛用一个简洁的框架概括了世界模型与具身智能的关系:

「世界模型是认知中枢,没有高质量世界模型,仿真难以逼近真实物理,数据飞轮也无法真正转动。」

数据底座 世界模型 智能体 具身本体 真实反馈

数据 → 认知 → 决策 → 行动 → 反馈,闭环飞轮持续加速

具体来说:

数据互联网先验 + 仿真试错 + 真实交互
世界模型推演世界规律,回答「是什么」「接下来发生什么」
智能体基于预测做自主决策与规划
具身本体执行物理动作,完成认知到行动闭环

梅涛强调,三类数据缺一不可——互联网先验数据提供常识基础,仿真物理试错数据提供安全探索空间,真实交互数据提供闭环反馈。而真实环境的行动反馈,又会回流成为新的训练数据,驱动飞轮持续加速。

一个诚实的注脚:

这个闭环目前仍处于早期阶段。世界模型在仿真环境中的表现与真实物理世界之间仍有差距,特别是在长尾场景、极端工况下的泛化能力还需要持续验证。但从架构逻辑上看,它是目前最完整的路径之一。

编辑核心判断

世界模型的竞争正在从「参数规模」转向「物理 fidelity」——谁能更真实地模拟物理世界的因果与交互,谁就能真正驱动具身智能的数据飞轮。IQ 140 的考试高手很多,但愿意走进物理世界「动手」的,才是下一个时代的入场券。

了解更多

HiDream-O1-World 已开放技术合作申请,覆盖互动影游、仿真训练、3D 场景生成等方向。

hidream.ai → 技术合作