01核心突破:原生全模态架构与时空一致性
HiDream-O1-World搭载智象自研的原生全模态(UiT)架构,在交互式世界模型公认的核心挑战——时空一致性与物理一致性上取得关键突破。当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应符合真实世界因果逻辑。
交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。HiDream-O1-World正是这场系统性重塑的第一道桥梁——让每一次交互,都通往一个从未抵达的世界。
姚霆智象未来CTO
WBench Navi 分榜
80.9
平均分 · 首次参评即登顶
评测基准
WBench
美团LongCat团队与复旦大学联合推出,聚焦空间导航与视角控制
02技术实现与评测验证
模型通过“3D先验注入Memory上下文”与“Test-Time Training在线维护”协同设计,实现长时程时空一致性;同时训练阶段引入物理模拟数据驱动的归纳偏置学习,推理阶段通过TTT在线适应物理场景,实现全局稳态物理一致性。
WBench 一致性维度
88.0
位列榜单前列,印证Memory+TTT架构在长时序交互中维持3D几何与空间一致性的能力
物理维度得分
73.3
WBench Physical维度位列第一
相比行业平均,HiDream-O1-World在视觉合理性评测中提升13.6%,在因果保真度评测中提升12.7%。
| 视觉合理性评测(运动符合常识物理) |
+13.6% vs 行业平均 |
| 因果保真度评测(流体、碰撞、形变等) |
+12.7% vs 行业平均 |
聚焦空间一致性研究的论文正式入选ECCV 2026,为交互式世界模型在三维空间理解与长时序生成方向上开辟了一条兼具理论原创性与工程可行性的技术路径。
论文标题: DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World ModelingECCV 2026收录
03功能体验与场景创造
HiDream-O1-World支持文本、图像、交互式操控等多模态输入,用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。模型具备漫游、编辑、交互三大功能,支持第一人称和第三人称视角,赋予用户实时编辑能力(如驱动角色动作、触发环境变化)。
功能覆盖
漫游 · 编辑 · 交互
用户可自由驱动角色行走、调整视角方向,并可实时编辑画面:驱动角色抓取、奔跑、下蹲、跳跃,或调度降雨、物体坠落等动态事件
多角色 & 多场景
人类 · 动物 · 虚构角色
覆盖真实城市街景、自然地貌、室内空间,同时可解锁幻想异世界、二次元卡通、3A游戏渲染等多元艺术风格
04产业格局与应用前景
HiDream-O1-World打开三大全新产业格局:AI互动影游、具身智能仿真、3D场景生产。
AI 互动影游
叙事主动参与者
用户成为叙事主动参与者,世界随探索持续沿不同分支剧情演进,获得影视级沉浸感。以影视级视听叙事为外壳、用户交互为内核的新兴内容形态,HiDream-O1-World实现高效统一。
具身智能仿真
虚拟试验底座
高效搭建城市、工厂、室内等多类型仿真空间,替代高成本实景测试,加速智能机器人训练、自动驾驶等场景。为具身智能产业提供高质量虚拟试验底座。
3D 场景生产
数字仿真路径
轻松生成3D手办、家居场景、艺术空间,支持结构微调、风格秒换与智能补全;并可延伸至微观世界模拟(细胞行为、蛋白相互作用等),为药物发现与疾病机理研究开辟数字仿真路径。