国产交互式世界模型登顶导航评测榜,文本图片一键生成可探索3D世界
8月17日,智象未来发布原生全模态交互式世界模型 HiDream-O1-World。它不只生成一段视频,而是尝试让用户进入一个能够被漫游、编辑并持续响应操作的三维世界。
8月17日,智象未来发布原生全模态交互式世界模型 HiDream-O1-World。它不只生成一段视频,而是尝试让用户进入一个能够被漫游、编辑并持续响应操作的三维世界。
WBench 是面向交互式世界模型的系统性评测,Navi 分榜重点观察模型能否在连续运镜中执行指令,同时维持场景结构和物体状态。HiDream-O1-World 的优势并非单帧画质,而是让生成的空间在移动过程中尽量“保持原样”。
榜单结果,先回答了“它是否能持续记住这个世界”。
注:原始报道仅披露榜首平均分及关键维度成绩,未披露完整 Top 榜分数;柱形为信息示意,不用于推算其他模型排名。
注:五个维度包括视频质量、设定遵循度、交互遵循度、一致性与物理真实性;数字越高代表综合表现越强。
交互式世界模型最容易在“看起来很真”上制造错觉:一旦镜头转向、用户返回原位,物体可能漂移,房间布局可能重置,碰撞和重力也可能失去因果关系。WBench 将这些连续交互过程拆成可重复检查的任务,而不是只截取一张漂亮画面。
注:提升幅度来自报道披露的对比结果;“+13.6%”与“+12.7%”不是榜单绝对分数,不能直接与平均分相加。
此外,智象未来与复旦大学围绕空间一致性开展的 DreamWorld 研究论文已被 ECCV 2026 接收。论文接收可以证明技术路线进入学术评审视野,但它不等于产品已经完成产业级验证。
用户可以输入文字、上传图片,或直接进行交互操控。模型以输入内容为起点补全周边环境,随后提供第一人称与第三人称两种视角,让用户在场景中前进、后退、转向,也可以驱动角色行动。
传统视频生成模型通常依据有限上下文预测下一帧。当镜头移动范围扩大、交互轮次增加,早先出现过的物体就可能消失或变形。HiDream-O1-World 的技术路线,是把“当前世界长什么样”从短暂画面,变成可持续调用的空间信息。
注:流程展示的是报道披露的机制关系,不代表完整模型结构或实际推理耗时。
模型编码场景几何结构、物体位置及空间关系,并在多轮镜头移动后调用这些信息,减少场景重置与物体位置变化。
推理阶段针对当前交互序列进行轻量在线自适应,让内部表征持续对齐当前场景的3D几何约束。
物理一致性则从训练和推理两端补强:训练数据覆盖刚体碰撞、流体运动、柔性形变、重力抛射与光影变化;推理时,模型还会针对水流、刚体等材料和物体类型动态调整表征。
如果一个生成世界可以持续存在,并且能响应用户操作,它就不再只是视频内容,而可能成为一种交互基础设施。HiDream-O1-World 当前瞄准的方向,集中在内容、仿真和生产三类场景。
根据用户移动、操作与选择实时生成后续场景,让剧情从固定路线转向可探索的分支叙事。
批量生成城市、工厂和室内环境,为机器人、自动驾驶与智能制造提供虚拟训练和测试场景。
服务手办、家居与艺术空间创作,支持结构调整、风格切换和内容补全。
注:以上为官方披露的规划方向,不等同于所有场景已经实现商业化部署。
团队还计划探索微观世界模拟,例如细胞行为与蛋白质相互作用。但这类用途对仿真精度、可解释性和验证体系要求更高,不能简单沿用视觉展示场景的评价标准。
WBench Navi 分榜的成绩,说明 HiDream-O1-World 在导航、空间一致性和物理维度上交出了有竞争力的结果;DreamWorld 论文被接收,也为几何驱动路线增加了研究层面的支撑。
但交互式世界模型距离大规模产业应用,仍要回答几个现实问题:生成速度能否跟上实时操作?长时间运行的成本是否可接受?复杂场景是否会累积误差?仿真结果又能否达到机器人训练和工业测试所需的精度?
世界模型的竞争正在从“生成一段逼真的画面”,转向“维护一个可被反复操作、验证并持续存在的世界”;谁能把空间记忆、物理约束和推理成本同时压住,谁才有机会把交互式生成真正变成基础设施。
原文已公开 DreamWorld 项目主页与论文信息,可通过项目名称检索研究细节;HiDream-O1-World 的实际体验入口与开放方式,以智象未来后续公告为准。