🌐 世界模型 · 技术快讯

国产交互式世界模型登顶导航评测榜,文本图片一键生成可探索3D世界

8月17日,智象未来发布原生全模态交互式世界模型 HiDream-O1-World。它不只生成一段视频,而是尝试让用户进入一个能够被漫游、编辑并持续响应操作的三维世界。

2026-08-18 全文约 4 分钟读完
#HiDream-O1-World #交互式世界模型 #WBench #3D生成
80.9 WBench Navi 分榜平均分
73.3 Physical 维度 · 榜单第一
88.0 Consistency 一致性得分

⚡ 30 秒速览

  • 发生了什么:HiDream-O1-World 登顶 WBench Navi 分榜,主打连续漫游、场景编辑与实时交互。
  • 评测考什么:WBench 覆盖 289 个多轮案例、1058 个交互轮次,从视频质量到物理真实性设置 22 项指标。
  • 它能做什么:用户可用文字、图片或交互创建场景,并控制角色动作、天气、物体状态与镜头视角。
  • 技术抓手:把 3D 空间先验写入 Memory,再以 Test-Time Training 在推理阶段持续校准。
  • 仍待验证:交互速度、生成成本、长时间稳定性与仿真精度,决定它能否从展示走向规模化应用。

01先看成绩:赢在导航与物理

WBench 是面向交互式世界模型的系统性评测,Navi 分榜重点观察模型能否在连续运镜中执行指令,同时维持场景结构和物体状态。HiDream-O1-World 的优势并非单帧画质,而是让生成的空间在移动过程中尽量“保持原样”。

榜单结果,先回答了“它是否能持续记住这个世界”。

HiDream-O1-World智象未来
80.9
其他参测模型平均水平参照

注:原始报道仅披露榜首平均分及关键维度成绩,未披露完整 Top 榜分数;柱形为信息示意,不用于推算其他模型排名。

289多轮交互案例
1058交互轮次
5评测维度
22细分指标

注:五个维度包括视频质量、设定遵循度、交互遵循度、一致性与物理真实性;数字越高代表综合表现越强。

02为什么可信:第三方测试拆成了什么

交互式世界模型最容易在“看起来很真”上制造错觉:一旦镜头转向、用户返回原位,物体可能漂移,房间布局可能重置,碰撞和重力也可能失去因果关系。WBench 将这些连续交互过程拆成可重复检查的任务,而不是只截取一张漂亮画面。

Physical 物理真实性碰撞、流体、形变、重力等关系
73.3 · No.1
Consistency 一致性跨视角、跨轮次维持空间与物体状态
88.0
视觉合理性相较参测模型平均水平
+13.6%
因果保真度流体、碰撞与形变等物理关系
+12.7%

注:提升幅度来自报道披露的对比结果;“+13.6%”与“+12.7%”不是榜单绝对分数,不能直接与平均分相加。

此外,智象未来与复旦大学围绕空间一致性开展的 DreamWorld 研究论文已被 ECCV 2026 接收。论文接收可以证明技术路线进入学术评审视野,但它不等于产品已经完成产业级验证。

03它到底能做什么?从一张图走进一个世界

用户可以输入文字、上传图片,或直接进行交互操控。模型以输入内容为起点补全周边环境,随后提供第一人称与第三人称两种视角,让用户在场景中前进、后退、转向,也可以驱动角色行动。

🛏️ 卧室照片 → 可探索室内空间

  • 上传一张卧室照片后,模型根据已有空间关系继续生成房间其他区域。
  • 镜头移动时,家具的尺寸、摆放位置与遮挡关系需要保持连续。
  • 它与普通图像扩展的区别在于:目标不是补齐画面,而是补齐一个可从不同角度观察的空间。
编辑观察:“看见更多”只是第一步,重新回到原位置时还能看见同一个房间,才是核心难点。

🤿 海底潜水 → 环境随镜头发生变化

  • 镜头移动时,水面光影、珊瑚纹理与鱼群运动同步变化。
  • 镜头靠近珊瑚后,模型继续生成局部细节,并尽量维持整体结构稳定。
  • 变化不只发生在镜头中心,还需要与周边空间和光照关系保持一致。
编辑观察:动态环境越复杂,模型越需要同时处理空间、材质与时间变化。

🏔️ 登雪山 → 角色动作与自然反馈联动

  • 角色可以行走,雪地留下脚印,雪花运动随风速变化。
  • 视角移动时,远处山体轮廓与近处岩石纹理持续呈现。
  • 支持人类、动物和虚构角色,也覆盖城市、室内、自然与幻想风格。
编辑观察:如果这些反馈能在长时间交互中稳定存在,世界模型才真正接近“可进入的场景”。

04为什么能做到:把空间记忆带进推理过程

传统视频生成模型通常依据有限上下文预测下一帧。当镜头移动范围扩大、交互轮次增加,早先出现过的物体就可能消失或变形。HiDream-O1-World 的技术路线,是把“当前世界长什么样”从短暂画面,变成可持续调用的空间信息。

输入文字 / 图片建立3D先验写入 Memory交互生成TTT校准

注:流程展示的是报道披露的机制关系,不代表完整模型结构或实际推理耗时。

3D 先验注入 Memory

模型编码场景几何结构、物体位置及空间关系,并在多轮镜头移动后调用这些信息,减少场景重置与物体位置变化。

Test-Time Training

推理阶段针对当前交互序列进行轻量在线自适应,让内部表征持续对齐当前场景的3D几何约束。

物理一致性则从训练和推理两端补强:训练数据覆盖刚体碰撞、流体运动、柔性形变、重力抛射与光影变化;推理时,模型还会针对水流、刚体等材料和物体类型动态调整表征。

05从演示走向应用:三条落地路径

如果一个生成世界可以持续存在,并且能响应用户操作,它就不再只是视频内容,而可能成为一种交互基础设施。HiDream-O1-World 当前瞄准的方向,集中在内容、仿真和生产三类场景。

🎮

AI互动影游

根据用户移动、操作与选择实时生成后续场景,让剧情从固定路线转向可探索的分支叙事。

🤖

具身智能仿真

批量生成城市、工厂和室内环境,为机器人、自动驾驶与智能制造提供虚拟训练和测试场景。

🧩

3D场景生产

服务手办、家居与艺术空间创作,支持结构调整、风格切换和内容补全。

注:以上为官方披露的规划方向,不等同于所有场景已经实现商业化部署。

团队还计划探索微观世界模拟,例如细胞行为与蛋白质相互作用。但这类用途对仿真精度、可解释性和验证体系要求更高,不能简单沿用视觉展示场景的评价标准。

06一个诚实的注脚:榜首不等于完成

WBench Navi 分榜的成绩,说明 HiDream-O1-World 在导航、空间一致性和物理维度上交出了有竞争力的结果;DreamWorld 论文被接收,也为几何驱动路线增加了研究层面的支撑。

但交互式世界模型距离大规模产业应用,仍要回答几个现实问题:生成速度能否跟上实时操作?长时间运行的成本是否可接受?复杂场景是否会累积误差?仿真结果又能否达到机器人训练和工业测试所需的精度?

编辑核心判断

世界模型的竞争正在从“生成一段逼真的画面”,转向“维护一个可被反复操作、验证并持续存在的世界”;谁能把空间记忆、物理约束和推理成本同时压住,谁才有机会把交互式生成真正变成基础设施。

如何进一步了解

原文已公开 DreamWorld 项目主页与论文信息,可通过项目名称检索研究细节;HiDream-O1-World 的实际体验入口与开放方式,以智象未来后续公告为准。

检索「DreamWorld」→ 阅读论文与项目资料