空间智能走到分水岭:AI 造出的三维世界,凭什么「经得起折腾」?
当 AI 的交付物从「一张图」变成「一个可以走进去的世界」,评判标准彻底变了。李飞飞押注的空间智能路线,正在回答一道工程考题:AI 生成的世界,能否在用户进入、操作、修改之后依然成立。
当 AI 的交付物从「一张图」变成「一个可以走进去的世界」,评判标准彻底变了。李飞飞押注的空间智能路线,正在回答一道工程考题:AI 生成的世界,能否在用户进入、操作、修改之后依然成立。
空间智能的基本构想并不复杂:让 AI 从识别二维画面,走向理解、推理和生成可进入、可操作、可持续编辑的三维世界。真正的考验在于——一个「站得住」的世界,是怎样构建出来的?
输出一张图、一段视频。人只能观看,画面中的任何东西都无法被改变。
输出三维世界。人可以进入、操作、持续编辑,对象在行动后仍保持身份。
Kimi K3 的官方演示里,一段自然语言最终变成浏览器中的程序化开放世界:骑乘、森林、村庄、山地、水体和天气处于同一运行画面。GPT-5.6 与 Codex 构建的 MiniTown 更进一步——房屋和道路之外,分区、居民日程、车辆与昼夜循环也被组织进同一状态,一幅城市画面由此获得了时间、规则和行为。
所谓「一句话生成」,实际压缩了一条很长的生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。
世界开始接受行动,状态维护随即进入智能系统的核心。
如果只把空间智能当作一种新渲染技术,很容易高估它的成熟度。建立世界相对容易;让世界在每一次局部修改后继续成立,才是真正的难题。
用户实际等待的是第一个通过几何、功能和任务检查的结果。单轮生成即使很快,只要接受率偏低,时间仍会被资产检索、渲染、碰撞检测、视觉审阅和反复修复吞掉。
注:时间按公开文档与论文复测整理,非均匀尺度。「首帧速度」与「首次有效速度」是两个完全不同的指标。
复测数据更直观:同一 A6000 环境下,LayoutGPT、Holodeck、SceneOrchestra 与 SceneWeaver 的平均运行时间,从 2.3 分钟延伸到 91 分钟。
注:四个方案在同一环境下的复测范围,代表「画得快」与「能交货」之间的真实差距。
世界最容易在局部修改后失去连续性。感知式世界会在视角切换、遮挡和重返场景时改变尺度或细节;符号化系统可能在移动一个对象后破坏碰撞、承托、朝向、绑定或路径。对象仍在,关系已经断裂。
瓶颈背后,是路线选择的分歧与合流。目前构建可运行三维世界的路径,主要沿三条线展开:
视觉生成驱动
对象身份与规则驱动
统一中间表示
三者起点不同、优势各异,但正朝同一方向收敛。
那么,怎么破局?答案藏在一个朴素的词里:状态层。
空间智能的三层能力已经形成共识:Renderer 把世界「画出来」,Simulator 记住「世界现在是什么样、行动之后会变成什么样」,Planner 决定「下一步做什么」。三者之间的连接,尤其是模拟与规划共享的状态层——那本「底账」,直接决定了一个生成世界能否继续运行。
这本「底账」需要同时容纳三类状态:语义状态说明对象是什么、承担什么功能;几何状态保存尺寸、位置、边界与拓扑;运行状态记录门是否打开、角色在做什么、路径是否有效。三者绑定在同一对象生命周期中,每次修改都转化为可检查的局部补丁,重算范围被限制在受影响区域。
更重要的能力是「越用越聪明」:系统把「状态—目标—行动—新状态—验证—反馈」保存为完整轨迹,从真实交互中识别能力缺口,自动生成新任务与困难样本,再经独立评测、版本门控与回滚驱动下一轮迭代。
裁判由四层组成:确定性规则检查格式、边界与对象生命周期;几何求解与路径搜索判断空间是否可用;多模态模型观察遮挡、语义与整体视觉后果;用户行为或机器人任务给出最终反馈。诊断比总分更重要——「门被挡住了」比「评分 73 分」更能指向修复位置。
注:来自研究稿中的代理评分(Gemini 2.5 Pro 评审)。Scene Compatibility 越高越好,Artifact 越低越好;代理房间目前为二维近似,结果需第三方复现进一步校验。
空间智能的竞赛,已从「谁画得更像」转向「谁的世界在行动后依然成立」。当前跑通的闭环大多停留在演示与自建基准层面——真实三维碰撞、长程交互与第三方复现仍未充分检验。真正拿到世界模型入场券的标志,不是发布一支惊艳 Demo,而是把「经得起折腾」变成可公开复现的工程指标。
世界模型的下一步验证,不再看首帧画质与演示规模,而是看这三个问题: