🌐 空间智能 · 前沿深读

空间智能走到分水岭:AI 造出的三维世界,凭什么「经得起折腾」?

当 AI 的交付物从「一张图」变成「一个可以走进去的世界」,评判标准彻底变了。李飞飞押注的空间智能路线,正在回答一道工程考题:AI 生成的世界,能否在用户进入、操作、修改之后依然成立。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#空间智能 #世界模型 #3D生成 #AI工程化
20秒1小时 第一个「可用世界」的等待时间跨度
50 LLM 独立输出完整事件图:全部失败
0.73/1.0 VisAlign 空间兼容分,基线仅 0.56

⚡ 30 秒速览

  • 交付形态质变:AI 从输出「画面」走向输出「可进入、可操作、可编辑」的三维世界,互动方式从「观看」变为「进入并行动」。
  • 两大瓶颈卡住落地:速度瓶颈——首帧返回很快,第一个「能继续工作的世界」却要等几分钟到一小时;状态瓶颈——局部改一处,全局关系开始失守。
  • 三条路线在收敛:视觉生成式、符号/程序化、融合架构正在汇合,关键检验发生在「行动之后」:观察与状态能否同步更新。
  • 破局点是「底账」:Renderer 画、Simulator 算、Planner 决策,三者之间需要一份独立、可验证、可增量更新的统一状态层。
  • 验证升级但远未终局:行业正从「成功渲染」走向「状态正确、任务可做」;真实三维碰撞与第三方复现仍是未过关的考题。

01交付物变了 从「一幅画面」到「一个世界」

空间智能的基本构想并不复杂:让 AI 从识别二维画面,走向理解、推理和生成可进入、可操作、可持续编辑的三维世界。真正的考验在于——一个「站得住」的世界,是怎样构建出来的?

旧范式:生成画面

输出一张图、一段视频。人只能观看,画面中的任何东西都无法被改变。

新范式:生成世界

输出三维世界。人可以进入、操作、持续编辑,对象在行动后仍保持身份。

Kimi K3 的官方演示里,一段自然语言最终变成浏览器中的程序化开放世界:骑乘、森林、村庄、山地、水体和天气处于同一运行画面。GPT-5.6 与 Codex 构建的 MiniTown 更进一步——房屋和道路之外,分区、居民日程、车辆与昼夜循环也被组织进同一状态,一幅城市画面由此获得了时间、规则和行为

所谓「一句话生成」,实际压缩了一条很长的生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。

世界开始接受行动,状态维护随即进入智能系统的核心。

02「等不起」与「改不动」 两个真实瓶颈

如果只把空间智能当作一种新渲染技术,很容易高估它的成熟度。建立世界相对容易;让世界在每一次局部修改后继续成立,才是真正的难题。

速度瓶颈:第一次返回很快,第一个有效结果却很慢

用户实际等待的是第一个通过几何、功能和任务检查的结果。单轮生成即使很快,只要接受率偏低,时间仍会被资产检索、渲染、碰撞检测、视觉审阅和反复修复吞掉。

≈20 秒Draft 草稿场景
≈5 分钟完整 World
≈1 小时高质量 Mesh

注:时间按公开文档与论文复测整理,非均匀尺度。「首帧速度」与「首次有效速度」是两个完全不同的指标。

复测数据更直观:同一 A6000 环境下,LayoutGPT、Holodeck、SceneOrchestra 与 SceneWeaver 的平均运行时间,从 2.3 分钟延伸到 91 分钟

2.3最短方案平均耗时
91最长方案平均耗时

注:四个方案在同一环境下的复测范围,代表「画得快」与「能交货」之间的真实差距。

状态瓶颈:局部修改之后,全局关系开始失守

世界最容易在局部修改后失去连续性。感知式世界会在视角切换、遮挡和重返场景时改变尺度或细节;符号化系统可能在移动一个对象后破坏碰撞、承托、朝向、绑定或路径。对象仍在,关系已经断裂。

🧱 FloorplanQA 室内布局

  • 模型反复违反碰撞与路径约束:家具越界、对象重叠、错误朝向。
  • 单点看起来正常,全局关系却站不住。

🎮 GameCraft-Bench 游戏机制

  • 局部机制能运行,完整游戏依然失败——单点修补解决不了系统级状态冲突。

🗺️ GEST 事件图生成

  • 让 LLM 独立输出完整事件图,50 次尝试全部失败
  • 程序化状态后端接管对象生命周期、时序与合法操作后,执行才稳定下来。
公开评测的一致结论:缺少独立、可增量更新的状态层,生成内容就承受不了真实行动。

03三条技术路线 同一个收敛方向

瓶颈背后,是路线选择的分歧与合流。目前构建可运行三维世界的路径,主要沿三条线展开:

👁️ 感知式

视觉生成驱动

  • 把世界信息压在画面或潜在表征里
  • 强在画质与连续空间泛化
  • 错误常藏在镜头之外
代表:World Labs

🧩 符号 / 程序化

对象身份与规则驱动

  • 把对象和程序显式写出
  • 强在可编辑、可验证
  • 错误常藏在代码与工具状态之后
代表:场景图 / 场景脚本研究

🔀 融合架构

统一中间表示

  • 视觉经验 + 符号规则的合流
  • 试图兼顾画质与可操作性
  • 关键检验在行动之后
代表:生境科技等

三者起点不同、优势各异,但正朝同一方向收敛。

04破局:给世界建一本「底账」 表示 → 转移 → 验证

那么,怎么破局?答案藏在一个朴素的词里:状态层

空间智能的三层能力已经形成共识:Renderer 把世界「画出来」,Simulator 记住「世界现在是什么样、行动之后会变成什么样」,Planner 决定「下一步做什么」。三者之间的连接,尤其是模拟与规划共享的状态层——那本「底账」,直接决定了一个生成世界能否继续运行。

表示 · 描述当前世界 转移 · 计算行动变化 验证 · 检查新状态

这本「底账」需要同时容纳三类状态:语义状态说明对象是什么、承担什么功能;几何状态保存尺寸、位置、边界与拓扑;运行状态记录门是否打开、角色在做什么、路径是否有效。三者绑定在同一对象生命周期中,每次修改都转化为可检查的局部补丁,重算范围被限制在受影响区域。

更重要的能力是「越用越聪明」:系统把「状态—目标—行动—新状态—验证—反馈」保存为完整轨迹,从真实交互中识别能力缺口,自动生成新任务与困难样本,再经独立评测、版本门控与回滚驱动下一轮迭代。

🏢 一个国内工程化样本:生境科技

  • 空间状态模型、空间—行动模型与空间执行引擎围绕同一世界状态组织。
  • MST-Builder 把合规图文、商品、3D 资产与 UGC 编译为带语义、几何、关系、来源与许可信息的空间 Token;NSF 用连续功能场表达「哪里适合做什么」。
  • 局部修改只需重算受影响区域,工程上已实现 20 秒级增量解算
这正是「等不起、改不动」两个瓶颈的对症解法——但距离大规模第三方复现仍有距离。

闭环的最后一步:谁来验收

裁判由四层组成:确定性规则检查格式、边界与对象生命周期;几何求解与路径搜索判断空间是否可用;多模态模型观察遮挡、语义与整体视觉后果;用户行为或机器人任务给出最终反馈。诊断比总分更重要——「门被挡住了」比「评分 73 分」更能指向修复位置。

Scene Compatibility
0.73
SFT 基线
0.56
Artifact 伪影
0.15
修复前伪影
0.24

注:来自研究稿中的代理评分(Gemini 2.5 Pro 评审)。Scene Compatibility 越高越好,Artifact 越低越好;代理房间目前为二维近似,结果需第三方复现进一步校验。

编辑核心判断

空间智能的竞赛,已从「谁画得更像」转向「谁的世界在行动后依然成立」。当前跑通的闭环大多停留在演示与自建基准层面——真实三维碰撞、长程交互与第三方复现仍未充分检验。真正拿到世界模型入场券的标志,不是发布一支惊艳 Demo,而是把「经得起折腾」变成可公开复现的工程指标

接下来,盯住三个指标

世界模型的下一步验证,不再看首帧画质与演示规模,而是看这三个问题:

首次有效多久拿到第一个可继续工作的场景
约束通过局部修改后,碰撞、承托、路径是否守住
长程一致几十轮行动后,世界是否依然自洽
持续追踪空间智能 → 关注评测基准与开源进展