🎙️ 深度对话 · 世界模型路线之争

不以动作为输入条件,就不叫世界模型:IEEE Fellow 张磊给出判别标准

当 2026 年上半年全球世界模型赛道融资额突破 300 亿元、涌入上千家团队时,IDEA 研究院讲席科学家、视启未来创始人张磊,却给出了一个让行业清醒的结论:绝大多数项目,并不符合世界模型的真正定义。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#世界模型 #具身智能 #DINO-X #张磊 #路线之争
300亿+ 2026 上半年世界模型赛道融资额
900亿+ 含具身智能融合赛道后总额
5倍+ 相比去年同期的融资增速

⚡ 30 秒速览

  • 核心判定:世界模型必须满足 Action Conditioned——能回答"如果我做了这个动作,环境会变成什么样"。
  • 谁被排除:Sora 等纯视频生成模型、WAM(世界动作模型)均不符合此定义,因为它们没有建模真正意义上的动作因果。
  • 路线之争:隐性空间派(LeCun 与张磊)主张在抽象表征中推演,像素派(Sora)追求画面逼真,分歧在"隐空间里保留什么"。
  • 张磊的差异牌:在隐空间引入"物体结构",用 DINO-X 的感知能力让模型先分清物体,再学习物理规律。
  • 行业警示:"大多数人没想清楚世界模型是什么"——概念混用正在推高泡沫风险。

01热潮之下,一个被忽视的问题

2026 年上半年,中国 AI 圈的钱和人潮水般涌向同一个方向:世界模型。仅前六个月,国内该赛道披露融资总额约 300 亿元,若将"具身智能+世界模型"融合赛道算入,数字膨胀到 900 多亿,融资增速超去年同期 5 倍

百亿资金、海量人才,如潮水般涌入。

但一个绕不过去的问题是:这么多人冲进来,有多少人真的想清楚了这东西到底是什么?

从业者在找方向,投资人在找人,猎头在摸组织,大厂战略部在研究谁能活下来。一件奇怪的事是:所有人都在问同一个问题——有没有谁能把世界模型讲清楚?

今天我们深访的张磊,是极少数给出清晰、可操作、不与任何主流妥协的答案的人。

77,000+ Google Scholar 引用量
107 H-Index
5个月 DINO 系列在 COCO 霸榜时长

张磊是 IEEE Fellow,DINO 系列与 Grounding DINO 被李飞飞团队、英伟达、银河通用等全球机构"标配"引用。

02世界模型?先过这一关

行业对"世界模型"的定义混乱程度,已经到了令人忧虑的地步:视频生成的叫世界模型,3D 空间建模的叫世界模型,LeCun 的 JEPA 架构也叫世界模型。

张磊的回应一针见血:世界模型一定要有动作依赖(Action Conditioned)

智能体能够与环境交互的原因是动作:智能体的动作导致环境变化,环境变化后产生新状态并反馈给智能体——这是一个完整闭环。环境状态的每一次转移,都依赖于上一步所执行的具体动作。正确的表述应该是:Action Conditioned 的 Next State Prediction

❌ 纯视频生成(Sora 类)

预测像素如何变化,生成自洽视频序列,但完全不建模"动作"与环境的交互因果。

✅ 强化学习意义下的世界模型

以动作作为输入条件,预测"如果我做了这个动作,环境会变成什么样",服务于智能体决策。

最近很火的 World Action Model(WAM)也被张磊明确排除:WAM 是先果后因——先生成未来画面再反推动作,不能用于强化学习,不符合定义。

读懂上图:左侧是业界常见的"挂名"做法,右侧是张磊给出的严格判据。核心差异在于"动作是否作为模型输入的前提条件"。

03隐空间 vs 像素:分歧不在表面

LeCun 是隐空间派的旗帜人物,主张在抽象表征中做预测;Sora 代表像素派,追求画面纤毫毕现。两条路线表面水火不容,但张磊指出:像素路线实际上也要借助隐空间来操作——Stable Diffusion、Sora 都是先将图像压缩到低维表征空间再处理。

所以,表征空间才是更本质的问题。真正的分歧在于:进入隐空间之后要保留什么、丢掉什么。

隐空间路线希望排除光影、纹理等非物理规律驱动的细节,但面临表征坍塌风险——一万个不同画面映射成完全一样的表示,模型就丧失了辨别能力。像素路线追求逼真,本质是在讨好人的眼睛,但若做世界模型,真正该追求的不是像素多逼真,而是生成的视频序列要符合物理合理性

🧠 隐空间派(张磊/LeCun)抽象表征中推演,强调物理因果
物理合理性 ↑
🎬 像素派(Sora 类)逐像素渲染,讨好人的眼睛
画面逼真度 ↑

注:此对比为定性示意,非定量评分。核心差异在于模型优化的目标函数——是"符合物理规律"还是"看起来像真的"。

04一张"物体结构"的差异牌

张磊与 LeCun 共享同一条第一性原理:人脑做反事实推理是在抽象表征里推演,不在像素里重演。但张磊认为,具身方向的物理空间复杂度极高,要在隐空间里引入必要的物体结构

直观来讲,物理规律是作用在物体上的。让隐空间表征理解物体,就可以更有效地学习物理规律。

这并非空谈——团队此前打磨的 DINO-X 已经解决了开放世界"看见物体"的问题,把"理解物体"做到了全球最好。现在,他们让物体成为世界模型预测与规划的基本单元。

DINO-X 物体感知隐空间物体结构化Action Conditioned 预测物理规律学习

LeCun 的路线是基础框架,张磊的团队在这个框架上引入物体结构,并让它在真实环境上闭环。"这个闭环的能力,是我们过去几年打出来的。"

张磊团队的核心积累:Grounding DINO 是首个把语言模型范式引入物体检测的团队,将检测拓展到开放域,至今仍是开源模型里引用和下载量最高的。

05怎么知道模型"真懂"了物理?

理解本身难以直接验证。语言模型到底怎么理解语言的,现在谁都讲不清楚,只能通过行为表象判断。世界模型面临类似困境。

张磊提出的验证方法是反事实测试:让模型尝试不同动作,看能否给出物理合理的结果。如果轨迹偏一点也能做对,说明学到了规律;做不对,说明学的可能仍是统计相关性。

🧪 反事实测试:判断模型是否真懂物理核心方法

  • 方法:给模型施加不同的动作输入,观察其预测的环境变化是否符合物理直觉。
  • 验证标准:如果动作轨迹稍有偏差,模型仍能给出物理合理的结果,说明学到了规律而非死记硬背。
  • 反例:Sora 类模型常出现杯子悬浮、物体穿模、蜡烛吹不灭等违背物理常识的输出。
关键洞察:"理解"本身难以直接验证,只能通过行为表象判断。中间步骤的可视化若与人类直觉一致,则说明模型可能捕捉到了物体结构。

这也回应了业界对"物体为中心"框架的担忧——流沙、水流、烟雾等没有清晰边界的物体怎么办?张磊的答案是:从 Mask 入手,把物体区域的像素分割出来,这是过去几年视觉领域最成熟的技术之一。

06一个诚实的注脚

张磊也承认,这条路线面临真实挑战:理解和验证之间仍有鸿沟。模型到底有没有真正理解物理规律,是不是真的捕捉到了物体结构,很难直接讲清楚。

但他坚信一种简洁范式迭代的力量:"语言模型研究者曾经恨不得把句法结构分析出来喂给它,最后还是打不过'预测下一个 Token'这个简单范式。"

过多人为设计,短期有效,长期会阻碍迭代。

他经历过 2018 年弱监督物体检测的失败——"这轮做不通,就换个角度,吃饭睡觉都在想,围着它不停地转。"直到 2022 年底 ChatGPT 出现的时刻,语言模型能力上来了,数据足够大了,Grounding DINO 的突破"自然而然地涌现"。

编辑核心判断

当 900 亿资金涌入一个连定义都尚未统一的赛道,概念的澄清比融资额更重要。张磊给出的判据——"不以动作为输入条件,就不叫世界模型"——正在划下一条清晰的线:真正稀缺的不是"看起来很真"的视频生成,而是能驱动机器人低成本试错、理解物理因果的决策引擎。行业下半场的分水岭,不在算力,而在对"模型到底在学什么"的认知深度。

想进一步了解?

关注视启未来与 IDEA 研究院计算机视觉与机器人研究中心(CVR)的公开技术报告与论文。

关注 DINO 系列开源工作