不以动作为输入条件,就不叫世界模型:IEEE Fellow 张磊给出判别标准
当 2026 年上半年全球世界模型赛道融资额突破 300 亿元、涌入上千家团队时,IDEA 研究院讲席科学家、视启未来创始人张磊,却给出了一个让行业清醒的结论:绝大多数项目,并不符合世界模型的真正定义。
当 2026 年上半年全球世界模型赛道融资额突破 300 亿元、涌入上千家团队时,IDEA 研究院讲席科学家、视启未来创始人张磊,却给出了一个让行业清醒的结论:绝大多数项目,并不符合世界模型的真正定义。
2026 年上半年,中国 AI 圈的钱和人潮水般涌向同一个方向:世界模型。仅前六个月,国内该赛道披露融资总额约 300 亿元,若将"具身智能+世界模型"融合赛道算入,数字膨胀到 900 多亿,融资增速超去年同期 5 倍。
百亿资金、海量人才,如潮水般涌入。
但一个绕不过去的问题是:这么多人冲进来,有多少人真的想清楚了这东西到底是什么?
从业者在找方向,投资人在找人,猎头在摸组织,大厂战略部在研究谁能活下来。一件奇怪的事是:所有人都在问同一个问题——有没有谁能把世界模型讲清楚?
今天我们深访的张磊,是极少数给出清晰、可操作、不与任何主流妥协的答案的人。
张磊是 IEEE Fellow,DINO 系列与 Grounding DINO 被李飞飞团队、英伟达、银河通用等全球机构"标配"引用。
行业对"世界模型"的定义混乱程度,已经到了令人忧虑的地步:视频生成的叫世界模型,3D 空间建模的叫世界模型,LeCun 的 JEPA 架构也叫世界模型。
张磊的回应一针见血:世界模型一定要有动作依赖(Action Conditioned)。
智能体能够与环境交互的原因是动作:智能体的动作导致环境变化,环境变化后产生新状态并反馈给智能体——这是一个完整闭环。环境状态的每一次转移,都依赖于上一步所执行的具体动作。正确的表述应该是:Action Conditioned 的 Next State Prediction。
预测像素如何变化,生成自洽视频序列,但完全不建模"动作"与环境的交互因果。
以动作作为输入条件,预测"如果我做了这个动作,环境会变成什么样",服务于智能体决策。
最近很火的 World Action Model(WAM)也被张磊明确排除:WAM 是先果后因——先生成未来画面再反推动作,不能用于强化学习,不符合定义。
读懂上图:左侧是业界常见的"挂名"做法,右侧是张磊给出的严格判据。核心差异在于"动作是否作为模型输入的前提条件"。
LeCun 是隐空间派的旗帜人物,主张在抽象表征中做预测;Sora 代表像素派,追求画面纤毫毕现。两条路线表面水火不容,但张磊指出:像素路线实际上也要借助隐空间来操作——Stable Diffusion、Sora 都是先将图像压缩到低维表征空间再处理。
所以,表征空间才是更本质的问题。真正的分歧在于:进入隐空间之后要保留什么、丢掉什么。
隐空间路线希望排除光影、纹理等非物理规律驱动的细节,但面临表征坍塌风险——一万个不同画面映射成完全一样的表示,模型就丧失了辨别能力。像素路线追求逼真,本质是在讨好人的眼睛,但若做世界模型,真正该追求的不是像素多逼真,而是生成的视频序列要符合物理合理性。
注:此对比为定性示意,非定量评分。核心差异在于模型优化的目标函数——是"符合物理规律"还是"看起来像真的"。
张磊与 LeCun 共享同一条第一性原理:人脑做反事实推理是在抽象表征里推演,不在像素里重演。但张磊认为,具身方向的物理空间复杂度极高,要在隐空间里引入必要的物体结构。
直观来讲,物理规律是作用在物体上的。让隐空间表征理解物体,就可以更有效地学习物理规律。
这并非空谈——团队此前打磨的 DINO-X 已经解决了开放世界"看见物体"的问题,把"理解物体"做到了全球最好。现在,他们让物体成为世界模型预测与规划的基本单元。
LeCun 的路线是基础框架,张磊的团队在这个框架上引入物体结构,并让它在真实环境上闭环。"这个闭环的能力,是我们过去几年打出来的。"
张磊团队的核心积累:Grounding DINO 是首个把语言模型范式引入物体检测的团队,将检测拓展到开放域,至今仍是开源模型里引用和下载量最高的。
理解本身难以直接验证。语言模型到底怎么理解语言的,现在谁都讲不清楚,只能通过行为表象判断。世界模型面临类似困境。
张磊提出的验证方法是反事实测试:让模型尝试不同动作,看能否给出物理合理的结果。如果轨迹偏一点也能做对,说明学到了规律;做不对,说明学的可能仍是统计相关性。
这也回应了业界对"物体为中心"框架的担忧——流沙、水流、烟雾等没有清晰边界的物体怎么办?张磊的答案是:从 Mask 入手,把物体区域的像素分割出来,这是过去几年视觉领域最成熟的技术之一。
张磊也承认,这条路线面临真实挑战:理解和验证之间仍有鸿沟。模型到底有没有真正理解物理规律,是不是真的捕捉到了物体结构,很难直接讲清楚。
但他坚信一种简洁范式迭代的力量:"语言模型研究者曾经恨不得把句法结构分析出来喂给它,最后还是打不过'预测下一个 Token'这个简单范式。"
过多人为设计,短期有效,长期会阻碍迭代。
他经历过 2018 年弱监督物体检测的失败——"这轮做不通,就换个角度,吃饭睡觉都在想,围着它不停地转。"直到 2022 年底 ChatGPT 出现的时刻,语言模型能力上来了,数据足够大了,Grounding DINO 的突破"自然而然地涌现"。
当 900 亿资金涌入一个连定义都尚未统一的赛道,概念的澄清比融资额更重要。张磊给出的判据——"不以动作为输入条件,就不叫世界模型"——正在划下一条清晰的线:真正稀缺的不是"看起来很真"的视频生成,而是能驱动机器人低成本试错、理解物理因果的决策引擎。行业下半场的分水岭,不在算力,而在对"模型到底在学什么"的认知深度。
关注视启未来与 IDEA 研究院计算机视觉与机器人研究中心(CVR)的公开技术报告与论文。
关注 DINO 系列开源工作 →