🌍 世界模型 · 榜单速递

国产世界模型登顶李飞飞 WorldScore,单图生成任意视角视频

兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶斯坦福李飞飞团队 WorldScore 榜单。给它一张图或一段随手拍的视频,它能还你一段"相机轨迹任你指定"的新视角视频——推、拉、摇、移,甚至绕场景 360° 转一圈,代码与权重已全部开源,并已适配国产昇腾算力。

来源:公开报道 2026-07-24 全文约 4 分钟读完
#UniWorld-View #世界模型 #WorldScore #新视角合成 #开源
🥇 第 1 名 WorldScore 榜单 · 李飞飞团队出品
1 张 单图输入,生成任意视角视频
1 套 同一代码同一模型,覆盖 3D 与 4D

⚡ 30 秒速览

  • 登顶了什么:WorldScore——由斯坦福李飞飞团队推出的世界模型评测基准,专门衡量空间智能能力。
  • 难在哪:新视角合成(NVS)本质是让 AI"脑补"没拍到的角度。只给正脸要画出后脑勺,传统方法轻则空洞伪影、重则直接摆烂。
  • 怎么破:双重投影专治"前景背景撕裂",法向过滤专治"背面漏光"——先把条件图里的错误几何信号清零,再交给生成模型补全。
  • 架构巧思:双流条件注入——"几何流"管构图钉死 3D 结构,"外观流"管上色去原视频翻素材。
  • 更深一步:多换几个机位,单目视频变多视角视频,4D 重建从"不可能任务"变常规操作。
  • 去哪复现:代码权重全开源,训练数据来自北大系初创企业元空智能。

01WorldScore 榜单 UniWorld-View 位居榜首

🥇 UniWorld-View兔展智能 / 北大 / 鹏城实验室
榜首
ViewCrafter几何 + 生成路线代表
第二
GEN3C英伟达 · 几何 + 生成路线
第三
传统 NeRF / 3DGS重建路线
靠后
纯生成式扩散无显式 3D 建模
靠后

注:WorldScore 官方未公开各模型精确分值,上表按报道披露的相对排位示意;柱形长度仅作直观对照,非真实分差。UniWorld-View 以"遮挡感知点云渲染 + 双流条件注入"的技术组合拿下榜首。

02WorldScore:考的是最难作假的空间智能

WorldScore 由斯坦福李飞飞团队推出,专门评测世界模型在空间理解与生成上的能力。它衡量的不是"模型会不会画",而是"模型懂不懂得这个世界的三维结构"。

新视角合成(Novel View Synthesis)是其中最硬核的子任务之一——本质是让 AI"脑补"没拍到的角度。难点全在"大基线"三个字上:只给 AI 看正脸,让它画出侧脸,甚至后脑勺。

重建路线(NeRF / 3DGS)

看得越多建得越好。可随手拍的单目视频视角覆盖约等于零,喂进去轻则空洞伪影满天飞,重则直接摆烂。

纯生成式扩散

敢画,但把相机位姿当"口头指令"塞进模型,没有显式 3D 建模,走两步就飘,转大角度直接失控。

几何 + 生成(UniWorld-View 路线)

先用几何模型撑成 3D 点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。几何归几何,生成归生成。

ViewCrafter、英伟达 GEN3C 走的也是第三条路,但 UniWorld-View 在这条路线上填了一个大家都踩过、却没人认真处理的坑。

03两板斧砍向点云渲染的"穿帮"核心技术创新

第三条路上藏着一个共同的坑:点云渲染会穿帮。点云是一堆孤立的点,既不知道谁跟谁相连,也不知道哪面朝外。视角一转大,两种经典穿帮就来了。

🔲 穿帮一:前景背景撕裂双重投影 专治

  • 深度边界处没有连接信息,视角一变,前景纹理像口香糖一样被扯到背景上,或背景像素糊到前景脸上。
  • 解法:把源画面投影到目标视角,再原路投影回来。来回一倒腾,凡是"回不来"的像素就是会被遮挡的区域。
  • 把这些区域沿相机轨迹逐帧累积成遮挡 mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补。
效果:错误纹理不再误导扩散模型,条件图里只剩可靠几何 + 明确的待补区域。

💡 穿帮二:背面漏光法向过滤 专治

  • 点云没有"面"的概念,不会自动遮挡。相机绕到物体背后,正面的点直接透过来——相当于隔着后脑勺看到了脸
  • 解法:给每个点估计法向量,和视线方向算个夹角;背对相机的点,直接踢出渲染。
效果:条件图里的错误几何信号清零,扩散模型不再被带偏出结构扭曲和伪影。

04双流条件注入:一个管构图,一个管上色

几何理顺了,还剩第二个矛盾:点云渲染图"位置对,但内容缺";源视频"内容全,但位置不对"。怎么让生成结果既贴合目标视角,又和原视频长得一模一样?

几何流(管构图)

点云渲染图 + mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上。

外观流(管上色)

源视频走新设计的 Ref-DiT 模块——新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里"翻素材",哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。

05从单目到 4D:一条龙打通

既然能任意换机位,那多换几个机位,单目视频不就变成多视角视频了?多视角视频一到手,4D 重建(动态 3DGS)就从"不可能任务"变成常规操作。

这里有个巧思。常规生成式方法的相机是"边走边拍",空间变换和时间推进耦合在一起,视角在 4D 空间里分布极不均匀。UniWorld-View 直接把两者解耦,分两步走:

先拍定妆照绕场生成一圈静态环绕视图当整个场景的外观锚点
再开机拍动态固定机位生成同步多视角视频第一帧用定妆照对齐4DGS 优化

最终,单目随手拍 → 可自由视角漫游的 4D 场景,一条龙打通。前景的自遮挡靠迭代生成逐步补全。

编辑视角 · 诚实提示

本篇报道源自企业通稿性质的信息发布,WorldScore 榜单的完整评分明细与各模型精确分值未见第三方独立复测,排位以报道披露为准。读者可带着"单方披露"的背景理解此次登顶——技术路线(遮挡感知渲染 + 双流注入)的工程逻辑是自洽且可复现的,但"榜首"的具体含金量需以官方开源仓库的实测数据为最终依据。

当世界模型的竞争从"谁敢画"进入"谁懂三维",胜负手已从参数规模转向几何先验与生成模型的工程协同——这条路线将决定空间智能能否真正落地到机器人与具身智能。

现在就能复现

UniWorld-View 代码与权重已全部开源,训练数据来自北大系初创企业元空智能,并已适配国产昇腾算力。

GitHub 仓库 → PKU-YuanGroup/UniWorld-View