国产世界模型登顶李飞飞 WorldScore,单图生成任意视角视频
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶斯坦福李飞飞团队 WorldScore 榜单。给它一张图或一段随手拍的视频,它能还你一段"相机轨迹任你指定"的新视角视频——推、拉、摇、移,甚至绕场景 360° 转一圈,代码与权重已全部开源,并已适配国产昇腾算力。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶斯坦福李飞飞团队 WorldScore 榜单。给它一张图或一段随手拍的视频,它能还你一段"相机轨迹任你指定"的新视角视频——推、拉、摇、移,甚至绕场景 360° 转一圈,代码与权重已全部开源,并已适配国产昇腾算力。
注:WorldScore 官方未公开各模型精确分值,上表按报道披露的相对排位示意;柱形长度仅作直观对照,非真实分差。UniWorld-View 以"遮挡感知点云渲染 + 双流条件注入"的技术组合拿下榜首。
WorldScore 由斯坦福李飞飞团队推出,专门评测世界模型在空间理解与生成上的能力。它衡量的不是"模型会不会画",而是"模型懂不懂得这个世界的三维结构"。
新视角合成(Novel View Synthesis)是其中最硬核的子任务之一——本质是让 AI"脑补"没拍到的角度。难点全在"大基线"三个字上:只给 AI 看正脸,让它画出侧脸,甚至后脑勺。
看得越多建得越好。可随手拍的单目视频视角覆盖约等于零,喂进去轻则空洞伪影满天飞,重则直接摆烂。
敢画,但把相机位姿当"口头指令"塞进模型,没有显式 3D 建模,走两步就飘,转大角度直接失控。
先用几何模型撑成 3D 点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。几何归几何,生成归生成。
ViewCrafter、英伟达 GEN3C 走的也是第三条路,但 UniWorld-View 在这条路线上填了一个大家都踩过、却没人认真处理的坑。
第三条路上藏着一个共同的坑:点云渲染会穿帮。点云是一堆孤立的点,既不知道谁跟谁相连,也不知道哪面朝外。视角一转大,两种经典穿帮就来了。
几何理顺了,还剩第二个矛盾:点云渲染图"位置对,但内容缺";源视频"内容全,但位置不对"。怎么让生成结果既贴合目标视角,又和原视频长得一模一样?
点云渲染图 + mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上。
源视频走新设计的 Ref-DiT 模块——新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里"翻素材",哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。
既然能任意换机位,那多换几个机位,单目视频不就变成多视角视频了?多视角视频一到手,4D 重建(动态 3DGS)就从"不可能任务"变成常规操作。
这里有个巧思。常规生成式方法的相机是"边走边拍",空间变换和时间推进耦合在一起,视角在 4D 空间里分布极不均匀。UniWorld-View 直接把两者解耦,分两步走:
最终,单目随手拍 → 可自由视角漫游的 4D 场景,一条龙打通。前景的自遮挡靠迭代生成逐步补全。
本篇报道源自企业通稿性质的信息发布,WorldScore 榜单的完整评分明细与各模型精确分值未见第三方独立复测,排位以报道披露为准。读者可带着"单方披露"的背景理解此次登顶——技术路线(遮挡感知渲染 + 双流注入)的工程逻辑是自洽且可复现的,但"榜首"的具体含金量需以官方开源仓库的实测数据为最终依据。
当世界模型的竞争从"谁敢画"进入"谁懂三维",胜负手已从参数规模转向几何先验与生成模型的工程协同——这条路线将决定空间智能能否真正落地到机器人与具身智能。
UniWorld-View 代码与权重已全部开源,训练数据来自北大系初创企业元空智能,并已适配国产昇腾算力。
GitHub 仓库 → PKU-YuanGroup/UniWorld-View