昆仑行昆仑世界模型GeWu斩获WorldArena 2.0图像质量冠军(69.58分)、综合亚军(65.91分):三塔因果架构成赛道最大变量

昆仑世界模型GeWu以「物理因果」作为架构设计的第一性原理,通过目的-干预-响应三塔因果注意力架构,在WorldArena 2.0 Track 1中拿下图像质量单项冠军与全球综合亚军,验证了按因果角色而非模态拆分的具身世界模型新路线正在成为行业变量。

权威榜单上的首秀即领先

★ 冠军徽记
69.58
图像质量 · 单项冠军
65.91 综合得分 · 全球亚军
82.40 交互质量 · 物理合理性核心维度
昆仑行是本次77支参赛模型中唯一一个在6大评测维度中获得4项前4名次的团队,综合能力均衡性断层领先,并非单项突进。
77支参赛模型

世界模型赛道的路线分野

业内已逐渐形成共识:优秀的具身机器人大脑不能只模拟动作,关键在于理解真实物理世界,严格遵循物理因果关系。

行业主流
渲染优先
视觉逼真
后期补物理
→ 路线分岔点 ←
WorldArena
国际权威基准
昆仑行
模拟优先
物理因果
架构原生
渲染:生成画面 模拟:预测状态 规划:推演动作
昆仑行的判断:模拟是世界模型最关键的能力,掌握模拟才可能具备规划能力;因此模型不能局限于渲染视觉上真实但物理上不可靠的视频。

这一判断将「物理因果」从评估指标拉升为架构设计原则,与当前行业中「先追视觉逼真、再补物理一致性」的补丁式路线形成鲜明对比。

按因果角色而非模态拆分

昆仑世界模型没有沿用业内主流的「文本归文本、视觉归视觉、动作归动作」的模态拆分方式,而是将视野放在因果关系上,按因果图中的角色语义拆分为三座参数独立的Transformer塔。

TOWER 1
Intent
目的
自回归编码语言指令与场景理解,确定「要做什么」
自回归
TOWER 2
Intervention
干预
flow matching建模动作序列,确定「怎么做」
flow matching
TOWER 3
Consequence
响应
flow matching生成未来视频帧,呈现「做了之后会发生什么」
flow matching
三座塔共享decoder基础结构,但每层拥有独立的投影矩阵、前馈网络和归一化参数——架构上的「参数独立」保证了因果角色不会被模态耦合稀释。

联合因果注意力的单向可见性约束

Tower 1 目的
✅ 可看
Tower 2 干预
✅ 可看
Tower 3 响应
Tower 2 不可看 Tower 3(红色断线)
消融实验退化警告
默写模式
切断任意一条注意力通路后,模型不再依据动作推演物理后果,而是将任务描述直接映射到训练集中最相似的视频片段,产生物体无对应动作却自行运动等违逆物理规律的画面。
「目的驱动行动,行动产生结果,这条因果链不仅是人类理解物理世界的基本框架,也应当成为模型架构的第一性原理。当归纳偏置对齐问题本质,我们看到了指标的提升,也看到了训练效率和泛化能力的同步改善。」
—— 郝志会博士 · 昆仑行机器人模型研发负责人

约束的深层含义:行动决策可以参考任务目的,但不能「偷看」尚未发生的视觉后果;视频渲染则需要同时知道「要做什么」和「怎么做」,才能生成物理因果上合理的画面。

仿生记忆采样策略

面对长时序视频生成,昆仑行采用Chunk-wise自回归方案将长视频分段生成,核心难点在于后续片段的上下文缺失——这是长视频生成普遍面临的根本性挑战。

近端帧 · 高密度 远端帧 · 稀疏采样
时间推进方向 →(绝对时序位置编码)
无记忆
▄▄▄▄──▄▄────▄▄────→ 物体消失/形变/噪点累积
有记忆
████████████████→ chunk间衔接流畅
仿生记忆采样策略模仿人类记忆衰减规律:近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留任务全局进度;配合绝对时序位置编码和帧率自适应放缩机制,准确感知物理时间位置并控制动作节奏。
物理因果·架构即原则
默写模式≠物理仿真

编辑判断:这篇报道的核心信息量集中在技术架构创新上。昆仑行没有跟随业内的模态拆分主流范式,而是用因果图角色语义重新定义了世界模型的架构边界——三塔之间的单向可见性约束是可验证、可消融的设计贡献。

尤其值得注意的是消融实验的退化方向:从「因果仿真」退化为「默写模式」,恰好揭示了当前具身世界模型的通病——视觉逼真但物理不可靠。

将这一技术选择放在更宏观的AI研究语境中,昆仑行的因果三塔路径与LeCun倡导的联合嵌入预测架构(JEPA)在精神上同频:都主张智能体应学习物理世界的结构性因果关系,而非仅拟合表面像素分布。

作为一篇技术路线宣言,它的论证闭环完整;但在更复杂的真实任务场景中,这套架构的规划与仿真强化能力仍待持续检验。

从渲染器到物理智能基座

行业主流
按模态拆分(文本/视觉/动作),各模态独立建模后融合,因果一致性依赖后期对齐
~~~~~
补丁式 · 路线尽头
昆仑行
按因果角色拆分(目的/干预/响应),以联合因果注意力的单向可见性从架构层面保证物理因果
━━━━━━━━▶
原生因果 · 延伸至画布外(物理智能基座)
借鉴UniDiffuser思想——「作为条件」与「作为生成目标」不过是同一去噪过程在不同噪声水平下的两端——通过调整各塔噪声参数,同一套架构和权重即可在世界模拟、策略推理、联合预测等多种模式间灵活切换,天然支持多任务统一推理。
作为第一代版本的初次亮相即实现全面领先,昆仑世界模型下一步将向更复杂任务场景扩展,并应用于行为规划与仿真强化,目标是推动世界模型从「视觉渲染器」进化为「物理智能基座」。
结语

昆仑世界模型GeWu在WorldArena 2.0 Track 1的亮相,含金量体现在两个层面:绝对成绩上,77支全球顶尖队伍中拿下图像质量冠军与综合亚军,且是唯一一个在6大维度中4项进入前4名的模型;架构叙事上,「目的—干预—响应」的三塔因果拆解配合消融实验验证的严格单向可见性,构成了站得住脚的第一性原理论证。

这是具身世界模型赛道一次值得关注的技术路线宣言——物理因果不是口头原则,而是被落实到了注意力机制的可见性约束中。

作为第一代版本,后续在复杂任务上的泛化表现与物理智能基座的实际落地效果,将是检验这套架构真正成色的下一站。