清华教授提出具身智能破局新路线:物理原生智能直指万亿参数训练困境
WAIC 现场传来新思路。清华大学李升波教授提出「物理原生智能」(Phi)概念,主张将物理规律的硬约束直接嵌入世界模型与训练算法,以破解具身智能在数据极度稀缺、安全要求严苛场景下的泛化难题——而非单纯依赖参数堆砌。
注:以上参数与数据量级为李升波教授在演讲中给出的工程估算,用于对比自动驾驶(百亿级参数/亿级片段)与机器人的开发难度差异。
WAIC 现场传来新思路。清华大学李升波教授提出「物理原生智能」(Phi)概念,主张将物理规律的硬约束直接嵌入世界模型与训练算法,以破解具身智能在数据极度稀缺、安全要求严苛场景下的泛化难题——而非单纯依赖参数堆砌。
注:以上参数与数据量级为李升波教授在演讲中给出的工程估算,用于对比自动驾驶(百亿级参数/亿级片段)与机器人的开发难度差异。
李升波指出,具身智能的终极目标是通用化——智能体影响物理实体越多,通用性越强。但这条路的开发难度远超视觉与语言领域。他以自动驾驶与机器人的对比给出量化坐标:
约需百亿级网络参数、亿级驾驶片段。至今智能性远未达人类水平,功能仍限于 L2 级辅助。
自由度更高、场景更复杂,约需万亿级参数、千亿级交互片段,训练难度至少是汽车的 10 倍以上。
"若仍然沿用现有的视觉、语言、多模态大模型训练思路,我们能否达到通用化的目标呢?答案是显而易见的,不具有可行性。"李升波在演讲中直言。
他的破局点受 McCarthy、Pearl、Hopfield 等先驱思想启发,主张将因果关系、物理系统集体属性嵌入智能开发范式,由此提出「物理原生智能」(Physics-native Intelligence, 简称 Phi)。
Phi 仍以数据驱动的端到端模型为基本架构,但从三个维度深入考虑物理实体的客观要求:
系统状态由两部分构成:显状态服从物理动力学约束,长期稳定;隐状态由神经网络驱动,长期推演不漂移。
时序优先,原因先于结果,状态预测不得依赖未来信息;改变动作输入,后续状态应产生可解释差异;关注负样本信息收益。
对称守恒:由对称性决定的物理量应守恒;结构保持:训练动力学应保持几何结构与能量收支规律。
世界模型是 Phi 的核心。现有路线(朴素世界模型、世界动作模型、受控世界模型)在长程化、精细化动作输出及与强化学习匹配度上均不理想。Phi 的解法是:
关键在于,策略与评价模块直接与状态关联而非观测——结构化信息输入有利于提升动作准确性、功能安全性与可解释性。
数据层面,Phi 提出物理原生数据三要素,可用于重构互联网视频、Ego/UMI 数据、真机操作与仿真合成数据:
将数据注入模型,算法必须满足三项客观需求:
神经网络训练本质是动力学系统的离散状态演化。将广义能量守恒、辛几何结构保持等性质强制嵌入算法,可极大提升训练稳定性。
真机训练每一代模型都须满足安全硬约束——"学习驾驶过程中也要保证安全"。需同时训练最优策略及其可行区域,通过博弈机制在可行域扩展与认知不确定性间达成均衡。
具身智能数据稀少、场景繁多,只能多阶段分步实施。关键在于构建抗遗忘条件与梯度正交机制,让后续训练不覆盖先前性能。
基于此,训练范式建议分三阶段阶梯推进,而非指望一蹴而就:
过去十年,清华大学研究组围绕 Phi 框架自主研发了通用训练平台 GOPS(General Optimal Control Problem Solver),形成从任务定义到端侧部署的全流程闭环。平台内嵌 8 套物理原生算法,覆盖强化学习、安全训练、状态估计等关键环节:
缓解策略高估问题,提升中小规模强化学习稳定性。
将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡。
结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡。
构建三元迭代框架,通过可行域内外差异化更新,实现安全区域单调扩展与策略收敛。
将反向扩散模型嵌入在线策略迭代,支持多模态动作生成并缓解策略分叉难题。
注:GOPS 平台还内嵌 BOOM(世界模型强化学习)、NANO(非线性高斯滤波状态估计)、MVP(瞬时速度约束生成式策略)三套算法,受篇幅所限未全数展开。
本文内容源自学者在行业大会上的公开演讲,属单方披露的前沿学术观点,目前未见第三方机构对 GOPS 平台及各算法效果进行独立复测验证。文中提及的"万亿参数/千亿片段"为工程估算,读者宜将其视为问题规模量级的说明,而非精确基准。
此外,演讲中提及的"物理原生智能"概念,带有明显的学术倡导色彩,其技术路线与当前工业界主流的端到端大模型路线存在路径分歧,短期内尚难判定孰优孰劣。
GOPS 平台及相关核心算法已由清华大学研究组开源,可通过以下地址获取代码与文档。
github.com/thu-rll-ecsafe/GOPS → 开源仓库