🔬 前沿 · 具身智能新范式

清华教授提出具身智能破局新路线:物理原生智能直指万亿参数训练困境

WAIC 现场传来新思路。清华大学李升波教授提出「物理原生智能」(Phi)概念,主张将物理规律的硬约束直接嵌入世界模型与训练算法,以破解具身智能在数据极度稀缺、安全要求严苛场景下的泛化难题——而非单纯依赖参数堆砌。

来源:公开演讲 WAIC 2024 全文约 3 分钟读完
#具身智能 #物理原生智能 #世界模型 #清华大学
10倍+ 机器人训练难度相较自动驾驶
万亿 通用机器人所需网络参数
千亿 所需交互片段数据量

注:以上参数与数据量级为李升波教授在演讲中给出的工程估算,用于对比自动驾驶(百亿级参数/亿级片段)与机器人的开发难度差异。

⚡ 30 秒速览

  • 核心问题:沿用视觉/语言大模型「堆参数+堆数据」的端到端路线开发机器人,在工程上已被证明不具有可行性。
  • 破局思路:提出「物理原生智能」(Phi),从世界模型、数据结构、训练算法三维度嵌入物理规律约束。
  • 三大特征:状态解耦(显式物理+隐式神经网络)、时序因果(原因先于结果)、训练嵌入底层物理规律(对称守恒与辛几何)。
  • 配套平台:清华团队已开源通用训练平台 GOPS,内嵌 8 套核心算法,覆盖安全强化学习与状态估计。
  • 深层信号:具身智能的竞争正从「大力出奇迹」转向「物理规律+系统工程的精雕细琢」。

01为什么旧路线走不通了?

李升波指出,具身智能的终极目标是通用化——智能体影响物理实体越多,通用性越强。但这条路的开发难度远超视觉与语言领域。他以自动驾驶与机器人的对比给出量化坐标:

自动驾驶(首个量产具身智能)

约需百亿级网络参数、亿级驾驶片段。至今智能性远未达人类水平,功能仍限于 L2 级辅助。

通用机器人(当前攻坚重点)

自由度更高、场景更复杂,约需万亿级参数、千亿级交互片段,训练难度至少是汽车的 10 倍以上。

"若仍然沿用现有的视觉、语言、多模态大模型训练思路,我们能否达到通用化的目标呢?答案是显而易见的,不具有可行性。"李升波在演讲中直言。

他的破局点受 McCarthy、Pearl、Hopfield 等先驱思想启发,主张将因果关系、物理系统集体属性嵌入智能开发范式,由此提出「物理原生智能」(Physics-native Intelligence, 简称 Phi)。

02物理原生智能的三大特征

Phi 仍以数据驱动的端到端模型为基本架构,但从三个维度深入考虑物理实体的客观要求:

特征一

状态解耦表征

系统状态由两部分构成:显状态服从物理动力学约束,长期稳定;隐状态由神经网络驱动,长期推演不漂移。

特征二

时序与因果性

时序优先,原因先于结果,状态预测不得依赖未来信息;改变动作输入,后续状态应产生可解释差异;关注负样本信息收益。

特征三

物理规律规范化

对称守恒:由对称性决定的物理量应守恒;结构保持:训练动力学应保持几何结构与能量收支规律。

03怎么做到:世界模型与数据结构

世界模型是 Phi 的核心。现有路线(朴素世界模型、世界动作模型、受控世界模型)在长程化、精细化动作输出及与强化学习匹配度上均不理想。Phi 的解法是:

观测输入编码器映射状态策略/评价模块直接关联状态

关键在于,策略与评价模块直接与状态关联而非观测——结构化信息输入有利于提升动作准确性、功能安全性与可解释性。

数据层面,Phi 提出物理原生数据三要素,可用于重构互联网视频、Ego/UMI 数据、真机操作与仿真合成数据:

转移特性支撑编码/解码/受控转移模块
奖励信号 r支撑强化学习评价模块
经验知识 K嵌入大模型评价能力

04训练算法的三项硬要求

将数据注入模型,算法必须满足三项客观需求:

① 嵌入训练动力学的底层规律

神经网络训练本质是动力学系统的离散状态演化。将广义能量守恒、辛几何结构保持等性质强制嵌入算法,可极大提升训练稳定性。

② 绝对安全保障能力

真机训练每一代模型都须满足安全硬约束——"学习驾驶过程中也要保证安全"。需同时训练最优策略及其可行区域,通过博弈机制在可行域扩展与认知不确定性间达成均衡。

③ 抗遗忘机制

具身智能数据稀少、场景繁多,只能多阶段分步实施。关键在于构建抗遗忘条件与梯度正交机制,让后续训练不覆盖先前性能。

基于此,训练范式建议分三阶段阶梯推进,而非指望一蹴而就:

监督学习预训练强化学习后训练强化学习真机微调

05已落地:清华 GOPS 平台与内嵌算法

过去十年,清华大学研究组围绕 Phi 框架自主研发了通用训练平台 GOPS(General Optimal Control Problem Solver),形成从任务定义到端侧部署的全流程闭环。平台内嵌 8 套物理原生算法,覆盖强化学习、安全训练、状态估计等关键环节:

DSAC 连续值分布建模

缓解策略高估问题,提升中小规模强化学习稳定性。

RAD 辛结构守恒优化器

将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡。

LipsNet 李普希兹约束

结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡。

RACS 安全强化学习

构建三元迭代框架,通过可行域内外差异化更新,实现安全区域单调扩展与策略收敛。

DACER 反向扩散模型

将反向扩散模型嵌入在线策略迭代,支持多模态动作生成并缓解策略分叉难题。

注:GOPS 平台还内嵌 BOOM(世界模型强化学习)、NANO(非线性高斯滤波状态估计)、MVP(瞬时速度约束生成式策略)三套算法,受篇幅所限未全数展开。

编辑视角

本文内容源自学者在行业大会上的公开演讲,属单方披露的前沿学术观点,目前未见第三方机构对 GOPS 平台及各算法效果进行独立复测验证。文中提及的"万亿参数/千亿片段"为工程估算,读者宜将其视为问题规模量级的说明,而非精确基准。

此外,演讲中提及的"物理原生智能"概念,带有明显的学术倡导色彩,其技术路线与当前工业界主流的端到端大模型路线存在路径分歧,短期内尚难判定孰优孰劣。

当具身智能的参数竞赛触及物理世界的硬约束时,谁能率先把因果律与守恒律转化为可工程化的训练框架,谁就能掌握下一代通用机器人的技术定义权。

深入了解与获取

GOPS 平台及相关核心算法已由清华大学研究组开源,可通过以下地址获取代码与文档。

github.com/thu-rll-ecsafe/GOPS → 开源仓库