ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026

大模型脆弱性 Sim-to-Real IJCAI 2026 演讲深度报道
核心论点:大模型智能体面临的脆弱性与多语言泛化难题,本质上是传统强化学习中的“仿真到现实”差距,可通过域随机化、不确定性量化及人类在环的协同机制弥合。

1引言:从交通信号到多语言——Sim-to-Real问题的普遍性

基础模型智能体在英文语境表现完美,切换到中文或低资源语言时错误率断崖上升,这种“智力降级”并非大模型时代的新问题,而是与强化学习在物理世界中遭遇的“仿真到现实”差距同源。
同一困境 · 两种面孔
大模型智能体
英文语境表现完美 训练数据以英语为主
中文断崖式下降 低资源语言错误率飙升
传统强化学习
模拟器表现完美 绿波优化超越传统解法
真实路网决策崩溃 雨天通行量骤降
同一底层差距 Sim-to-Real 鸿沟
今天大模型智能体所面临的脆弱性,本质上与传统强化学习在物理世界中遭遇的‘仿真到现实(Sim-to-Real)’差距如出一辙。
—— 魏华,亚利桑那州立大学助理教授

2传统强化学习中的Sim-to-Real差距:以交通信号控制为例

2017年起,魏华团队通过KDD论文证明强化学习能复现并超越传统“绿波”优化解,但将完美算法部署到杭州真实路网时,天气、摄像头视角、奖励函数偏差导致决策瞬间崩溃。
动态差距示例 模拟器假设 > 真实通行量下降
在模拟器中,变绿灯后所有车辆顺利通过;但在真实雨天或雾天,相同绿灯时长下仅有两辆车通过,剩余车辆被堵在路口。
来自AAAI 2024研究[4]
魏华团队将Sim-to-Real差距系统性拆解为五个子维度:
观察差距 传感器在雾天/夜间画面退化[5]
状态差距 模拟器与真实世界的状态表征差异
动作差距 相同动作在不同环境中效果不同
动态差距 相同状态/动作导致不同下一个状态(如雨雪天)
奖励差距 模拟器仅优化通行时间,真实世界需考虑行人安全

3大模型智能体中的Sim-to-Real差距:多语言作为观察差距的实例

大模型的多语言泛化难题本质上是一个标准的“仿真到现实”问题:训练数据以英语为主(模拟器),测试环境是其他语言(真实世界),对应观察差距。
如果把每种语言看作一种‘模态’,模型的训练数据主要是一种模态(英语语境,相当于‘模拟器’),而它的测试环境是另一种模态(其他语言,相当于‘复杂的真实世界’)。这就完美对应了我们刚才提到的‘观察差距’。
—— 魏华,亚利桑那州立大学助理教授
统一框架证据 KDD 2026论文[6]
在KDD 2026论文[6]中,魏华团队正式提出基础模型智能体的可靠性问题可从统一MDP视角理解,与强化学习Sim-to-Real共享底层结构。
论文标题:The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

4解决方案:域随机化——从机器人领域“平移”的抗干扰哲学

机器人领域成熟的“域随机化”技术可直接引入大模型智能体:在训练时对输入文本、提示词、动作和奖励空间进行随机化扰动,提升跨环境鲁棒性。
实验结果 3B模型 > 32B模型
经过域随机化处理后,一个仅30亿参数的小模型应对跨环境差距的表现几乎完美,甚至击败了规模大十倍的320亿参数模型[7,8]。
来自arXiv论文[7]和AndroidReality基准[8]
机器人领域历经检验的‘抗干扰’哲学,在今天的大模型智能体时代依然是大杀器。
—— 魏华,亚利桑那州立大学助理教授

5终极防线:不确定性量化与人类在环

面对未知的真实世界,我们可能永远无法完美弥合虚实鸿沟,因此必须让机器知道自己“何时不知道”,并精准地向人类求助,避免人类监督负担随智能体规模指数增长。
不确定性量化层级 四级框架
魏华团队为大模型定义了四个层级的不确定性量化[9]:
来自KDD 2025调查论文[9]
四个层级的具体含义:
1 答案本身是否值得信任?
2 模型的推理逻辑是否脆弱?
3 能否精确定位是哪一步推理犯错?
4 该智能体的认知是否与其他模型/系统对齐?
机器必须知道自己‘什么时候不确定’,知道何时该自主决断,何时必须呼叫人类支援,在关键时刻将决策权交给人类。
—— 魏华,亚利桑那州立大学助理教授

6总结与展望:建立共通评估标准,迈向可靠智能体

“仿真到现实”差距广泛存在于机器人学、强化学习、真实世界决策及基础模型智能体中,呼吁相关领域学者建立一套共通的底层词汇与评估标准,共享技术方案。
智能体可以无限制地扩大规模、接管更多的任务,但人类的监督负担绝不能随之呈指数级加重。让机器学会在不确定时求助,把最关键的问题留给人类,才是AI走向真实世界的最优解。
—— 魏华,亚利桑那州立大学助理教授
综合公开信息整理