阿里推Qwen-UI-Agent:27B参数、百台真机训练的GUI智能体,六大基准测试五项第一

阿里通过真机环境训练和自动化数据飞轮,首次让GUI智能体在真实设备上达到接近人类的执行成功率,但模型能力迈向落地仍需解决生态适配与产品形态问题。

★★★★★ 5/6 第一 Qwen-UI-Agent · 27B
6大核心GUI基准测试 · 真实设备评测集
Qwen-UI-Agent
92.2%
GPT-5.6 Sol
Claude Opus 4.8
字节Seed 2.1 Pro
MobileWorld-Real 真实设备评测集 92.2% 成功率 AndroidDaily 日常任务集 97.5% 100+ 真机 · 150+ 应用训练环境

行业背景:GUI智能体的 sim-to-real gap 与生态挑战

当前大多数GUI智能体困在模拟器环境,一旦放到真实手机,面对变化的界面、弹窗广告、登录过期、网络抖动,性能大幅下跌。中国市场的超级应用功能深、入口杂、弹窗多,加剧了仿真与现实的鸿沟。
传统 GUI 智能体
模拟器训练 · 单App被动问答 · 人工依赖数据
Qwen-UI-Agent
100+真机训练 · 跨端跨App主动感知 · AI自动合成+验证
阿里认为,下一代GUI基座模型必须同时解决三大矛盾:模拟与真实的矛盾、单点能力与完整工作流的矛盾、人工驱动与规模化的矛盾。
— 阿里研究团队 · 技术报告引言

技术架构:真机训练、统一动作空间与数据飞轮

Qwen-UI-Agent构建了四层框架:真机训练环境、统一动作空间、智能体驱动的数据飞轮、Harness主动服务层。
并发效率提升
约20×
通过虚拟屏幕技术,单台手机同时运行多个应用会话
RL训练效果
+7% 成功率
推理token减少21.3%,实际执行步骤增加8.4%
统一动作空间 将GUI操作、CLI命令(如bash脚本)和API调用纳入同一体系。在OSWorld桌面任务中,CLI动作占比超过40%,批处理动作占比约40%,单次推理可输出多个连贯操作,减少交互轮次。
三阶段训练流程: SFT建立基础能力 → Action RL纠正定位错误、重复循环等动作失误 → Online RL在100步以上长程轨迹中优化端到端成功率,同时调度近万个并发环境加速rollout。
+7%
成功率提升
-21.3%
推理token减少
+14.7%
验证动作轨迹比例
失败原因分布: 52%来自真实世界干扰(弹窗广告、UI误读、物理控件滑不准),40%来自执行能力缺陷(找不到深层入口、重复点击、遗忘进度)——验证了真机训练的必要性。

应用场景与跨端能力

移动端 · 生活决策
模拟点击打开地图查找咖啡馆,并到社交媒体搜索评价辅助决策。
PC端 · 批量作业
执行CLI动作,批量输出多个操作,完成跨网站调研、比价等任务。
深度搜索 · 数据联动
GUI负责网页检索与数据源定位,CLI负责数据下载与分析,协同完成复杂查询。
跨端工作流 · 主动服务
手机电脑跨端执行、PPT报告生成,主动关注设备通知,提供推荐和方案。
面对违法或高风险请求,模型会直接拒绝并终止任务;面对支付、数据删除等敏感场景,则在关键步骤主动停手,向用户说明情况,待确认后继续。
— 阿里安全设计 · 技术报告安全章节

行业竞争与未来展望

GUI智能体已成为国内字节、阶跃等AI玩家探索方向。阿里此前曾发布MAI-UI研究成果,此次新成果或意味着持续投入。
后续方向 高效执行 · 合成环境 · Harness优化 技术报告披露:未来计划探索更高效GUI执行与更好Harness优化长程能力;更可扩展的高保真合成环境也在构建中,但尚未整合到训练中。
模型能力只是第一步。Qwen-UI-Agent未来会以何种形态落地到真实世界的设备之上,是值得关注的关键命题。
— 智东西 · 结语