🤖 智能体 · 模型发布

Qwen-UI-Agent 跨 App 长任务成功率 97.5%:阿里把手机 Agent「拆」成可下载的模型

阿里通义实验室发布 Qwen-UI-Agent,在自建移动端评测中最高达 97.5% 成功率。它把豆包手机曾展示的跨 App 操作能力,从一台工程机里拆解为一套可训练、可评测、可部署的独立模型——手机 Agent 从产品回归模型

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Qwen-UI-Agent #AI Agent #阿里通义千问 #MAI-UI #移动端智能体
🥇 97.5% AndroidDaily 最佳成绩
82.1% MobileWorld 综合成功率
79.5% OSWorld-Verified 桌面级任务

⚡ 30 秒速览

  • 核心成绩:Qwen-UI-Agent 在 AndroidDaily 上达 97.5%,MobileWorld 达 82.1%,OSWorld-Verified 达 79.5%,覆盖移动端与桌面端真实任务。
  • 关键能力:跨 App 长任务(抖音搜索菜谱 → 盒马采购)、跨设备执行(手机 + 电脑)、支持 GUI + 命令行 + API 三种动作空间。
  • 开源策略:前身 MAI-UI 已开源 2B / 8B 两档权重(Apache 2.0),旗舰 32B / 235B 及最新 Qwen-UI-Agent 权重暂未开放——小杯引流,大杯变现
  • 诚实一面:论文公开了 失败案例——朴朴超市选品失误、朋友圈权限未设置成功。长任务中一次误判可能滚成连锁失败。

01移动端与桌面端四维评测 自建场景 + 公开基准

Qwen-UI-Agent 在四个评测集上提交了成绩,覆盖移动端真实 App 操作、桌面端文件处理与跨设备协同:

97.5% AndroidDaily
92.2% MobileWorld-Real
82.1% MobileWorld
79.5% OSWorld-Verified

注:四个评测集均为阿里自建或参与维护的环境,部分竞品成绩为团队复跑,非各厂商在同一公开测试中的官方提交。AndroidDaily 侧重日常高频 App 操作,OSWorld-Verified 侧重桌面端文件与代码任务。

此外,前代 MAI-UI-235BAndroidWorld 上取得 76.7%,高于 UI-TARS-2 的 73.3%。纵向对比看,新一代在自建场景上提升明显,但基准环境差异也意味着分数不宜直接跨榜比较。

02它到底能做什么?一个成功,两个失败

论文中最引人注目的演示,是一条跨越两个 App 的采购指令。但更值得看的,是那些没做好的任务。

🛒 抖音 → 盒马:跨 App 长任务一次跑通 成功案例

  • 指令:「在抖音搜索『百香果酸汤牛肉』收藏量最高的图文,记下配料;然后跳进盒马,把调料之外的食材加入购物车,预约当天 18:45 送达。」
  • 执行:Agent 自主打开抖音,搜索、识别收藏量最高的图文,提取配料清单;切换至盒马,逐项匹配商品,跳过调料类目,完成加购并设置配送时段。
  • 意义:跨 App 状态保持、目标拆解与多步决策链条完整跑通,是当前国产模型在系统级 Agent 任务上的标杆演示。
评分维度:任务拆解 / 跨 App 切换 / 信息提取 / 执行准确 —— 全部完成。

🧺 朴朴超市:10 元以下商品筛选失败 模型失误

  • 指令:在朴朴超市直播间把 10 元以下的在售商品加入购物车,再收藏最贵的商品。
  • 结果:模型反复点开面包、榴莲和抹茶蛋糕,始终没有完成筛选条件,最终未能正确执行。
  • 症结:对价格数字的视觉识别 + 条件判断出现偏差,导致执行路径陷入循环。
论文标记为 MODEL FAILURE,属于典型的「视觉理解 + 逻辑判断」双重失误。

🔒 朋友圈权限:发了内容,却忘了改权限 模型失误

  • 指令:发一条朋友圈,然后将可见范围改为「仅自己可见」。
  • 结果:朋友圈成功发出,但权限设置步骤始终没有完成,内容对所有人可见。
  • 症结:长任务中后段步骤容易被「遗忘」——先发再改权限的顺序执行中,权限修改被遗漏。
论文标记为 MODEL FAILURE。发帖 + 改权限这类「先执行、再回收」的任务,对 Agent 的步骤记忆构成挑战。

两个失败案例比任何高分都更真实。任务越长,前面一次小误判越容易滚成后面的彻底失败;而发帖、付款和改权限,恰好是用户最不希望 AI 犯错的地方。

03从 MAI-UI 到 Qwen-UI-Agent:把手机 Agent 拆成模型

2025 年 12 月,阿里通义实验室发布 MAI-UI,开放 2B、8B 两档权重。当时它做的事情和豆包很像:接收屏幕信息,决定点击、滑动还是输入,执行后观察新页面,判断任务是否偏航。

区别在于封装方式。豆包把这套循环装进系统权限,做成产品;阿里先把循环拆成了可以下载、训练和部署的模型。

Qwen-UI-Agent 又往前走了一步。

团队搭建了 100 多台真机、150 多个 App 组成的运行环境,约一万个模拟环境并发生成训练轨迹,用在线强化学习处理超过 100 步的长任务。动作空间也不止点击屏幕:遇到文件、表格和数据处理,模型可以切到命令行;几个连续操作还能在一次输出里一起生成。

接收指令理解屏幕选择动作 (GUI / CLI / API)执行并观察验证结果

这套架构把「手机替人点 App」扩成了 跨设备的执行系统:该点屏幕时点屏幕,该走接口时走接口,需要处理文件时就去命令行。GUI 不再是唯一的道路,但模型知道什么时候该走哪条路。

技术细节:训练数据来自真机录屏 + 自动化标注,采用在线强化学习(Online RL)处理长任务信用分配问题。论文中未披露模型参数量与训练算力消耗。

04三条路线,一个赛点 谁站在手机和用户之间?

Qwen-UI-Agent 的发布,让手机 Agent 的竞争格局从「一家独秀」变成了「三方角力」。模型公司、手机厂商、超级 App 都想成为那个跨品牌的中间层,但三方的筹码与短板各不相同。

🧩

阿里:开源引流,大杯变现

MAI-UI 的 2B/8B 权重已开源(Apache 2.0),供开发者试错与适配;旗舰权重保留在云端,通过无影云手机等产品按实例收费。小杯降低门槛,大杯留住客户

开源策略
📱

字节:产品先行,踩坑换经验

豆包手机是第一个把系统级 Agent 塞进量产机的产品,但也撞上了超级 App 的风控墙——银行、支付类操作被限制,部分游戏被禁用。新一代转向 MCP 协议,让 App 主动开放权限。

产品路线
⚙️

手机厂商:第三方参照,筹码增加

过去不想从零训练 GUI Agent 的厂商,只能和字节合作。现在有了 MAI-UI 做原型,可以自己积累数据、适配系统,再决定更强能力向谁采购。独占性被稀释,谈判空间变大

技术参照

一个诚实的注脚:MAI-UI 的 2B/8B 权重还远远不等于一台豆包手机。模型之外,还要解决系统权限、真机数据、App 适配、安全策略和售后责任。但用户的选择已经变了——手机厂商有了第二个技术参照,阿里要的,就是这份独占性的稀释。

编辑核心判断

Agent 时代,把能力「拆成模型」和「装进手机」是两种完全不同的竞争逻辑。阿里选择了前者——用开源降低门槛,用云端锁定价值。这条路不会立刻取代豆包,但它让手机厂商多了一个选择,也让「AI 控制手机」这件事不再只由一家公司定义。

技术报告与项目页面已公开

Qwen-UI-Agent 技术报告、项目演示及 MAI-UI 开源权重均已发布,可查阅论文与 GitHub 仓库获取完整评测流程与训练细节。

Qwen-UI-Agent 项目页

注:旗舰模型权重暂未开放,MAI-UI 2B/8B 权重可下载