Qwen-UI-Agent 跨 App 长任务成功率 97.5%:阿里把手机 Agent「拆」成可下载的模型
阿里通义实验室发布 Qwen-UI-Agent,在自建移动端评测中最高达 97.5% 成功率。它把豆包手机曾展示的跨 App 操作能力,从一台工程机里拆解为一套可训练、可评测、可部署的独立模型——手机 Agent 从产品回归模型。
阿里通义实验室发布 Qwen-UI-Agent,在自建移动端评测中最高达 97.5% 成功率。它把豆包手机曾展示的跨 App 操作能力,从一台工程机里拆解为一套可训练、可评测、可部署的独立模型——手机 Agent 从产品回归模型。
Qwen-UI-Agent 在四个评测集上提交了成绩,覆盖移动端真实 App 操作、桌面端文件处理与跨设备协同:
注:四个评测集均为阿里自建或参与维护的环境,部分竞品成绩为团队复跑,非各厂商在同一公开测试中的官方提交。AndroidDaily 侧重日常高频 App 操作,OSWorld-Verified 侧重桌面端文件与代码任务。
此外,前代 MAI-UI-235B 在 AndroidWorld 上取得 76.7%,高于 UI-TARS-2 的 73.3%。纵向对比看,新一代在自建场景上提升明显,但基准环境差异也意味着分数不宜直接跨榜比较。
论文中最引人注目的演示,是一条跨越两个 App 的采购指令。但更值得看的,是那些没做好的任务。
两个失败案例比任何高分都更真实。任务越长,前面一次小误判越容易滚成后面的彻底失败;而发帖、付款和改权限,恰好是用户最不希望 AI 犯错的地方。
2025 年 12 月,阿里通义实验室发布 MAI-UI,开放 2B、8B 两档权重。当时它做的事情和豆包很像:接收屏幕信息,决定点击、滑动还是输入,执行后观察新页面,判断任务是否偏航。
区别在于封装方式。豆包把这套循环装进系统权限,做成产品;阿里先把循环拆成了可以下载、训练和部署的模型。
Qwen-UI-Agent 又往前走了一步。
团队搭建了 100 多台真机、150 多个 App 组成的运行环境,约一万个模拟环境并发生成训练轨迹,用在线强化学习处理超过 100 步的长任务。动作空间也不止点击屏幕:遇到文件、表格和数据处理,模型可以切到命令行;几个连续操作还能在一次输出里一起生成。
这套架构把「手机替人点 App」扩成了 跨设备的执行系统:该点屏幕时点屏幕,该走接口时走接口,需要处理文件时就去命令行。GUI 不再是唯一的道路,但模型知道什么时候该走哪条路。
技术细节:训练数据来自真机录屏 + 自动化标注,采用在线强化学习(Online RL)处理长任务信用分配问题。论文中未披露模型参数量与训练算力消耗。
Qwen-UI-Agent 的发布,让手机 Agent 的竞争格局从「一家独秀」变成了「三方角力」。模型公司、手机厂商、超级 App 都想成为那个跨品牌的中间层,但三方的筹码与短板各不相同。
MAI-UI 的 2B/8B 权重已开源(Apache 2.0),供开发者试错与适配;旗舰权重保留在云端,通过无影云手机等产品按实例收费。小杯降低门槛,大杯留住客户。
开源策略豆包手机是第一个把系统级 Agent 塞进量产机的产品,但也撞上了超级 App 的风控墙——银行、支付类操作被限制,部分游戏被禁用。新一代转向 MCP 协议,让 App 主动开放权限。
产品路线过去不想从零训练 GUI Agent 的厂商,只能和字节合作。现在有了 MAI-UI 做原型,可以自己积累数据、适配系统,再决定更强能力向谁采购。独占性被稀释,谈判空间变大。
技术参照一个诚实的注脚:MAI-UI 的 2B/8B 权重还远远不等于一台豆包手机。模型之外,还要解决系统权限、真机数据、App 适配、安全策略和售后责任。但用户的选择已经变了——手机厂商有了第二个技术参照,阿里要的,就是这份独占性的稀释。
Agent 时代,把能力「拆成模型」和「装进手机」是两种完全不同的竞争逻辑。阿里选择了前者——用开源降低门槛,用云端锁定价值。这条路不会立刻取代豆包,但它让手机厂商多了一个选择,也让「AI 控制手机」这件事不再只由一家公司定义。
Qwen-UI-Agent 技术报告、项目演示及 MAI-UI 开源权重均已发布,可查阅论文与 GitHub 仓库获取完整评测流程与训练细节。
Qwen-UI-Agent 项目页 →注:旗舰模型权重暂未开放,MAI-UI 2B/8B 权重可下载