🏆 智能体 · 榜单速递

首个突破 90% 成功率的桌面操作智能体诞生,登顶 OSWorld 双榜

7 月 27 日,实在 Agent 以 90.2% 的总成功率、325.59 分总成绩包揽 OSWorld 总榜与 Agentic Framework 分榜双冠,成为业内首个将 Computer-Use Agent 成功率推过 90% 关口的产品,刷新全球公开评测最高纪录。

来源:公开报道 2026-07-27 全文约 3 分钟读完
#实在Agent #OSWorld #Computer-Use #智能体评测
90.2% 总成功率,首个突破 90% 关口
325.59 总成绩,双榜排名第一
361 实战任务数,全场景考核

⚡ 30 秒速览

  • 赢了多少:以 90.2% 成功率、325.59 分包揽 OSWorld 总榜与 Agentic Framework 分榜双冠,打破行业存在的技术瓶颈。
  • 榜单硬在哪:基于 Ubuntu 真实操作系统,361 项全场景实战任务,全程机器无主观评分,考核长链路规划与多软件协同。
  • 怎么做到的:不靠堆模型参数,靠 8 年打磨的 Harness 工程体系,相同底座可带来 6-10 个百分点提升。
  • 下一步去哪:目标通过人机协同熔断机制,将可靠性从 90.2% 提升至工业级 99.99%。

01两年迭代曲线 从 12.2% 到突破 90%

复盘行业两年迭代曲线,全球计算机使用智能体完成了指数级进化。实在 Agent 此次 90.2% 的突破,打破了行业长期存在的技术瓶颈:

2024 年

12.2% 基础成功率,行业起步阶段

2025 年

72.6% 成功率,首次超越人类基线

2026 年 5 月

83.6% 行业高点,技术迭代速度持续攀升

2026 年 7 月

90.2% 实在 Agent 打破技术瓶颈,登顶双榜

02OSWorld:测的是最难作假的能力

对于开发者而言,OSWorld 是衡量智能体实景落地能力的黄金标尺。自 2024 年上线以来,GPT、Gemini、Claude 等旗舰模型均以该榜单数据为核心佐证。它与轻量化基准的区别非常直接:

传统轻量化基准

仅能模拟简单网页交互,脱离真实复杂环境。

OSWorld 实战基准

基于 Ubuntu 真实操作系统,考核环境感知、长链路规划、多软件协同、底层系统操作。

361全场景实战任务
0人工主观评分
Ubuntu真实操作系统底座

注:OSWorld 全程机器自动校验,精准考核智能体在真实系统中的底层执行稳定性。

03它到底会做什么?三大硬核能力拆解

🔄 跨应用协同:多软件连续流转93 项复杂任务

  • 在最考验长链路逻辑的场景中,自主完成浏览器下载、文档编辑、截图存档、邮件发送的全流程操作。
  • 多步之间存在依赖,任何一步出错后面都接不上,Agent 实现一次性跑完。

🎨 像素级图像处理:GIMP 非标面板识别成功率 92.3%

  • 攻克非标准浮动面板、自定义工具栏的识别难题。
  • 26 项任务完成 24 项,在像素级操作场景展现出高精度视觉感知能力。

⚙️ 系统底层运维:零容错场景满分24 项任务满分

  • 在零容错的系统底层运维场景中,实现 24 项任务满分通关
  • 文件权限修改、进程管理、命令行操作全程零失误,展现底层执行稳定性。

04为什么是实在做出来了?

业内开发者共识显示,大模型底座能力已进入同质化阶段,Harness 工程体系成为智能体能力分层的核心关键。研究数据表明,相同模型底座下,优质的 Harness 架构优化可带来 6-10 个百分点的性能提升,复杂场景下优化迭代增益最高可达 17 个百分点

实在 Agent 的领先,正是 8 年工程化深耕的结果,而非单次模型调优的偶然突破。自 2018 年成立以来,实在智能持续打磨适配真实桌面环境的多模态 Harness 体系:

API 可行则调用 API无 API 则 GUI 可视化操作千万级异常场景迭代

依托海量企业级真实场景数据,解决了实验室模型“跑分强、落地弱”的行业通病,让智能体具备适配复杂真实环境的实战能力。

编辑视角

本次成绩及具体任务表现目前由企业单方披露,未见第三方独立复测结果,读者可带此背景参考。报道中提及的“8 年工程化深耕”及“千万级异常场景迭代”为厂商自述口径,实际落地效果需后续企业级生产环境验证。

当模型底座趋于同质化,决定智能体落地能力的不再是参数规模,而是工程化处理异常场景的颗粒度——系统工程正在取代参数比拼,成为 AI 落地的真正护城河

后续动态

核心技术正面向企业级生产场景迭代,目标向工业级 99.99% 可靠性推进。关注实在智能官方渠道获取最新进展。

实在智能官网 → 了解技术进展