首个突破 90% 成功率的桌面操作智能体诞生,登顶 OSWorld 双榜
7 月 27 日,实在 Agent 以 90.2% 的总成功率、325.59 分总成绩包揽 OSWorld 总榜与 Agentic Framework 分榜双冠,成为业内首个将 Computer-Use Agent 成功率推过 90% 关口的产品,刷新全球公开评测最高纪录。
7 月 27 日,实在 Agent 以 90.2% 的总成功率、325.59 分总成绩包揽 OSWorld 总榜与 Agentic Framework 分榜双冠,成为业内首个将 Computer-Use Agent 成功率推过 90% 关口的产品,刷新全球公开评测最高纪录。
复盘行业两年迭代曲线,全球计算机使用智能体完成了指数级进化。实在 Agent 此次 90.2% 的突破,打破了行业长期存在的技术瓶颈:
12.2% 基础成功率,行业起步阶段
72.6% 成功率,首次超越人类基线
83.6% 行业高点,技术迭代速度持续攀升
90.2% 实在 Agent 打破技术瓶颈,登顶双榜
对于开发者而言,OSWorld 是衡量智能体实景落地能力的黄金标尺。自 2024 年上线以来,GPT、Gemini、Claude 等旗舰模型均以该榜单数据为核心佐证。它与轻量化基准的区别非常直接:
仅能模拟简单网页交互,脱离真实复杂环境。
基于 Ubuntu 真实操作系统,考核环境感知、长链路规划、多软件协同、底层系统操作。
注:OSWorld 全程机器自动校验,精准考核智能体在真实系统中的底层执行稳定性。
业内开发者共识显示,大模型底座能力已进入同质化阶段,Harness 工程体系成为智能体能力分层的核心关键。研究数据表明,相同模型底座下,优质的 Harness 架构优化可带来 6-10 个百分点的性能提升,复杂场景下优化迭代增益最高可达 17 个百分点。
实在 Agent 的领先,正是 8 年工程化深耕的结果,而非单次模型调优的偶然突破。自 2018 年成立以来,实在智能持续打磨适配真实桌面环境的多模态 Harness 体系:
依托海量企业级真实场景数据,解决了实验室模型“跑分强、落地弱”的行业通病,让智能体具备适配复杂真实环境的实战能力。
本次成绩及具体任务表现目前由企业单方披露,未见第三方独立复测结果,读者可带此背景参考。报道中提及的“8 年工程化深耕”及“千万级异常场景迭代”为厂商自述口径,实际落地效果需后续企业级生产环境验证。
核心技术正面向企业级生产场景迭代,目标向工业级 99.99% 可靠性推进。关注实在智能官方渠道获取最新进展。
实在智能官网 → 了解技术进展