华尔街实测8款全球主流Agent:千问办公综合排名第一,超越Claude Cowork与Codex
8月19日,华尔街投行杰富瑞发布全球主流AI Agent实测报告,阿里千问办公在5项真实办公任务中综合得分排名第一,是唯一在所有维度均获90分以上的Agent产品,超越Claude Cowork、Codex等七款国内外主流工具。
8月19日,华尔街投行杰富瑞发布全球主流AI Agent实测报告,阿里千问办公在5项真实办公任务中综合得分排名第一,是唯一在所有维度均获90分以上的Agent产品,超越Claude Cowork、Codex等七款国内外主流工具。
杰富瑞分析师对八款全球主流AI Agent进行了真实办公任务实测,覆盖文档处理、数据检索、浏览器操作、演示文稿制作、多模态生成五大能力维度。千问办公是唯一在所有维度中均获得90分以上的Agent产品。
报告特别指出,千问办公在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,整体表现均衡且稳定。这不仅是模型能力的体现,更是系统工程能力的胜利。
排名基于杰富瑞分析师公开报告,5项任务维度得分均为90+分,综合评分位列8款参测产品之首。
评测覆盖了现代办公中最核心的5类任务场景,千问办公在每个维度均交出高分答卷。这不仅是"能做事",更是"稳定地做好事"。
5项任务涵盖文档处理、联网检索、桌面自动化、数据可视化、多模态生成,均为企业日常高频刚需场景。评分采用自动化校验与人工审核双轨机制。
一个诚实的注脚:全部90+分不等于完美。在浏览器操作类任务中,部分复杂页面的元素定位仍有提升空间。但横向对比8款产品,千问办公是唯一没有明显短板的选手。
杰富瑞报告将Agent能力拆解为模型与Harness两部分。所谓Harness,是围绕模型运行的一整套工程机制——它决定了模型能力能否稳定转化为实际任务结果。
参数规模、推理精度、知识储备——决定"能不能理解"。
指令编排、上下文管理、工具调用、边界控制、反馈纠错、治理——决定"能不能交付"。
千问办公的隐含Harness分位居此次测试产品首位,高于Claude Cowork和Codex。这意味着,在底层模型之外,阿里在工程化落地上构筑了更扎实的壁垒。
这条链路中每一环都影响最终交付质量。千问办公的Harness表现证明:优秀的系统架构能显著释放模型潜力——同一个底座模型,搭配更完善的工程框架,任务完成率就会更高。
这次评测释放了一个清晰的信号:Agent竞争正在从"模型参数比拼"转向"工程能力竞赛"。千问办公的登顶不是因为Qwen 3.8 Max比Claude或GPT更强,而是因为模型+Harness的协同效应在参测产品中做到了最好。
对于企业客户而言,这意味着一件事:选Agent不能只看底层模型,更要看产品化能力——指令是否精准、上下文是否连贯、工具调用是否稳定、出错能否自动纠偏。这些才是决定"能不能用"的关键。
一个容易被忽视的维度是成本。千问办公底层Qwen 3.8 Max的API价格明显低于海外头部模型,而Agent任务通常需要多轮推理和长链路执行,"Cost per Task"将成为企业规模化部署的核心考量。性能与成本的双重优势,让千问办公在企业级场景中具备了更强的落地基础。
Agent时代,工程能力与产品化水平正在取代模型参数,成为智能体竞争的核心分水岭。谁能把"模型潜力"稳定转化为"任务交付力",谁就能在企业级市场占据主动。
千问办公已初步打通钉钉IM,企业员工可通过自然语言完成群聊总结、文档表格创建、消息邮件收发等操作。未来还将接入企业真实工作流,连接数据库与业务系统。
通义千问官网 → 体验千问办公