🏆 智能体 · 华尔街评测

华尔街实测8款全球主流Agent:千问办公综合排名第一,超越Claude Cowork与Codex

8月19日,华尔街投行杰富瑞发布全球主流AI Agent实测报告,阿里千问办公在5项真实办公任务中综合得分排名第一,是唯一在所有维度均获90分以上的Agent产品,超越Claude Cowork、Codex等七款国内外主流工具。

综合公开信息整理 2026-08-20 全文约 3 分钟读完
#千问办公 #AI Agent #杰富瑞评测 #Harness #企业级智能体
🥇 综合第1 8款全球主流AI Agent参测
5项任务 全部90+分 · 唯一达成
隐含Harness分 高于Claude Cowork与Codex

⚡ 30秒速览

  • 赢了多少:综合排名第一,超越Claude Cowork、Codex等七款主流Agent产品。
  • 怎么测的:华尔街投行杰富瑞设定5项真实办公任务,涵盖年报摘要、数据比较、浏览器操作、PPT制作、海报生成。
  • 为什么赢:模型+Harness(工程机制)协同出色,千问办公的隐含Harness分位居参测产品首位。
  • 成本优势:底层Qwen 3.8 Max API价格明显低于海外头部模型,企业关注"Cost per Task"。
  • 已落地:千问办公已打通钉钉IM,支持群聊总结、文档表格创建、消息邮件收发等企业场景。

01综合排名:8款产品中位列第一杰富瑞分析师实测报告

杰富瑞分析师对八款全球主流AI Agent进行了真实办公任务实测,覆盖文档处理、数据检索、浏览器操作、演示文稿制作、多模态生成五大能力维度。千问办公是唯一在所有维度中均获得90分以上的Agent产品。

综合排名 🥇 第1 8款参测产品
高于Claude Cowork、Codex等
任务表现 全部90+ 5项真实办公任务
唯一达成此成绩的产品
Harness分 🥇 第1 隐含工程能力评分
高于Claude Cowork和Codex

报告特别指出,千问办公在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,整体表现均衡且稳定。这不仅是模型能力的体现,更是系统工程能力的胜利。

排名基于杰富瑞分析师公开报告,5项任务维度得分均为90+分,综合评分位列8款参测产品之首。

02五维全优:5项真实办公任务全部90+分

评测覆盖了现代办公中最核心的5类任务场景,千问办公在每个维度均交出高分答卷。这不仅是"能做事",更是"稳定地做好事"。

📄 公司年报摘要 90+分
🔍 经营数据比较 90+分
🖥️ 桌面浏览器操作 90+分
📊 英文PPT制作 90+分
🎨 营销海报生成 90+分

5项任务涵盖文档处理、联网检索、桌面自动化、数据可视化、多模态生成,均为企业日常高频刚需场景。评分采用自动化校验与人工审核双轨机制。

一个诚实的注脚:全部90+分不等于完美。在浏览器操作类任务中,部分复杂页面的元素定位仍有提升空间。但横向对比8款产品,千问办公是唯一没有明显短板的选手。

03Harness:工程能力才是真正的护城河

杰富瑞报告将Agent能力拆解为模型Harness两部分。所谓Harness,是围绕模型运行的一整套工程机制——它决定了模型能力能否稳定转化为实际任务结果。

模型能力

参数规模、推理精度、知识储备——决定"能不能理解"。

Harness 工程机制

指令编排、上下文管理、工具调用、边界控制、反馈纠错、治理——决定"能不能交付"。

千问办公的隐含Harness分位居此次测试产品首位,高于Claude Cowork和Codex。这意味着,在底层模型之外,阿里在工程化落地上构筑了更扎实的壁垒。

指令理解 上下文管理 工具调用 边界控制 反馈纠错 治理保障

这条链路中每一环都影响最终交付质量。千问办公的Harness表现证明:优秀的系统架构能显著释放模型潜力——同一个底座模型,搭配更完善的工程框架,任务完成率就会更高。

🔧 什么是"隐含Harness分"? 杰富瑞通过对比同一模型在不同Agent框架下的表现差异,反向推算出各产品的工程能力评分。千问办公的隐含Harness分居首,说明其工程与产品的协同能力在参测产品中最为突出。

04它到底能做什么?两个真实任务切片

📄 多文件年报摘要:从散落到成篇90+分

  • 输入:多份财务报告、管理层讨论、行业分析PDF,无预设模板。
  • 过程:Agent自主定位关键指标、提取业绩亮点与风险提示,按投行标准格式组织摘要。
  • 输出:一份可直接用于汇报的公司年报摘要,附数据来源标注与可比分析。
评测维度:信息提取准确率 / 逻辑组织 / 格式规范 / 完整性 —— 全部90+分。

🖥️ 桌面浏览器操作:检索→分析→生成90+分

  • 任务:联网查找并比较两家公司的经营数据,将结果整理为带图表的文档。
  • 难点:需要自主导航网页、识别数据表格、处理多源信息冲突、生成可视化输出。
  • 结果:Agent完成全链路操作,交付一份包含对比表格和趋势图的分析报告。
LLM评审结论:「任务完成度与交付质量均达到优秀水平」

05编辑核心判断

这次评测释放了一个清晰的信号:Agent竞争正在从"模型参数比拼"转向"工程能力竞赛"。千问办公的登顶不是因为Qwen 3.8 Max比Claude或GPT更强,而是因为模型+Harness的协同效应在参测产品中做到了最好。

对于企业客户而言,这意味着一件事:选Agent不能只看底层模型,更要看产品化能力——指令是否精准、上下文是否连贯、工具调用是否稳定、出错能否自动纠偏。这些才是决定"能不能用"的关键。

一个容易被忽视的维度是成本。千问办公底层Qwen 3.8 Max的API价格明显低于海外头部模型,而Agent任务通常需要多轮推理和长链路执行,"Cost per Task"将成为企业规模化部署的核心考量。性能与成本的双重优势,让千问办公在企业级场景中具备了更强的落地基础。

编辑核心判断

Agent时代,工程能力与产品化水平正在取代模型参数,成为智能体竞争的核心分水岭。谁能把"模型潜力"稳定转化为"任务交付力",谁就能在企业级市场占据主动。

现在就能用

千问办公已初步打通钉钉IM,企业员工可通过自然语言完成群聊总结、文档表格创建、消息邮件收发等操作。未来还将接入企业真实工作流,连接数据库与业务系统。

通义千问官网 → 体验千问办公