⚡ 智能体 · 办公实测

耗时41分钟,千问办公交出一份行业周报 —— 三款AI办公产品实测,拼的不是速度,是判断成本

8月3日,Qwen3.8-Max与千问办公一同亮相。我们第一时间让三款AI办公产品执行同一个具身智能行业周报任务。结果,千问办公耗时41分钟,TRAE Work用了16分钟,WorkBuddy只用了7分钟。但当我们把三份报告摊开,事情开始变得有意思了。

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#千问办公 #AI Agent #WorkBuddy #TRAE Work #智能体评测
⏱ 41 分钟 千问办公 · 深度判断型
16 分钟 TRAE Work · 信息覆盖型
7 分钟 WorkBuddy · 效率优先型

⚡ 30 秒速览

  • 测试了什么:三款AI办公产品生成同一份具身智能行业周报,覆盖融资、企业动态、技术进展。
  • 关键差异:WorkBuddy追求速度(7分钟),TRAE Work追求信息覆盖(16分钟),千问办公追求判断深度(41分钟)。
  • 判断分歧:WorkBuddy和TRAE Work将部分公司标记为"无动态",但实际存在公开事件;千问办公主动标注风险、解释取舍。
  • 深层信号:Agent竞争的分水岭正在从"输出速度"转向"执行信用"——用户是否相信它能在复杂任务中稳定交付可靠结果。
  • 商业逻辑:Token成为AI时代新商业语言,办公场景距离Token商业闭环最近,但单纯堆Token不等于创造价值。

01一份周报,三条路线 速度 vs 覆盖 vs 判断

测试任务:生成一份具身智能行业周报,统计周期为一周,覆盖融资事件、企业动态、技术进展。三款产品交出的答卷,呈现出三种完全不同的产品哲学。

WorkBuddy · 7分钟

效率优先,输出"可直接修改的工作初稿"。结构完整,标题清晰,但判断链条较短。乐聚机器人、它石智航被标记为"无重大动态",实际存在IPO进展与行业入选。

TRAE Work · 16分钟

信息覆盖优先,列出十家公司动态,其中六家被标记为"无新动态"。但核查发现至少五家有公开事件。信源偏重聚合平台,识别信息关系的能力较弱。

千问办公 · 41分钟

判断深度优先。主动标注风险、区分事件时间与报道时间、解释取舍逻辑、交代研究方法。输出不只是报告,更是一套研究过程的展示。

注:三条路线对应不同的用户假设:WorkBuddy认为用户需要快速可用结果,TRAE Work认为用户需要更丰富来源,千问办公认为用户需要可信的判断过程。

02判断的鸿沟 从"没找到"到"没发生"

WorkBuddy在周报中判断乐聚机器人和它石智航"本周未检索到重大公开动态"。但进一步核查发现,乐聚机器人本周有IPO获深交所受理,它石智航联合创始人入选MIT TR35榜单。

问题不是信息不存在,而是"没有找到信息"被推导成了"这件事没有发生"。这两个判断之间,存在一道关键鸿沟。

TRAE Work同样存在类似问题。它在报告中列出了十家公司动态,其中六家被标记为"本周未检索到可查证的新动态",包括千寻智能、乐聚机器人、地瓜机器人等。逐一核查后发现,至少五家公司都有公开动态。

5/6TRAE Work标记"无动态"的公司中,至少5家有实际动态
2/2WorkBuddy标记"无重大动态"的公司,均存在实际事件
0千问办公在周报中出现的判断性错误

注:数据来自对三份周报的逐条核查,核查范围覆盖所有被标记的公司动态。

千问办公的处理方式截然不同。面对一条关于美国FCC限制人形机器人进口的信息,它没有直接写成确定事实,而是标注"目前单一信源,建议进一步核实"。此外,它还会区分事件发生时间和报道时间,解释自己的取舍逻辑,并在报告末尾附上完整的"报告说明"。

03两个测试场景 千问办公的"判断成本"体现在哪

📄 场景一:行业周报生成 判断深度

  • 主动标注风险:涉及美国FCC限制中国人形机器人进口的信息时,标注"单一信源,建议进一步核实"。
  • 区分事件时间与报道时间:光轮智能与西门子合作发生在7月20日WAIC期间,已超周报窗口,但标注"窗口内出现相关报道,因此收录"。
  • 解释取舍逻辑:统计逐际动力消息时,写道"窗口内处于Pre-IPO轮后的相对静默期,收录一条"。
  • 交代研究方法:报告末尾增加完整的"报告说明",包括统计口径、信源格式、可靠性说明。
三个判断行为:标注风险、区分时间、解释取舍——千问办公把"为什么"写在了报告里。

🎙️ 场景二:会议转写修正 上下文理解

  • 读取钉钉中AI硬件录音卡的会议转写时,未在未获得权限时假装读取成功,明确提示当前无法访问数据。
  • 重新授权后,不仅完成转写内容提取,还主动识别语音识别错误:VLA被误识别为"VOA",CVPR被识别为"cpr",根据上下文修正。
  • 面对无法确认的公司名称,标记为"疑似转写误差",交由用户判断,不强行猜测。
两个测试场景完全不同,但体现同一种能力:面对不确定信息,千问办公没有急于给答案,而是知道什么时候需要验证、什么时候需要说明边界。

04Token:AI时代的新商业语言

为什么大家愿意投入更多"智能成本"去建立信任?答案指向Token。互联网时代的生意围绕用户规模展开,DAU、MAU是关键指标。AI时代,用户数量依然重要,但更重要的是用户到底调用了多少AI能力。

Token已经从一个技术指标,变成AI时代新的商业度量衡。

今年3月,阿里巴巴成立ATH事业群,由集团CEO吴泳铭亲自负责,核心方向被概括为"创造Token、输送Token、应用Token"。办公场景天然高频、刚需,嵌入企业生产流程,一旦AI进入写作、会议、知识管理、数据分析等日常工作,模型调用就不再是一次性体验,而会变成持续发生的生产力消耗。

Token 成为新商业语言 办公 距离Token闭环最近 判断成本 决定Agent价值 执行信用 新的竞争分水岭

但一个诚实的注脚:Token增长,并不天然等于价值增长。单纯比较Token数量没有意义,重要的是每个Token创造了多少价值。未来Agent可能会走向两条路线:一种是通过更多智能投入提高复杂任务完成质量,另一种是通过流程优化降低成本让AI进入更多普通工作场景。

05Agent的分水岭 从"谁回得快"到"谁交的活儿能用"

过去判断AI产品能力,用户习惯比响应速度、比回答丝滑度。但当AI真正走进办公场景,竞争核心从"输出能力"转向"执行信用"——用户是否相信它能够在复杂任务中,稳定交付一个可靠结果。

WorkBuddy:高效执行者

任务到手,拆解、执行、交卷,一气呵成。追求"先有结果再做优化",适用于普通办公场景。

🔍

TRAE Work:信息助手

长板是拉网,尽可能扩大搜索半径。但进入复杂任务深水区,瓶颈不再是找到信息,而是判断信息。

🧠

千问办公:判断承担者

试图让Agent从"帮用户做事"走向"替用户承担判断"。41分钟背后对应的是更多的中间步骤。

Agent的分水岭不是速度,而是判断成本。三款AI办公产品展示的是不同的智能投入方式,这三种需求都会长期存在。

编辑核心判断

当AI从聊天工具变成真正参与工作的智能体,竞争将延伸到模型能力之外——考验产品如何理解任务价值,以及如何分配有限的智能资源。判断成本,正在成为Agent时代的核心竞争壁垒。

现在就能用

千问办公已正式上线,登录官网即可体验深度Agent能力。

千问办公 → 开始体验