耗时41分钟,千问办公交出一份行业周报 —— 三款AI办公产品实测,拼的不是速度,是判断成本
8月3日,Qwen3.8-Max与千问办公一同亮相。我们第一时间让三款AI办公产品执行同一个具身智能行业周报任务。结果,千问办公耗时41分钟,TRAE Work用了16分钟,WorkBuddy只用了7分钟。但当我们把三份报告摊开,事情开始变得有意思了。
8月3日,Qwen3.8-Max与千问办公一同亮相。我们第一时间让三款AI办公产品执行同一个具身智能行业周报任务。结果,千问办公耗时41分钟,TRAE Work用了16分钟,WorkBuddy只用了7分钟。但当我们把三份报告摊开,事情开始变得有意思了。
测试任务:生成一份具身智能行业周报,统计周期为一周,覆盖融资事件、企业动态、技术进展。三款产品交出的答卷,呈现出三种完全不同的产品哲学。
效率优先,输出"可直接修改的工作初稿"。结构完整,标题清晰,但判断链条较短。乐聚机器人、它石智航被标记为"无重大动态",实际存在IPO进展与行业入选。
信息覆盖优先,列出十家公司动态,其中六家被标记为"无新动态"。但核查发现至少五家有公开事件。信源偏重聚合平台,识别信息关系的能力较弱。
判断深度优先。主动标注风险、区分事件时间与报道时间、解释取舍逻辑、交代研究方法。输出不只是报告,更是一套研究过程的展示。
注:三条路线对应不同的用户假设:WorkBuddy认为用户需要快速可用结果,TRAE Work认为用户需要更丰富来源,千问办公认为用户需要可信的判断过程。
WorkBuddy在周报中判断乐聚机器人和它石智航"本周未检索到重大公开动态"。但进一步核查发现,乐聚机器人本周有IPO获深交所受理,它石智航联合创始人入选MIT TR35榜单。
问题不是信息不存在,而是"没有找到信息"被推导成了"这件事没有发生"。这两个判断之间,存在一道关键鸿沟。
TRAE Work同样存在类似问题。它在报告中列出了十家公司动态,其中六家被标记为"本周未检索到可查证的新动态",包括千寻智能、乐聚机器人、地瓜机器人等。逐一核查后发现,至少五家公司都有公开动态。
注:数据来自对三份周报的逐条核查,核查范围覆盖所有被标记的公司动态。
千问办公的处理方式截然不同。面对一条关于美国FCC限制人形机器人进口的信息,它没有直接写成确定事实,而是标注"目前单一信源,建议进一步核实"。此外,它还会区分事件发生时间和报道时间,解释自己的取舍逻辑,并在报告末尾附上完整的"报告说明"。
为什么大家愿意投入更多"智能成本"去建立信任?答案指向Token。互联网时代的生意围绕用户规模展开,DAU、MAU是关键指标。AI时代,用户数量依然重要,但更重要的是用户到底调用了多少AI能力。
Token已经从一个技术指标,变成AI时代新的商业度量衡。
今年3月,阿里巴巴成立ATH事业群,由集团CEO吴泳铭亲自负责,核心方向被概括为"创造Token、输送Token、应用Token"。办公场景天然高频、刚需,嵌入企业生产流程,一旦AI进入写作、会议、知识管理、数据分析等日常工作,模型调用就不再是一次性体验,而会变成持续发生的生产力消耗。
但一个诚实的注脚:Token增长,并不天然等于价值增长。单纯比较Token数量没有意义,重要的是每个Token创造了多少价值。未来Agent可能会走向两条路线:一种是通过更多智能投入提高复杂任务完成质量,另一种是通过流程优化降低成本让AI进入更多普通工作场景。
过去判断AI产品能力,用户习惯比响应速度、比回答丝滑度。但当AI真正走进办公场景,竞争核心从"输出能力"转向"执行信用"——用户是否相信它能够在复杂任务中,稳定交付一个可靠结果。
任务到手,拆解、执行、交卷,一气呵成。追求"先有结果再做优化",适用于普通办公场景。
长板是拉网,尽可能扩大搜索半径。但进入复杂任务深水区,瓶颈不再是找到信息,而是判断信息。
试图让Agent从"帮用户做事"走向"替用户承担判断"。41分钟背后对应的是更多的中间步骤。
Agent的分水岭不是速度,而是判断成本。三款AI办公产品展示的是不同的智能投入方式,这三种需求都会长期存在。
当AI从聊天工具变成真正参与工作的智能体,竞争将延伸到模型能力之外——考验产品如何理解任务价值,以及如何分配有限的智能资源。判断成本,正在成为Agent时代的核心竞争壁垒。
千问办公已正式上线,登录官网即可体验深度Agent能力。
千问办公 → 开始体验