Token 消耗再降 75%、百万输入仅 0.8 元:千问发布 Qwen3.8-Flash,办公 Agent 迈过成本"斩杀线"
8 月 26 日晚,阿里千问大模型团队发布多模态 MoE 模型 Qwen3.8-Flash,开源版本同步放出。几乎同一时间,该模型首发上线千问办公全新「标准模式」——单任务生成速度提升约 100%,Token 消耗平均减少 75%,输入价格低至每百万 Tokens 0.8 元。
8 月 26 日晚,阿里千问大模型团队发布多模态 MoE 模型 Qwen3.8-Flash,开源版本同步放出。几乎同一时间,该模型首发上线千问办公全新「标准模式」——单任务生成速度提升约 100%,Token 消耗平均减少 75%,输入价格低至每百万 Tokens 0.8 元。
价格从来不是孤立数字。对办公 Agent 而言,它由两笔账构成——每个 Token 的单价,和完成同一件事要花的 Token 数量。千问这次两头都在压。
注:缓存命中价格意味着「多轮复用上下文」的成本几乎可以忽略,这是长会话场景的关键变量。
那标准模式和高级模式,差在哪?
单任务速度 +100%,Token 消耗 -75%,积分消耗大多停在零点几。目标:覆盖每天都会发生的日常任务。
部分细节处理和页面呈现更完整,积分消耗很快进入两位数。适合更复杂的推理任务。
一个诚实的注脚:标准模式未必要在每一道题上都超过高级模式。只要那些每天都会发生、结果达到可用线就够的工作能稳定完成,用户就少了一个每次都往高级模式上点的理由。
便宜归便宜,够不够用才是关键。我们把几类典型任务实际跑了一遍。
价格是结果,效率是原因。这笔账,要从模型内外两头算——先看模型内。
注:MoE 架构让模型保留千亿级容量的同时,每个 Token 只让极小部分参数参与计算——这是「高智能密度」的成本基础。
在架构层面,Qwen3.8-Flash 延续了 Qwen3.5 的 GDN + Attention Hybrid 设计:
可以理解成:GDN 负责把大量历史信息压缩记住,真正需要找细节时,QSA 先做一轮粗筛,从长上下文里找到最相关的区域——不用每次都把全部内容重新过一遍。
注:前两项为 1M Token 上下文下 QSA Attention Kernel 的加速数据;吞吐为 90% Prefix Cache 命中率下,相对 Qwen3.7-Plus 的倍数。为直观对比,柱形自 0 起始,非缩放。
但模型只解决一半问题。另一半在模型外——Agent Harness、上下文管理和工具调用。
过去做 Agent,常见路线是先找强模型,再外接规划、工具、Memory 和 Agent Loop。两边各自优化,很快就会暴露问题:模型不熟悉工具能力边界,一次调用能解决的问题可能要试错两三次;上下文越堆越长,模型每轮都在重复阅读已处理过的信息。
千问这次的做法,是把模型与 Agent 放到一起调——千问大模型团队与千问办公团队联合推出办公专属版本,在多步规划、工具选择、上下文压缩等场景做专项训练,再结合推理优化和定制 Harness 提升整体吞吐。这与 GPT-5-Codex、Qoder 走的是同一条路线,只是从 Coding 进一步扩展到了办公场景。
这股「省钱风」其实吹遍了全球。Token 焦虑已经不分国界、不太分职级——硅谷焦虑「用得不够多」,普通人焦虑「花得太多」。
注:据公开报道,Meta 内部排行榜追踪超 8.5 万名员工的 Token 使用量,成本按 Claude Opus 4.6 输入/输出均价粗估,仅供参考量级。
硅谷的「Tokenmaxxing」是一种生产力竞赛。但对普通用户来说,Agent 的账单很难在使用前算明白——于是出现了一个有点无奈的现象:为了省 Token,一些工作不舍得交给 Agent 跑。
千问这次想解决的,正是这个问题。
8 月 3 日千问办公开启公测,整合了此前多款产品的能力,把桌面 Agent、云端 Agent 和企业协同放进同一套产品;随后开放的 MyContext 把 IM、文档、日历、会议数据加工成 Agent 可用的上下文。模型、Harness、Context 再到办公应用,一条完整链路已经拼齐。标准模式把这套链路推向极致——让用户不用在按下执行之前,先算一遍 Token。
真正的「斩杀线」,不是一次降价就能划出来的。千问把模型与 Agent 放到一起调——训练、推理、工具调用、Harness 层层协同。办公 Agent 的竞争,正在从「谁的模型更强」,转向「谁能把每个 Token 花得更值」。
标准模式已全量上线千问办公,登录官方平台选择「标准模式」即可体验。低至 0.8 元 / 百万 Tokens 的输入价格,已经让「随手用」成为可能。
千问办公官网 → 选择「标准模式」