⚡ 模型发布 · 办公 Agent

Token 消耗再降 75%、百万输入仅 0.8 元:千问发布 Qwen3.8-Flash,办公 Agent 迈过成本"斩杀线"

8 月 26 日晚,阿里千问大模型团队发布多模态 MoE 模型 Qwen3.8-Flash,开源版本同步放出。几乎同一时间,该模型首发上线千问办公全新「标准模式」——单任务生成速度提升约 100%,Token 消耗平均减少 75%,输入价格低至每百万 Tokens 0.8 元

综合公开信息整理 2026-08-27 全文约 5 分钟读完
#千问 #Qwen3.8-Flash #办公Agent #MoE
0.8 输入价格 / 每百万 Tokens
-75% 标准模式 Token 消耗平均减少
6B 每个 Token 仅激活 6B 参数
⚡ 30 秒速览
  • 新模型:Qwen3.8-Flash 发布并同步开源(开放权重版 Qwen3.8-Flash-Next),MoE 架构 125B 总参、每 Token 仅激活 6B。
  • 新价格:输入 0.8 元 / 百万 Tokens、输出 2.7 元,缓存命中仅 0.1 元
  • 新标准:千问办公标准模式单任务速度 +100%、Token 消耗 -75%,覆盖约 95% 日常任务
  • 新技术:GDN + Attention 混合架构与 QSA 稀疏注意力,1M 上下文下 Prefill 最高 7.6 倍加速。
  • 新信号:模型与 Agent 协同优化,办公 Agent 竞争从「模型能力」转向「系统工程」。

01先把账算清楚 标准模式的成本结构

价格从来不是孤立数字。对办公 Agent 而言,它由两笔账构成——每个 Token 的单价,和完成同一件事要花的 Token 数量。千问这次两头都在压。

0.8 元输入 / 百万 Tokens
2.7 元输出 / 百万 Tokens
0.1 元缓存命中 / 百万 Tokens
95%标准模式可覆盖日常任务

注:缓存命中价格意味着「多轮复用上下文」的成本几乎可以忽略,这是长会话场景的关键变量。

那标准模式和高级模式,差在哪?

标准模式(本次更新)

单任务速度 +100%,Token 消耗 -75%,积分消耗大多停在零点几。目标:覆盖每天都会发生的日常任务。

高级模式(原有)

部分细节处理和页面呈现更完整,积分消耗很快进入两位数。适合更复杂的推理任务。

一个诚实的注脚:标准模式未必要在每一道题上都超过高级模式。只要那些每天都会发生、结果达到可用线就够的工作能稳定完成,用户就少了一个每次都往高级模式上点的理由。

02九十五分的日常 标准模式够用吗?

便宜归便宜,够不够用才是关键。我们把几类典型任务实际跑了一遍。

📋 周报整理:零散材料到「直接可发」一次完成

  • 一周工作散落在会议纪要、聊天记录、待办列表和临时笔记里,一股脑丢给它,要求"别写流水账,自己找重点"。
  • 没有机械按原始顺序排列,而是自动合并重复项目进展,区分本周主要成果、风险与需协调事项、下周工作重点。
  • 连接钉钉后,精简版周报直接发到钉钉消息,中间不需要复制粘贴一次。
实测结论:从整理到交付,一个任务链路完整跑完,没有产生任何返工。

🌤️「奇思妙想」任务:一句需求换一个能打开的网页直接可用

  • 需求原文:「需要一个网站自动抓取各个天气网站未来一周内的天气情况,综合分析,推荐今日通勤的服装和注意事项」。
  • 千问办公自动调用公开天气 API,完成页面和规则逻辑,没有让用户提供任何接口。
  • 最终交付一个可以直接打开的网页,包含温度、舒适度、雨雪分析与穿衣建议。
实测结论:过去至少要自己找数据接口、处理城市定位和页面结构,现在一句需求就够了。

📄 同一任务:标准模式 vs 高级模式完成度接近

  • 把一份文字版工作报告做成带留言框的网页,两个模式各跑一遍。
  • 两个版本完成度接近——标准模式已能完整跑通「理解需求 → 内容组织 → 页面生成 → 基础交互」。
  • 高级模式在部分细节和页面呈现上更完整,但积分消耗差距明显:标准模式单次零点几,高级模式两位数。
差值确实存在,但标准模式证明了一件事:它让「随手用」成为可能,而不是每次都要精打细算。

03便宜从哪里来 模型内外的双向优化

价格是结果,效率是原因。这笔账,要从模型内外两头算——先看模型内。

125B主模型参数量
51BN-gram Embedding
6B每 Token 激活参数

注:MoE 架构让模型保留千亿级容量的同时,每个 Token 只让极小部分参数参与计算——这是「高智能密度」的成本基础。

在架构层面,Qwen3.8-Flash 延续了 Qwen3.5 的 GDN + Attention Hybrid 设计:

GDN(3/4 层)压缩历史全局 Attention(1/4 层)精确检索QSA micro-block 粗筛

可以理解成:GDN 负责把大量历史信息压缩记住,真正需要找细节时,QSA 先做一轮粗筛,从长上下文里找到最相关的区域——不用每次都把全部内容重新过一遍。

Prefill 加速
7.6x
Decode 加速
4.9x
Prefill 吞吐
8.6x

注:前两项为 1M Token 上下文下 QSA Attention Kernel 的加速数据;吞吐为 90% Prefix Cache 命中率下,相对 Qwen3.7-Plus 的倍数。为直观对比,柱形自 0 起始,非缩放。

但模型只解决一半问题。另一半在模型外——Agent Harness、上下文管理和工具调用。

过去做 Agent,常见路线是先找强模型,再外接规划、工具、Memory 和 Agent Loop。两边各自优化,很快就会暴露问题:模型不熟悉工具能力边界,一次调用能解决的问题可能要试错两三次;上下文越堆越长,模型每轮都在重复阅读已处理过的信息。

千问这次的做法,是把模型与 Agent 放到一起调——千问大模型团队与千问办公团队联合推出办公专属版本,在多步规划、工具选择、上下文压缩等场景做专项训练,再结合推理优化和定制 Harness 提升整体吞吐。这与 GPT-5-Codex、Qoder 走的是同一条路线,只是从 Coding 进一步扩展到了办公场景。

04Token 焦虑可以休矣 一个行业现象

这股「省钱风」其实吹遍了全球。Token 焦虑已经不分国界、不太分职级——硅谷焦虑「用得不够多」,普通人焦虑「花得太多」。

2810 亿Meta 一名员工年 Token 消耗量
2810 万粗略等价页 PPT(1 万 Token/页)
400 万美元 · 对应成本估算

注:据公开报道,Meta 内部排行榜追踪超 8.5 万名员工的 Token 使用量,成本按 Claude Opus 4.6 输入/输出均价粗估,仅供参考量级。

黄仁勋(英伟达 CEO):如果一位年薪 50 万美元的工程师一年只花掉很少的 AI 计算预算,他反而会担心——理想量级接近每年 25 万美元。
Andrej Karpathy(前特斯拉/OpenAI AI 科学家):如果订阅额度到月底还剩很多,他会觉得自己没有充分利用能够获得的 Token 吞吐。

硅谷的「Tokenmaxxing」是一种生产力竞赛。但对普通用户来说,Agent 的账单很难在使用前算明白——于是出现了一个有点无奈的现象:为了省 Token,一些工作不舍得交给 Agent 跑

千问这次想解决的,正是这个问题。

8 月 3 日千问办公开启公测,整合了此前多款产品的能力,把桌面 Agent、云端 Agent 和企业协同放进同一套产品;随后开放的 MyContext 把 IM、文档、日历、会议数据加工成 Agent 可用的上下文。模型、Harness、Context 再到办公应用,一条完整链路已经拼齐。标准模式把这套链路推向极致——让用户不用在按下执行之前,先算一遍 Token

编辑核心判断

真正的「斩杀线」,不是一次降价就能划出来的。千问把模型与 Agent 放到一起调——训练、推理、工具调用、Harness 层层协同。办公 Agent 的竞争,正在从「谁的模型更强」,转向「谁能把每个 Token 花得更值」。

现在就能用

标准模式已全量上线千问办公,登录官方平台选择「标准模式」即可体验。低至 0.8 元 / 百万 Tokens 的输入价格,已经让「随手用」成为可能。

千问办公官网 → 选择「标准模式」