🚀 模型 · 产品双发

2.4T 参数旗舰模型与 AI 办公平台同日登场,AI 竞赛从“聊天”转向“交付”

8 月 3 日,阿里正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数达 2.4 万亿、激活 95B、支持 1M 上下文。同日,企业级 Agent 产品 千问办公 开启公测,将模型能力直接接入钉钉生态。模型与产品同步落地,释放出明确信号:大模型竞争正从“参数竞赛”进入“工位扎根”阶段。

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#阿里 Qwen3.8 #千问办公 #MoE #AI Agent #钉钉
2.4T Qwen3.8-Max 总参数量
95B 单次激活参数,稀疏 MoE 架构
1M 上下文长度,原生多模态理解

⚡ 30 秒速览

  • 模型有多大:Qwen3.8-Max 总参数 2.4T、激活 95B,采用稀疏 MoE + 混合注意力机制,首次将千问推至万亿级。
  • 能力转向:从“答得对”到“干得完”——自主编程连跑 16 天交付真实项目,法务标注一周工作量一小时完成。
  • 产品合龙:千问办公整合三款内部 Agent 产品,深度绑定钉钉,成为阿里云与钉钉“唯一主推的 SaaS 产品”。
  • 定价策略:国内每百万 tokens 输入 12 元、输出 36 元,海外仅为 Opus5 的 24%–40%,以价换规模。
  • 竞争格局:与腾讯 WorkBuddy、字节 Trae/豆包企业版同台,AI 办公赛道进入“三国杀”阶段。

01模型规格 2.4T 参数、95B 激活、1M 上下文

Qwen3.8 采用 稀疏 MoE(混合专家)架构与混合注意力机制的联合优化。总参数 2.4 万亿,但每次推理只激活 95B——相当于一家拥有 2400 名员工的超级工厂,面对新任务时精准调度最懂行的 95 人。

总参数决定知识上限,激活参数决定实际算力消耗。两者差距越大,架构效率越高。

与上一代相比,这一代的关键变化不在参数翻了多少倍,而在架构逻辑的切换:

传统 Dense 架构

所有参数全部激活,算力成本与参数规模成正比,扩展至万亿级时推理成本极高。

Qwen3.8 稀疏 MoE

2.4T 总参数中仅激活 95B,用更少的计算量获得更大的知识容量,推理效率提升明显。

2.4T总参数
95B激活参数
1M上下文长度
MoE混合专家架构

注:稀疏 MoE 架构下,总参数与激活参数的比值反映模型效率。Qwen3.8 的激活比例约为 3.96%,意味着每次推理只调用不到 4% 的参数。

一个诚实的注脚:参数规模是基础能力的天花板,但天花板不等于实际表现。真正决定用户体验的,是模型在具体任务中的交付质量——而这正是 Qwen3.8 试图证明的方向。

02能力验证 榜单排名与真实任务表现

在权威三方榜单 Arena 中,Qwen 模型整体性能仅次于 Anthropic 的 Claude 系列,处于全球第一梯队。在 CodeArena 编程榜单中,Qwen3.8 位居全球第四。

但榜单分数只是快照,真实能力要看具体任务中的表现。

🥇 Claude 系列Anthropic
Qwen3.8阿里
全球第一梯队
CodeArena 编程榜Qwen3.8 排名
#4

注:Arena 榜单为综合能力排名,此处仅示意相对位置,非精确分数。CodeArena 编程榜排名为全球第四,数据来自公开榜单。

一组真实的效率对比:法务标注——一支法务助理团队需一周完成的数百份文档、千余条条款标注,Qwen3.8 一小时做完;篮球录像分析——160 小时以上比赛录像、8400 多个攻防回合,模型 数十分钟 拆解完毕,输出球员战术画像与教练报告。

需要说明的是,上述为官方团队给出的示例。真实水位有待更多第三方使用持续验证,但方向已经清晰:模型的训练目标,正在从“答得对”转向“干得完”。

03自主编程 16 天 从一个空文件夹到交付真实项目

这是 Qwen3.8 最具冲击力的能力展示:

🤖 自进化智能体框架“oh-my-cli”全流程开源

  • 一个空文件夹出发,自主完成需求分析、架构设计、代码编写、调试测试、文档生成全流程。
  • 独立连续运行约 16 天,最终交付一个真实可用的自进化智能体框架,整个过程完全开源、公开存储在 GitHub 上。
  • 这已经不是几个小时的评测题,而是接近真实工程师冲刺周期的工作长度。
关键判断:16 天自主运行意味着模型具备长周期任务规划、中间状态保持、异常自恢复等能力,这是“对话式 AI”到“交付式 AI”的关键跨越。

这不是一个精心设计的演示场景——整个项目从零开始,没有预设代码模板,没有人工干预窗口。模型自己决定下一步做什么、遇到 bug 怎么修、功能如何迭代。

当模型能稳定、可靠地交付生产级成果,AI 才真正从“辅助思考”跨入“替代执行”时代。

04千问办公 模型能力落地,钉钉生态合龙

模型证明它能干活之后,下一个问题随之而来:这份能力通过什么载体交到企业手里?

阿里的答案是 千问办公——一款整合了内部三款 Agent 产品(桌面级 QoderWork、云端 MuleRun、企业级悟空)的统一产品,也是业内首款同时支持桌面端、云端和企业协同的 Agent 产品。

从“三线赛马”到“一面旗帜”,整合本身就是战略信号。

Qwen3.8 底座千问办公产品钉钉 2600 万企业组织

三者焊在一起,形成从模型到场景到组织的完整链路。千问办公已初步打通钉钉 IM,能同步获取群聊信息、日程安排、审批流程等企业级数据。钉钉 PC 端和手机端的内置入口开放后,用户无需切换应用即可调用全部能力。

AI 办公的护城河从来不是模型能力,而是组织关系、审批流、日程与群聊里沉淀多年的业务上下文。

传统 AI 办公助手

用户提问 → AI 回答 → 用户复制粘贴、手动调整、跨系统搬运。AI 只完成第一步,剩下九步还是人。

千问办公

拆解任务并执行,交付 PPT、Word、Excel、网页、代码、多媒体;通过技能、记忆与定时任务沉淀为可复用流程。

千问办公被定义为阿里云与钉钉“唯一主推的 SaaS 产品”,这意味着阿里在 AI ToB 赛道上将所有筹码押向同一个方向。

05定价策略与竞争格局 以价换规模,三国杀开局

Qwen3.8 的定价策略值得单独说:

¥12国内输入 / 百万 tokens
¥36国内输出 / 百万 tokens
$2海外输入 / 百万 tokens
$6海外输出 / 百万 tokens

注:海外价格仅为 Opus5 的 24%–40%。隐式缓存命中价格更低:国内 ¥1.5/百万 tokens。这是一套典型的“以价换规模”策略——用旗舰模型的高性价比锁定开发者和企业客户。

而在产品层面,AI 办公赛道正迎来一场“三国杀”:

阿里 千问办公 腾讯 WorkBuddy 字节 Trae / 豆包企业版 钉钉生态 飞书 + 豆包 Harness 驾驭层

三家大厂路径不同:阿里用钉钉的 2600 万企业组织 做支点,把千问办公的产品归钉钉、销售归阿里云;字节将飞书产品团队并入豆包,让办公产品直接承接模型与企业级算力;腾讯的 WorkBuddy 则依托 Harness 层优势生长。

终点一致:谁能先让 Agent 在客户的实际业务里“跑起来、留下来、反复用”,谁就握住了办公 AI 商业化的命脉。

编辑核心判断

模型能力决定第一次使用有多惊艳,交付能力决定用户会不会持续把真实工作交给它,沉淀能力决定组织会不会离不开它。Qwen3.8 证明了“能干活”,千问办公证明了“能落地”,但真正的胜负手在于:钉钉上 2600 万企业组织,有多少愿意把日常工作流的核心环节交给一个 AI 同事——这个问题的答案,任何榜单都给不了。

现在就能用

千问办公已开启公测,Qwen3.8 模型能力同步接入。用户可通过钉钉客户端或千问办公官网体验,在对话中直接调用任务 Agent 能力。

钉钉客户端 → 搜索“千问办公”