2.4T 参数旗舰模型与 AI 办公平台同日登场,AI 竞赛从“聊天”转向“交付”
8 月 3 日,阿里正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数达 2.4 万亿、激活 95B、支持 1M 上下文。同日,企业级 Agent 产品 千问办公 开启公测,将模型能力直接接入钉钉生态。模型与产品同步落地,释放出明确信号:大模型竞争正从“参数竞赛”进入“工位扎根”阶段。
8 月 3 日,阿里正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数达 2.4 万亿、激活 95B、支持 1M 上下文。同日,企业级 Agent 产品 千问办公 开启公测,将模型能力直接接入钉钉生态。模型与产品同步落地,释放出明确信号:大模型竞争正从“参数竞赛”进入“工位扎根”阶段。
Qwen3.8 采用 稀疏 MoE(混合专家)架构与混合注意力机制的联合优化。总参数 2.4 万亿,但每次推理只激活 95B——相当于一家拥有 2400 名员工的超级工厂,面对新任务时精准调度最懂行的 95 人。
总参数决定知识上限,激活参数决定实际算力消耗。两者差距越大,架构效率越高。
与上一代相比,这一代的关键变化不在参数翻了多少倍,而在架构逻辑的切换:
所有参数全部激活,算力成本与参数规模成正比,扩展至万亿级时推理成本极高。
2.4T 总参数中仅激活 95B,用更少的计算量获得更大的知识容量,推理效率提升明显。
注:稀疏 MoE 架构下,总参数与激活参数的比值反映模型效率。Qwen3.8 的激活比例约为 3.96%,意味着每次推理只调用不到 4% 的参数。
一个诚实的注脚:参数规模是基础能力的天花板,但天花板不等于实际表现。真正决定用户体验的,是模型在具体任务中的交付质量——而这正是 Qwen3.8 试图证明的方向。
在权威三方榜单 Arena 中,Qwen 模型整体性能仅次于 Anthropic 的 Claude 系列,处于全球第一梯队。在 CodeArena 编程榜单中,Qwen3.8 位居全球第四。
但榜单分数只是快照,真实能力要看具体任务中的表现。
注:Arena 榜单为综合能力排名,此处仅示意相对位置,非精确分数。CodeArena 编程榜排名为全球第四,数据来自公开榜单。
一组真实的效率对比:法务标注——一支法务助理团队需一周完成的数百份文档、千余条条款标注,Qwen3.8 一小时做完;篮球录像分析——160 小时以上比赛录像、8400 多个攻防回合,模型 数十分钟 拆解完毕,输出球员战术画像与教练报告。
需要说明的是,上述为官方团队给出的示例。真实水位有待更多第三方使用持续验证,但方向已经清晰:模型的训练目标,正在从“答得对”转向“干得完”。
这是 Qwen3.8 最具冲击力的能力展示:
这不是一个精心设计的演示场景——整个项目从零开始,没有预设代码模板,没有人工干预窗口。模型自己决定下一步做什么、遇到 bug 怎么修、功能如何迭代。
当模型能稳定、可靠地交付生产级成果,AI 才真正从“辅助思考”跨入“替代执行”时代。
模型证明它能干活之后,下一个问题随之而来:这份能力通过什么载体交到企业手里?
阿里的答案是 千问办公——一款整合了内部三款 Agent 产品(桌面级 QoderWork、云端 MuleRun、企业级悟空)的统一产品,也是业内首款同时支持桌面端、云端和企业协同的 Agent 产品。
从“三线赛马”到“一面旗帜”,整合本身就是战略信号。
三者焊在一起,形成从模型到场景到组织的完整链路。千问办公已初步打通钉钉 IM,能同步获取群聊信息、日程安排、审批流程等企业级数据。钉钉 PC 端和手机端的内置入口开放后,用户无需切换应用即可调用全部能力。
AI 办公的护城河从来不是模型能力,而是组织关系、审批流、日程与群聊里沉淀多年的业务上下文。
用户提问 → AI 回答 → 用户复制粘贴、手动调整、跨系统搬运。AI 只完成第一步,剩下九步还是人。
拆解任务并执行,交付 PPT、Word、Excel、网页、代码、多媒体;通过技能、记忆与定时任务沉淀为可复用流程。
千问办公被定义为阿里云与钉钉“唯一主推的 SaaS 产品”,这意味着阿里在 AI ToB 赛道上将所有筹码押向同一个方向。
Qwen3.8 的定价策略值得单独说:
注:海外价格仅为 Opus5 的 24%–40%。隐式缓存命中价格更低:国内 ¥1.5/百万 tokens。这是一套典型的“以价换规模”策略——用旗舰模型的高性价比锁定开发者和企业客户。
而在产品层面,AI 办公赛道正迎来一场“三国杀”:
三家大厂路径不同:阿里用钉钉的 2600 万企业组织 做支点,把千问办公的产品归钉钉、销售归阿里云;字节将飞书产品团队并入豆包,让办公产品直接承接模型与企业级算力;腾讯的 WorkBuddy 则依托 Harness 层优势生长。
终点一致:谁能先让 Agent 在客户的实际业务里“跑起来、留下来、反复用”,谁就握住了办公 AI 商业化的命脉。
模型能力决定第一次使用有多惊艳,交付能力决定用户会不会持续把真实工作交给它,沉淀能力决定组织会不会离不开它。Qwen3.8 证明了“能干活”,千问办公证明了“能落地”,但真正的胜负手在于:钉钉上 2600 万企业组织,有多少愿意把日常工作流的核心环节交给一个 AI 同事——这个问题的答案,任何榜单都给不了。
千问办公已开启公测,Qwen3.8 模型能力同步接入。用户可通过钉钉客户端或千问办公官网体验,在对话中直接调用任务 Agent 能力。
钉钉客户端 → 搜索“千问办公”