🔓 开源 · 大模型发布

阿里千问首次开源 2.4 万亿参数旗舰模型,多项基准反超 GPT-5.6 与 Fable 5

8 月 13 日,阿里千问团队正式开放 Qwen3.8-2.4T-A95B 模型权重。总参数 2.4 万亿、每 Token 激活 950 亿,这是千问历史上第一次把 Max 级旗舰模型交到社区手里。在论文复现、电脑操作、工程设计三项基准上,它反超了 GPT-5.6 Sol 与 Fable 5。

综合公开信息 2026-08-13 全文约 4 分钟读完
#阿里千问 #Qwen3.8 #开源大模型 #长周期Agent #模型压缩
2.4万亿 总参数量 · 每Token激活950亿
93.0 PaperBench 论文复现 · 高于GPT-5.6 Sol、Fable 5
91% 存储体积缩减 · 4.9TB 压至 397GB

⚡ 30 秒速览

  • 开源了什么:Qwen3.8-2.4T-A95B 权重全面开放——2.4 万亿总参数、每 Token 激活 950 亿,原生 26 万 Token 上下文,可扩展至 101 万。
  • 高光成绩:PaperBench 93.0 分、OSWorld-Verified 86.1 分、参数化 CAD 91.5 分,均领先 GPT-5.6 Sol 与 Fable 5。
  • 诚实的短板:SWE-bench Pro 67.7 分,落后 Fable 5 达 12.3 分;TerminalBench、VideoMME 同样未登顶。
  • 主打能力:长周期自主——连续编程 16 天、独立复现改进论文、2000+ 轮交互经营虚拟电商。
  • 怎么跑:SGLang / vLLM / TokenSpeed 可部署;Unsloth 量化版仅 397GB,410GB+ 内存显存即可本地运行。

01发生了什么 首次把 Max 级旗舰交到社区手里

8 月 13 日,千问团队在 Hugging Face 与魔搭社区同步上架 Qwen3.8-2.4T-A95B 的模型权重。它基于 Qwen3.5 底层架构,8 月 3 日已随官方版本 Qwen3.8-Max 首发——这一次开源,是千问第一次把 Max 级旗舰模型对外开放。

开源的不只是权重,是旗舰能力的"出厂设置"。

和以往开源的"小杯"不同,这款模型的规格直接拉到顶级:总参数 2.4 万亿,每个 Token 只激活 950 亿参数——典型的 MoE 架构,让"大"与"快"不必二选一。

2.4 万亿总参数量
950 亿 / Token激活参数
262,144 Token原生上下文 · 可扩至 101 万
Qwen3.5底层架构
SGLang · vLLM · TokenSpeed支持推理引擎
默认开启,不可关闭思考模式

上下文扩展到 101 万 Token 需要额外配置;思考模式强制开启,意味着所有输出都经过完整的推理链路,代价是响应延迟更高。

02成绩单 领先是客观的,但不是全面的

发布预告时,千问团队给了一句少见的自信表述:"可能是除了 Fable 5 外最强大的模型。"基准测试基本撑住了这句话。

但它没有在所有赛道上都赢。

PaperBench论文复现 · 高于 GPT-5.6 Sol、Fable 5、Claude Opus 4.8
93.0
OSWorld-Verified电脑操作 · 参评模型第一
86.1
参数化 CAD工程设计 · 超过 Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro
91.5

柱形按满分 100 等比绘制,仅用于观感排序;精确分差以右侧标注数字为准。

再往前看,领先开始收窄,甚至反转。

TerminalBench 2.1 · 86.6
GPT-5.6 Sol 88.8 · 落后 2.2 分
SWE-bench Pro · 67.7
Fable 5 80.0 · 落后 12.3 分
VideoMME v2 · 68.3
GPT-5.6 Sol 71.1 · 落后 2.8 分

领跑项集中在 agent 执行与工程能力;代码修复(SWE-bench Pro)与长视频理解仍是明显短板——预训练时的"豪言",在细分基准上打了折扣。

03能干什么 不陪聊,自己把活干完

Qwen3.8 的设计重心不在单轮问答,而是一个更野的问题:模型能不能脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完?

🧑‍💻 连续自主编程 16 天 多阶段自进化

  • 自主构建了自进化 Harness,持续完成社区需求收集、issue 派发、代码生成、验证与自我修复。
  • 16 天无人干预,任务间的切换全部由模型自己决定。
这已经接近一个"自带项目管理"的工程团队,而非单纯的代码生成器。

📄 独立复现并改进一篇研究论文 跨数周流程

  • 从论文阅读、实验复现到提出改进方案,全程自主完成
  • 科研中"读-做-改-写"的闭环,被压缩进一次长会话。
科研自动化迈出的是完整一步,不是单点辅助。

🛒 2000+ 轮交互经营虚拟电商 长周期决策

  • 在超过 2000 轮交互中完成选品、定价、客服、复盘等经营决策。
  • 持续考验长期记忆、策略一致性与复盘迭代能力。
长周期决策的稳定性,是 agent 进入真实商业场景的门票

0491% 的体积压缩 开源社区的反向补刀

权重开源当晚,开源 AI 项目团队 Unsloth AI 就放出狠活:用动态 1-bit 分层选择性量化,把 4.9TB 的原始权重压到 397GB。借助 Unsloth-Desktop,内存 + 显存总量 410GB 以上即可本地运行。

91% 存储体积缩减 · 4.9TB → 397GB

压缩前

4.9TB企业级服务器集群才跑得动

压缩后

397GB410GB+ 内存显存即可本地运行

1-bit 量化以精度换体积,推理质量会有折损——它是"跑得起来"的路径,不是"跑得最好"的路径。

05为什么是现在 三家顶流,同一个夜晚

8 月 13 日夜,三家公司轮番炸场:Grok 4.6、DeepSeek-V4-Pro、Qwen3.8。

巧合?更像是默契。

Grok 4.6

马斯克旗下最强模型,智能体与知识基准综合性能对齐 GPT-5.6 Sol Max。

DeepSeek-V4-Pro

正式版上线,综合性能接近、部分指标超越 Claude Fable 5。

Qwen3.8

首次把 2.4 万亿参数旗舰模型开放权重。

三家的发力点高度一致:多步骤、长周期、自主闭环。模型竞争的重心,正从"单轮对话智商"转向"独立承接完整项目的能力"。

接收高难度任务自主拆解调用工具执行验证交付

而阿里千问的选择是——把这条赛道的顶级选手,直接开源。

编辑核心判断

开源旗舰正在改写竞争的底层规则。当 2.4 万亿参数的权重可以被自由下载、部署、量化、再分发,模型本身不再稀缺,稀缺的是工程能力与场景闭环。开源从来不是慈善,它是把竞争从"谁的模型更强"拖进"谁能把它用得更好"的战场。

现在就能跑

模型权重已上线 ModelScope 与 Hugging Face,搜索 Qwen3.8-2.4T-A95B 即可下载。想本地部署又缺算力,可以再等等——更小杯 Qwen3.8-27B 已在路上。

ModelScope / Hugging Face → 搜索 Qwen3.8-2.4T-A95B
官方 API 同步开放:国内每百万 Tokens 输入 12 元、输出 36 元;海外输入 2 美元、输出 6 美元