阿里千问首次开源 2.4 万亿参数旗舰模型,多项基准反超 GPT-5.6 与 Fable 5
8 月 13 日,阿里千问团队正式开放 Qwen3.8-2.4T-A95B 模型权重。总参数 2.4 万亿、每 Token 激活 950 亿,这是千问历史上第一次把 Max 级旗舰模型交到社区手里。在论文复现、电脑操作、工程设计三项基准上,它反超了 GPT-5.6 Sol 与 Fable 5。
8 月 13 日,阿里千问团队正式开放 Qwen3.8-2.4T-A95B 模型权重。总参数 2.4 万亿、每 Token 激活 950 亿,这是千问历史上第一次把 Max 级旗舰模型交到社区手里。在论文复现、电脑操作、工程设计三项基准上,它反超了 GPT-5.6 Sol 与 Fable 5。
8 月 13 日,千问团队在 Hugging Face 与魔搭社区同步上架 Qwen3.8-2.4T-A95B 的模型权重。它基于 Qwen3.5 底层架构,8 月 3 日已随官方版本 Qwen3.8-Max 首发——这一次开源,是千问第一次把 Max 级旗舰模型对外开放。
开源的不只是权重,是旗舰能力的"出厂设置"。
和以往开源的"小杯"不同,这款模型的规格直接拉到顶级:总参数 2.4 万亿,每个 Token 只激活 950 亿参数——典型的 MoE 架构,让"大"与"快"不必二选一。
上下文扩展到 101 万 Token 需要额外配置;思考模式强制开启,意味着所有输出都经过完整的推理链路,代价是响应延迟更高。
发布预告时,千问团队给了一句少见的自信表述:"可能是除了 Fable 5 外最强大的模型。"基准测试基本撑住了这句话。
但它没有在所有赛道上都赢。
柱形按满分 100 等比绘制,仅用于观感排序;精确分差以右侧标注数字为准。
再往前看,领先开始收窄,甚至反转。
领跑项集中在 agent 执行与工程能力;代码修复(SWE-bench Pro)与长视频理解仍是明显短板——预训练时的"豪言",在细分基准上打了折扣。
Qwen3.8 的设计重心不在单轮问答,而是一个更野的问题:模型能不能脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完?
权重开源当晚,开源 AI 项目团队 Unsloth AI 就放出狠活:用动态 1-bit 分层选择性量化,把 4.9TB 的原始权重压到 397GB。借助 Unsloth-Desktop,内存 + 显存总量 410GB 以上即可本地运行。
4.9TB企业级服务器集群才跑得动
397GB410GB+ 内存显存即可本地运行
1-bit 量化以精度换体积,推理质量会有折损——它是"跑得起来"的路径,不是"跑得最好"的路径。
8 月 13 日夜,三家公司轮番炸场:Grok 4.6、DeepSeek-V4-Pro、Qwen3.8。
巧合?更像是默契。
马斯克旗下最强模型,智能体与知识基准综合性能对齐 GPT-5.6 Sol Max。
正式版上线,综合性能接近、部分指标超越 Claude Fable 5。
首次把 2.4 万亿参数旗舰模型开放权重。
三家的发力点高度一致:多步骤、长周期、自主闭环。模型竞争的重心,正从"单轮对话智商"转向"独立承接完整项目的能力"。
而阿里千问的选择是——把这条赛道的顶级选手,直接开源。
开源旗舰正在改写竞争的底层规则。当 2.4 万亿参数的权重可以被自由下载、部署、量化、再分发,模型本身不再稀缺,稀缺的是工程能力与场景闭环。开源从来不是慈善,它是把竞争从"谁的模型更强"拖进"谁能把它用得更好"的战场。
模型权重已上线 ModelScope 与 Hugging Face,搜索 Qwen3.8-2.4T-A95B 即可下载。想本地部署又缺算力,可以再等等——更小杯 Qwen3.8-27B 已在路上。
ModelScope / Hugging Face → 搜索 Qwen3.8-2.4T-A95B