阿里千问 Qwen3.8-Flash 发布:全新 Next 架构,千亿参数仅激活 6B,性能超越 Claude Opus4.6
8 月 26 日晚,阿里发布并同步开源 Qwen3.8-Flash。该模型采用下一代架构,总参数 125B 仅激活 6B,性能超越 Claude Opus4.6、接近 Opus4.8,训练成本较上代骤降 90%,推理价格低至 DeepSeek-V4-Flash 的 1/3,创下全球模型性价比新基准。
8 月 26 日晚,阿里发布并同步开源 Qwen3.8-Flash。该模型采用下一代架构,总参数 125B 仅激活 6B,性能超越 Claude Opus4.6、接近 Opus4.8,训练成本较上代骤降 90%,推理价格低至 DeepSeek-V4-Flash 的 1/3,创下全球模型性价比新基准。
Qwen3.8-Flash 在多项权威评测中全面超越 Claude Opus4.6,在智能体编程、专业工作、多模态等维度均建立显著优势:
注:以上分数为 Qwen3.8-Flash 相对于 Claude Opus4.6 的领先幅度。柱形长度反映相对领先比例,非绝对分数。所有评测均采用官方公开协议,结果可复现。
此外,在 CoWorkBench 长程专业任务和 Toolathlon Verified 真实工具调用中,Qwen3.8-Flash 同样超越 DeepSeek-V4-Flash,展现出全面的智能体能力。
Qwen3.8-Flash 采用了与此前所有千问大模型完全不同的全新架构,三大核心创新协同发力:
单条信息主通道,注意力计算开销大,参数扩展依赖纯规模增长,训练效率逐年递减。
QSA 混合注意力 + Gated Residual 四通道 + N-gram Embedding 外挂记忆,效率与性能双突破。
QSA(Qwen Sparse Attention):与 GDN 高效融合的混合注意力机制,在高缓存命中的 1M Tokens 长上下文场景中可提速 8 倍以上,兼顾速度与准确率。
Gated Residual 方法:将传统 Transformer 的 1 条信息主通道拆分为 4 条,模型可根据需求动态决定读写信息,训练更稳定,信息传递效率倍增。
N-gram Embedding:引入 51B 的外挂参数,为 Transformer 提供高效查表寻址,每次 token 计算时无需参与,以极低资源消耗实现"外挂记忆指南",参数扩展效率大幅提升。
注:三大创新协同作用,使模型在预训练阶段即以远低于上代的成本达成超越。仅完成预训练的基座模型,在通用、数学推理、编程等基础能力上已超过 3 倍大小的 Qwen3.7-Plus 基座。
架构与训练协同优化,直接带来了成本的断崖式下降:
横向对比,Qwen3.8-Flash 的推理价格仅为 Claude Opus4.6 的 3%,是 DeepSeek-V4-Flash 忙时价格的 1/3、闲时价格的 2/3。用更直白的话说:用不到十分之一的训练成本,做出了超越上代旗舰的性能。
注:价格数据基于官方发布的标准 API 定价。训练成本指从零到完成模型训练的总计算资源开销,含实验调优。实际部署成本因场景而异。
Qwen3.8-Flash 的模型权重已在 Hugging Face 和 魔搭社区全面开源,接受全球开发者检验。截至目前,Qwen 系列模型已发布三大尺寸(Max / 27B / Flash),覆盖从旗舰到高效的全场景需求。
官方表示,Next 新架构将是全新一代千问大模型 Qwen4 的雏形,Qwen3.8-Flash 的开源旨在让全球社区参与验证,共同打造更强大的下一代模型。
注:衍生模型指社区基于 Qwen 系列基座进行微调、量化、适配后发布的二次开发模型。下载量数据截至 2026 年 8 月。
6B 激活参数做到超越 Opus4.6,靠的不是堆算力,而是架构效率的系统性碾压。训练成本降 90% 不是渐进优化,是架构代际更替的结果。当一家公司同时做到性能领先、成本腰斩、全面开源,行业竞争的游戏规则就已经被重写。
Qwen3.8-Flash 已首发上线"千问办公",标准模式内置最新模型,可完成 95% 日常办公任务。开发者和企业可通过千问 AI 平台获取 API 服务。
千问 AI 平台 → 立即体验