🚀 模型 · 架构突破

阿里千问 Qwen3.8-Flash 发布:全新 Next 架构,千亿参数仅激活 6B,性能超越 Claude Opus4.6

8 月 26 日晚,阿里发布并同步开源 Qwen3.8-Flash。该模型采用下一代架构,总参数 125B 仅激活 6B,性能超越 Claude Opus4.6、接近 Opus4.8,训练成本较上代骤降 90%,推理价格低至 DeepSeek-V4-Flash 的 1/3,创下全球模型性价比新基准。

综合公开信息整理 2026-08-26 全文约 4 分钟读完
#阿里千问 #Qwen3.8-Flash #Next架构 #MoE #极致性价比
6B 激活 125B 总参数 · MoE 架构
90% 训练成本较 Qwen3.7-Plus 降幅
¥1 每百万 Tokens 输入价格

⚡ 30 秒速览

  • 性能有多强:超越 Claude Opus4.6,接近 Opus4.8;仅激活 6B 参数,总参数 125B。
  • 成本有多低:训练成本较 Qwen3.7-Plus 骤降 90%;推理输入 1 元 / 百万 Tokens,输出 3 元,最低仅为 DeepSeek-V4-Flash 忙时价格的 1/3。
  • 架构新在哪:全新 Next 架构,引入 QSA 混合注意力、Gated Residual 四通道信息传递、N-gram Embedding 外挂记忆。
  • 评测全面领先:SWE-bench Pro 领先 Opus4.6 达 9.1 分,JobBench 超出近 20 分,AndroidWorld 高出 22.5 分,MathVision 超出 25.1 分,ERQA 领先 31.5 分。
  • 开源生态:模型权重已在 Hugging Face、魔搭社区全面开源,全球下载量突破 30 亿次,衍生模型超 30 万个。

01核心成绩 6B 激活全面超越 Opus4.6

Qwen3.8-Flash 在多项权威评测中全面超越 Claude Opus4.6,在智能体编程、专业工作、多模态等维度均建立显著优势:

🥇 SWE-bench Pro智能体编程
+9.1
JobBench专业工作任务
+19.8
AndroidWorld移动端智能体
+22.5
MathVision视觉推理数学
+25.1
ERQA具身智能
+31.5

注:以上分数为 Qwen3.8-Flash 相对于 Claude Opus4.6 的领先幅度。柱形长度反映相对领先比例,非绝对分数。所有评测均采用官方公开协议,结果可复现。

此外,在 CoWorkBench 长程专业任务和 Toolathlon Verified 真实工具调用中,Qwen3.8-Flash 同样超越 DeepSeek-V4-Flash,展现出全面的智能体能力。

02技术突破 Next 架构三大创新

Qwen3.8-Flash 采用了与此前所有千问大模型完全不同的全新架构,三大核心创新协同发力:

传统 Transformer 架构

单条信息主通道,注意力计算开销大,参数扩展依赖纯规模增长,训练效率逐年递减。

Next 架构(Qwen3.8-Flash)

QSA 混合注意力 + Gated Residual 四通道 + N-gram Embedding 外挂记忆,效率与性能双突破。

QSA 混合注意力 Gated Residual 四通道 N-gram Embedding MoE 6B/125B 1M 长上下文

QSA(Qwen Sparse Attention):与 GDN 高效融合的混合注意力机制,在高缓存命中的 1M Tokens 长上下文场景中可提速 8 倍以上,兼顾速度与准确率。

Gated Residual 方法:将传统 Transformer 的 1 条信息主通道拆分为 4 条,模型可根据需求动态决定读写信息,训练更稳定,信息传递效率倍增。

N-gram Embedding:引入 51B 的外挂参数,为 Transformer 提供高效查表寻址,每次 token 计算时无需参与,以极低资源消耗实现"外挂记忆指南",参数扩展效率大幅提升。

注:三大创新协同作用,使模型在预训练阶段即以远低于上代的成本达成超越。仅完成预训练的基座模型,在通用、数学推理、编程等基础能力上已超过 3 倍大小的 Qwen3.7-Plus 基座。

03极致性价比 训练降 90%,推理低至 1 元

架构与训练协同优化,直接带来了成本的断崖式下降

训练成本降幅
90%
较 Qwen3.7-Plus
推理输入价格
¥1
每百万 Tokens
推理输出价格
¥3
每百万 Tokens

横向对比,Qwen3.8-Flash 的推理价格仅为 Claude Opus4.6 的 3%,是 DeepSeek-V4-Flash 忙时价格的 1/3、闲时价格的 2/3。用更直白的话说:用不到十分之一的训练成本,做出了超越上代旗舰的性能。

注:价格数据基于官方发布的标准 API 定价。训练成本指从零到完成模型训练的总计算资源开销,含实验调优。实际部署成本因场景而异。

04能做什么 三个典型场景

💻 智能体编程:从需求到代码的端到端交付 SWE-bench Pro +9.1

  • 给定一个 GitHub Issue,Agent 自主理解需求、定位代码文件、生成补丁、运行测试。
  • 在 SWE-bench Pro 评测中,Qwen3.8-Flash 以领先 Opus4.6 达 9.1 分的成绩,证明其工程化编程能力已达业界前沿。
  • 支持多文件协同修改、依赖分析、测试验证全流程自动化。
评分维度:需求理解 / 代码定位 / 补丁正确性 / 测试通过率 —— 全面领先。

📊 专业办公:复杂任务链的智能执行 JobBench +19.8

  • 一句话触发多步任务链:如"汇总本季度销售数据,按区域做趋势分析,生成 PPT 大纲并写出关键结论"。
  • 在 JobBench 专业工作任务评测中,Qwen3.8-Flash 超出 Opus4.6 近 20 分,展现出强大的任务拆解与执行能力。
  • 千问办公标准模式已内置 Qwen3.8-Flash,可完成 95% 的日常办公任务
LLM 评审结论:任务完成度与交付质量均达到专业助理水平。

📱 多模态智能体:视觉与操作的统一 AndroidWorld +22.5

  • 模拟手机操作:在 AndroidWorld 移动端智能体评测中,Qwen3.8-Flash 比 Opus4.6 高出 22.5 分
  • MathVision 视觉推理数学任务超出 25.1 分,ERQA 具身智能任务领先 31.5 分
  • 多模态能力全面增强,可同时处理视觉理解、空间推理与操作决策。
多模态维度:视觉理解 / 空间推理 / 操作规划 / 任务完成 —— 均达显著优势。

05开源生态 全球下载量突破 30 亿

Qwen3.8-Flash 的模型权重已在 Hugging Face魔搭社区全面开源,接受全球开发者检验。截至目前,Qwen 系列模型已发布三大尺寸(Max / 27B / Flash),覆盖从旗舰到高效的全场景需求。

30 亿+ 全球模型下载量
30 万+ 衍生模型数量
3 大尺寸 Max · 27B · Flash 全开源

官方表示,Next 新架构将是全新一代千问大模型 Qwen4 的雏形,Qwen3.8-Flash 的开源旨在让全球社区参与验证,共同打造更强大的下一代模型。

注:衍生模型指社区基于 Qwen 系列基座进行微调、量化、适配后发布的二次开发模型。下载量数据截至 2026 年 8 月。

编辑核心判断

6B 激活参数做到超越 Opus4.6,靠的不是堆算力,而是架构效率的系统性碾压。训练成本降 90% 不是渐进优化,是架构代际更替的结果。当一家公司同时做到性能领先、成本腰斩、全面开源,行业竞争的游戏规则就已经被重写。

现在就能用

Qwen3.8-Flash 已首发上线"千问办公",标准模式内置最新模型,可完成 95% 日常办公任务。开发者和企业可通过千问 AI 平台获取 API 服务。

千问 AI 平台 → 立即体验