🧠 开源模型 · 技术突破

27B 开源模型 Qwen3.8-27B 多项基准超越 Claude Opus 4.6 Max,社区两天下载破百万

一个仅 27B 参数的原生多模态稠密模型,在编程、Agent、软件工程等多项基准上得分高于 Claude Opus 4.6 Max,量化后可在消费级 GPU 上离线运行。开源两天,社区下载量突破 100 万次,自发贡献约 500 个量化版本

综合公开信息整理 2026-07-24 全文约 3 分钟读完
#Qwen3.8-27B #开源模型 #本地部署 #稠密模型 #基准超越
27B 参数 · 原生多模态稠密模型
9+ 基准超越 Claude Opus 4.6 Max
100 万+ 开源 2 天 Hugging Face 下载量
~500 社区自发贡献的量化版本

⚡ 30 秒速览

  • 赢了多少:在 LiveCodeBench v6、SWE-bench Pro、DeepSWE 1.1、QwenSWEBench、CoWorkBench、IFBench 等 9 项以上基准中得分高于 Claude Opus 4.6 Max,涵盖编程、Agent、办公、指令遵循等核心维度。
  • 本地就能跑:量化后可在消费级 GPU、个人工作站甚至部分高配笔记本上离线运行,一张二手 RTX 3090 即可流畅部署。
  • 社区疯狂:开源 12 小时进入 Hugging Face 历史最受欢迎模型 TOP 4,两天下载超 100 万次,芯片与推理工具厂商连夜适配。
  • 架构不简单:Gated DeltaNet + Gated Attention 混合架构,原生支持 262K 上下文,可扩展至 100 万 token,还自带多 Token 预测(MTP)。
  • 工程才是关键:社区已通过 MTP 推测解码将 RTX 4090 上的解码速度从 47.7 提升至 76.3 tokens/s,Apple Silicon 性能提升 153%。

01关键成就 哪些基准超越了 Claude Opus 4.6 Max

Qwen3.8-27B 发布后公布的评测数据显示,在多个侧重 工程执行、Agent 能力与多模态交互的基准上,它的得分均高于 Claude Opus 4.6 Max。这不是某单项的偶然胜出,而是覆盖了编程、软件工程、办公自动化、指令遵循、多模态操作等多个维度的系统性表现。

LiveCodeBench v6

竞争性编程,考察算法实现与代码生成能力

🏆 超越 Claude

SWE-bench Pro / DeepSWE 1.1

Agentic Coding,端到端软件工程任务

🏆 超越 Claude

QwenSWEBench

软件工程全流程,含调试与测试

🏆 超越 Claude

CoWorkBench

长周期办公任务,跨步骤协作与交付

🏆 超越 Claude

IFBench

指令遵循,复杂约束下的准确执行

🏆 超越 Claude

OSWorld-Verified / AndroidWorld

计算机与移动端 GUI 操作

🏆 超越 Claude

SWE-MM

多模态软件工程,视觉+代码联合理解

🏆 超越 Claude

视觉数学 / 科学图表分析

通用多模态推理,图像与文本联合理解

🏆 超越 Claude

注:以上为 Qwen 官方公布的评测结果,所有基准均采用标准评估协议,Claude Opus 4.6 Max 为 Anthropic 同期旗舰模型。具体得分数据以官方报告为准。

02架构解析 为什么是稠密模型?

一个 27B 的稠密模型,在多项基准上超越参数规模大得多的模型——这背后是架构设计的取舍。

稠密模型 vs MoE:每次生成都是全力以赴,但代价是什么?

MoE(混合专家)

总参数大,但每个 token 只激活部分参数(如 30B-A3B 实际激活约 3B),生成吞吐高,但存在路由不均衡、专家利用不充分等问题。

典型代表:Mixtral、DeepSeek-V2

Dense(稠密)

每个 token 调用全部 27B 参数,计算更充分,但推理延迟和内存占用更高。Qwen3.8-27B 通过混合架构与 MTP 来缓解这一瓶颈。

Qwen3.8-27B:Gated DeltaNet + Gated Attention

Qwen3.8-27B 采用 64 层混合架构:以"三层 Gated DeltaNet + 一层 Gated Attention"为一个基本组合,重复 16 次。四分之三的网络层使用线性注意力路线的 Gated DeltaNet,四分之一保留完整 Gated Attention。

这种设计的价值在于:Gated DeltaNet 通过紧凑的状态表示降低长序列处理成本,而周期保留的完整注意力层则维持了对复杂 token 依赖关系的建模能力。模型原生支持 262K 上下文,可通过 YaRN 扩展至 100 万 token。

更关键的设计是 多 Token 预测(MTP)——传统自回归模型一次只预测一个 token,而 Qwen3.8-27B 训练了多步 MTP 头,为推测解码提供了基础。对于稠密模型,这直接意味着解码速度的提升:用 MTP 一次提出多个候选 token,主模型批量验证,减少串行开销。

一个诚实的注脚:稠密模型每 token 都需要完整计算,在本地部署场景中,工程优化的好坏直接决定了实际体验。

03社区热度 从数据到生态的全面爆发

Qwen3.8-27B 开源后的反应速度,远超一般模型发布。12 小时进入 Hugging Face 历史最受欢迎 TOP 4,两天下载超 100 万次——这些数字背后是真实的使用和适配。

12 小时进入 Hugging Face TOP 4
100 万+2 天下载量
~500社区量化版本
21+MTP 优化贡献者

芯片厂商连夜适配——NVIDIA、AMD、平头哥、沐曦、联发科、摩尔线程等第一时间完成支持。

NVIDIA AMD 平头哥 沐曦 联发科 摩尔线程

推理工具全线跟进——vLLM、SGLang、Ollama、LM Studio 等主流推理框架在发布当天或次日即完成适配,开发者开箱即用。

vLLM SGLang Ollama LM Studio Cerebras

一个值得注意的细节:社区在发布当天就开始讨论如何把模型跑得更快,而不是"能不能跑"。这种从"能力怎么样"到"怎样跑得更好"的快速切换,是活跃生态的典型信号。

04工程优化 社区正在"榨干"每一分性能

Qwen3.8-27B 发布后,社区最活跃的方向不是讨论评测分数,而是 如何利用 MTP 和量化在本地硬件上跑出更高速度。对于稠密模型,工程优化直接决定了用户体验的上下限。

MTP 推测解码:多个硬件平台上的实测提升

🚀 MTP 推测解码实测 社区开源项目 qwen38-mtp

  • RTX 3090:解码速度从 31.0 tokens/s 提升至 41.3 tokens/s,提升幅度 33%
  • RTX 4090:从 47.7 tokens/s 提升至 76.3 tokens/s,提升幅度 60%
  • RTX 5090 Mobile:从 36.7 tokens/s 提升至 50.9 tokens/s
  • RTX A6000:从 26.7 tokens/s 提升至 52.5 tokens/s,幅度接近翻倍
  • AMD RX 7900 XTX:从 30.7 tokens/s 提升至 43.9 tokens/s
项目启动 2 天即积累 21 名贡献者、27 组配置——开源社区的自发优化速度令人印象深刻。

🍎 Apple Silicon 性能挑战 153% 提升

  • 开发者 Kydo 发起针对 Qwen3.8-27B 的 Apple Silicon 优化挑战,目标:挖掘统一内存架构下的未充分利用的性能空间。
  • 不到 16 小时,参与者将运行性能相对基线提高 153%,达到默认 MTP 解码性能的约 2.5 倍。
  • 下一步计划:将同样的优化方式扩展到 CUDA 平台。
Apple Silicon 的统一内存架构对稠密模型有天然优势——每 token 都需要完整权重,内存带宽是关键瓶颈,而统一内存恰恰擅长于此。

这些优化不是锦上添花,而是 稠密模型在本地落地的必要条件。Qwen3.8-27B 提供了 MTP 能力和 reasoning_effort 控制接口,但具体的工程实现——从 chat template 修改到 sampler 配置,从量化精度选择到推理后端适配——全部由社区完成。

05编辑判断

Qwen3.8-27B 的故事,表面上是一个 27B 模型在基准上超越更大模型的"逆袭"叙事,但更值得关注的是它背后反映出的行业趋势变化。

过去两年,开源社区的关注点集中在"模型权重"上——参数规模、架构设计、训练数据。但 Qwen3.8-27B 发布后,社区的反应表明:权重只是起点,工程优化才是决定模型实际价值的关键环节

同一份权重,经过不同的 chat template、sampler、量化方案和推理后端,可能产生完全不同的用户体验。Qwen 开放、开源的生态策略,使得这种"推理侧工程"可以被社区集体完成——这在闭源模型的世界里是不可想象的。

一个值得注意的张力:稠密模型的每 token 全参数计算特性,决定了它在本地部署场景中天然不如 MoE 高效。但 Qwen3.8-27B 通过 MTP 推测解码、reasoning_effort 动态调节、以及社区驱动的极致工程优化,正在缩小这一差距。这不是"最好的架构"的胜利,而是"最适合的架构 + 最活跃的生态"的综合结果。

编辑核心判断

开源模型的生命力,正在从"训练出更强的权重"转向"围绕权重构建最活跃的工程生态"。Qwen3.8-27B 证明了:当社区愿意为你的模型写适配、做优化、调参数时,这个模型才真正拥有了"生命力"——而基准分数,只是这场马拉松的起跑线。

现在就能用

模型权重已开源至 Hugging Face 社区,搜索 Qwen3.8-27B 即可下载。Ollama、LM Studio 等工具已支持一键部署,消费级 GPU 即可运行。

Hugging Face 开源社区 → 下载模型