27B 开源模型 Qwen3.8-27B 多项基准超越 Claude Opus 4.6 Max,社区两天下载破百万
一个仅 27B 参数的原生多模态稠密模型,在编程、Agent、软件工程等多项基准上得分高于 Claude Opus 4.6 Max,量化后可在消费级 GPU 上离线运行。开源两天,社区下载量突破 100 万次,自发贡献约 500 个量化版本。
一个仅 27B 参数的原生多模态稠密模型,在编程、Agent、软件工程等多项基准上得分高于 Claude Opus 4.6 Max,量化后可在消费级 GPU 上离线运行。开源两天,社区下载量突破 100 万次,自发贡献约 500 个量化版本。
Qwen3.8-27B 发布后公布的评测数据显示,在多个侧重 工程执行、Agent 能力与多模态交互的基准上,它的得分均高于 Claude Opus 4.6 Max。这不是某单项的偶然胜出,而是覆盖了编程、软件工程、办公自动化、指令遵循、多模态操作等多个维度的系统性表现。
竞争性编程,考察算法实现与代码生成能力
🏆 超越 ClaudeAgentic Coding,端到端软件工程任务
🏆 超越 Claude软件工程全流程,含调试与测试
🏆 超越 Claude长周期办公任务,跨步骤协作与交付
🏆 超越 Claude指令遵循,复杂约束下的准确执行
🏆 超越 Claude计算机与移动端 GUI 操作
🏆 超越 Claude多模态软件工程,视觉+代码联合理解
🏆 超越 Claude通用多模态推理,图像与文本联合理解
🏆 超越 Claude注:以上为 Qwen 官方公布的评测结果,所有基准均采用标准评估协议,Claude Opus 4.6 Max 为 Anthropic 同期旗舰模型。具体得分数据以官方报告为准。
一个 27B 的稠密模型,在多项基准上超越参数规模大得多的模型——这背后是架构设计的取舍。
稠密模型 vs MoE:每次生成都是全力以赴,但代价是什么?
总参数大,但每个 token 只激活部分参数(如 30B-A3B 实际激活约 3B),生成吞吐高,但存在路由不均衡、专家利用不充分等问题。
典型代表:Mixtral、DeepSeek-V2每个 token 调用全部 27B 参数,计算更充分,但推理延迟和内存占用更高。Qwen3.8-27B 通过混合架构与 MTP 来缓解这一瓶颈。
Qwen3.8-27B:Gated DeltaNet + Gated AttentionQwen3.8-27B 采用 64 层混合架构:以"三层 Gated DeltaNet + 一层 Gated Attention"为一个基本组合,重复 16 次。四分之三的网络层使用线性注意力路线的 Gated DeltaNet,四分之一保留完整 Gated Attention。
这种设计的价值在于:Gated DeltaNet 通过紧凑的状态表示降低长序列处理成本,而周期保留的完整注意力层则维持了对复杂 token 依赖关系的建模能力。模型原生支持 262K 上下文,可通过 YaRN 扩展至 100 万 token。
更关键的设计是 多 Token 预测(MTP)——传统自回归模型一次只预测一个 token,而 Qwen3.8-27B 训练了多步 MTP 头,为推测解码提供了基础。对于稠密模型,这直接意味着解码速度的提升:用 MTP 一次提出多个候选 token,主模型批量验证,减少串行开销。
一个诚实的注脚:稠密模型每 token 都需要完整计算,在本地部署场景中,工程优化的好坏直接决定了实际体验。
Qwen3.8-27B 开源后的反应速度,远超一般模型发布。12 小时进入 Hugging Face 历史最受欢迎 TOP 4,两天下载超 100 万次——这些数字背后是真实的使用和适配。
芯片厂商连夜适配——NVIDIA、AMD、平头哥、沐曦、联发科、摩尔线程等第一时间完成支持。
推理工具全线跟进——vLLM、SGLang、Ollama、LM Studio 等主流推理框架在发布当天或次日即完成适配,开发者开箱即用。
一个值得注意的细节:社区在发布当天就开始讨论如何把模型跑得更快,而不是"能不能跑"。这种从"能力怎么样"到"怎样跑得更好"的快速切换,是活跃生态的典型信号。
Qwen3.8-27B 发布后,社区最活跃的方向不是讨论评测分数,而是 如何利用 MTP 和量化在本地硬件上跑出更高速度。对于稠密模型,工程优化直接决定了用户体验的上下限。
MTP 推测解码:多个硬件平台上的实测提升
这些优化不是锦上添花,而是 稠密模型在本地落地的必要条件。Qwen3.8-27B 提供了 MTP 能力和 reasoning_effort 控制接口,但具体的工程实现——从 chat template 修改到 sampler 配置,从量化精度选择到推理后端适配——全部由社区完成。
Qwen3.8-27B 的故事,表面上是一个 27B 模型在基准上超越更大模型的"逆袭"叙事,但更值得关注的是它背后反映出的行业趋势变化。
过去两年,开源社区的关注点集中在"模型权重"上——参数规模、架构设计、训练数据。但 Qwen3.8-27B 发布后,社区的反应表明:权重只是起点,工程优化才是决定模型实际价值的关键环节。
同一份权重,经过不同的 chat template、sampler、量化方案和推理后端,可能产生完全不同的用户体验。Qwen 开放、开源的生态策略,使得这种"推理侧工程"可以被社区集体完成——这在闭源模型的世界里是不可想象的。
一个值得注意的张力:稠密模型的每 token 全参数计算特性,决定了它在本地部署场景中天然不如 MoE 高效。但 Qwen3.8-27B 通过 MTP 推测解码、reasoning_effort 动态调节、以及社区驱动的极致工程优化,正在缩小这一差距。这不是"最好的架构"的胜利,而是"最适合的架构 + 最活跃的生态"的综合结果。
开源模型的生命力,正在从"训练出更强的权重"转向"围绕权重构建最活跃的工程生态"。Qwen3.8-27B 证明了:当社区愿意为你的模型写适配、做优化、调参数时,这个模型才真正拥有了"生命力"——而基准分数,只是这场马拉松的起跑线。
模型权重已开源至 Hugging Face 社区,搜索 Qwen3.8-27B 即可下载。Ollama、LM Studio 等工具已支持一键部署,消费级 GPU 即可运行。
Hugging Face 开源社区 → 下载模型