🚀 模型 · 旗舰发布

千问 Qwen3.8-Max 正式发布:2.4万亿参数旗舰,多项基准超越海外模型,真实工程仍存差距

8 月 3 日,阿里正式发布 Qwen3.8-Max,参数规模达 2.4 万亿,支持 100 万 Token 上下文。科研编程与 Agent 任务大幅跃升,PaperBench 从 64.8 分跃至 93 分,但 SWE-bench Pro 仍落后 Fable 5 约 12 分,真实软件工程能力尚存短板。

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#阿里 #千问 #Qwen3.8-Max #大模型 #MoE
2.4 万亿 参数规模 · MoE 架构
100 万 Token 上下文窗口长度
12 / 36 API 输入/输出(每百万 Token)

⚡ 30 秒速览

  • 核心参数:2.4 万亿参数 MoE 架构,100 万 Token 上下文,API 定价输入 12 元 / 输出 36 元(每百万 Token),处于国产头部中间价位。
  • 最大进步:科研编程与 Agent 任务大幅跃升。PaperBench 从 64.8 分升至 93 分,Agents' Last Exam 通过率从 11.8% 升至 27%,部分项目反超海外旗舰。
  • 明显短板:真实软件工程仍有差距。SWE-bench Pro 得分 67.7,低于 Fable 5 约 12 分,也低于 Claude Opus 4.8 的 69.2 分。
  • 与同期旗舰对比:与 Kimi K3 相比多数项目落后但差距有限,工作流智能体任务反超;与 DeepSeek V4 Flash 相比全部领先,但价格差距远大于能力差距。
  • 阿里生态:云计算 + 钉钉 + 企业客户整合,千问在企业级大模型调用市场排名第一,但模型能力仍是长期竞争力的核心。

01基准测试成绩 科研编程跃升,真实工程仍落后

千问官方将 Fable 5、Opus 4.8 和 GPT-5.6 Sol 等海外旗舰作为对标对象。从结果看,Qwen3.8-Max 进步明显,但尚未全面领先。

📈 PaperBench科研复现 · 跃升幅度最大
93.0
Agents' Last ExamAgent 任务通过率
27.0%
SWE-bench Pro真实软件工程
67.7
Claude Opus 4.8 (SWE-bench)对比参考
69.2
Fable 5 (SWE-bench)对比参考
80.0

注:柱形宽度按比例缩放,PaperBench 以 Qwen3.8-Max 得分 93 为基准标定 100%,其余项目依此比例呈现。SWE-bench 对比显示,Qwen3.8-Max 在真实代码仓库中的跨文件修改与稳定性仍有差距。

一个诚实的注脚:官方编程基准成绩较好,但 Arena 用户盲选榜单中,Qwen3.8-Max 在 Code Arena 排名第四,比榜首低 37 分。前者反映解题与工程任务能力,后者更侧重生成结果的视觉效果与用户偏好——跑分与口碑之间,存在温差。

02能力解读 反超项 vs 差距项

Qwen3.8-Max 的提升集中在需要 任务拆解、工具调用与连续执行 的场景,而在需要 全局理解与稳定修改 的真实工程项目中,仍与最强模型有距离。

✅ 反超项

PaperBench:64.8 → 93 分,理解论文并复现实验的能力大幅提升。
Agents' Last Exam:11.8% → 27%,多步 Agent 任务通过率翻倍。
工作流智能体:在与 Kimi K3 的对比中,该项唯一反超。

⚠️ 差距项

SWE-bench Pro:67.7 分,低于 Fable 5 约 12 分。
深度软件工程:跨文件修改、避免引入新问题,稳定性不足。
复杂工具调用:动态环境中的连续操作仍是短板。

大模型从业者王楠将长周期任务的难点概括为:远距离规划、状态追踪和错误恢复。每一步操作都会改变环境,一次错误可能数步之后才显现。Qwen3.8-Max 在这方面的能力有提升,但真正成熟还需社区验证。

03实际能力案例 实验室成绩 vs 开发者真实体验

🛠️ 连续 16 天,从零构建开源项目 官方展示

  • Qwen3.8-Max 连续运行约 16 天,从零构建了一个名为 oh-my-cli 的开源项目。
  • 流程:用户反馈与自测结果整理为 Issue → Agent 领取任务 → 代码完成 → 构建/单元测试/端到端测试 → 验证失败则退回修改。
  • Issue 记录任务状态,自动测试提供外部反馈,退回修改对应错误恢复——工程系统与模型协同工作
注意:连续 16 天运行仍不能直接证明长周期能力已成熟。真正需要验证的是模型能否长期保持目标一致、及时发现错误,以及出错后能否恢复。

🧑‍💻 开发者实测:进步明显,但"有点懒" 社区反馈

  • 开发者艾林测试后认为,Qwen3.8-Max 在 任务拆解、Agent 调用、需求理解和 UI 设计 方面均有明显提升。
  • 独立开发者李默感受到编程和复杂任务能力的进步,但在生成交互网站时,模型没有完整实现核心拖动功能,还把 HTML 标签直接显示在页面上。
  • "Qwen3.8-Max 有点懒"——需要把要求拆得非常具体,才能执行到位。稳定性和交付意识尚未完全解决。
个体体验有落差,但共识是:Qwen3.8-Max 已经摸到第一梯队门槛,但还不是默认选择。

04国产旗舰对比 与 Kimi K3 和 DeepSeek V4 Flash 的差距与定位

Qwen3.8-Max 的对标名单已从国内厂商转向海外旗舰,但这不意味着它已甩开国产对手。与同期发布的 Kimi K3DeepSeek V4 Flash 的对比,更能看清它的真实位置。

与 Kimi K3 对比:Qwen3.8-Max 只在工作流智能体任务上超过 Kimi K3,其余项目多数落后。差距较小的主要是终端操作和科学推理,说明基础能力处于相近区间;差距较大的则是深度软件工程和前沿工程任务。

与 DeepSeek V4 Flash 对比:Qwen3.8-Max 在所有可比项目中均占优势,覆盖编程、自动化和工具调用。但 V4 Flash 以更小规模、更低成本取得了"够用"的成绩——这场对比真正的信息量不在输赢,而在价格。

Qwen3.8-Max
12 / 36 输入/输出 · 百万 Token
Kimi K3
高价旗舰 路线 定价高于千问
DeepSeek V4 Flash
低价 路线 轻量模型 · 成本更低
GLM 5.2
中间价位 输入输出均低于千问

如果轻量模型的能力已经够用,中间价位的旗舰就要证明:多出来的能力值这个差价。Qwen3.8-Max 比 Kimi K3 便宜,却在部分复杂编程任务上落后;它的能力高于 DeepSeek V4 Flash,价格差距又远大于能力差距。真正的考验在于稳定性和实际交付质量。

05生态优势与长期挑战

阿里更难被复制的优势在模型之外。从底层算力到应用场景,阿里已经构建了一条完整的链路:

阿里云千问平台模型开发钉钉企业客户

企业采购的不只是一项模型能力,还包括算力、数据存储、权限管理、安全合规、部署运维和服务保障。阿里能够把这些环节打包提供,把模型能力变成一套可以直接采购和部署的服务。对于已经使用阿里云或钉钉的企业,接入千问的迁移成本更低。

但生态不能替代模型能力。企业越来越倾向于在同一系统中调用多个模型,哪个效果更好、价格更低,就把任务分配给哪个。平台越开放,模型被替换也越容易。如果千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。

阿里云 AI 云市场第一 千问 企业级调用第一 钉钉办公场景 电商与客服 开源生态 27B 多模态覆盖
编辑核心判断

模型能力决定入场券,价格决定尝试意愿,生态决定留存——三者缺一不可。千问的竞争壁垒已不在单一模型,而在于模型、算力与应用的协同交付。但若模型长期落后于第一梯队,生态只能延缓流失,无法消除差距。

现在就能用

Qwen3.8-Max 已通过千问 AI 平台开放 API 服务,开发者可直接调用。27B 小尺寸模型即将开源,为本地部署提供更多选择。

千问 AI 平台 → 立即体验