🚀 模型 · 旗舰发布

Qwen3.8-Max 登场:2.4万亿参数,自主编程16天,市值暴涨1300亿

8月3日,阿里正式发布旗舰大模型 Qwen3.8-Max,总参数达 2.4万亿,激活参数950亿。这是千问首个计划开放权重的Max级模型。发布当天,阿里港股上涨7.26%,市值增加约1300亿港元。

综合公开信息整理 2026-08-03 全文约 4 分钟读完
#阿里千问 #Qwen3.8-Max #2.4万亿参数 #长程Agent #开源权重
2.4 万亿 总参数量 · 千问史上最大
+7.26% 阿里港股当日涨幅
16 天 连续自主编程纪录

⚡ 30 秒速览

  • 参数规模:总参数 2.4 万亿,激活 950 亿,计划开放权重。
  • 长程能力:连续自主编程约 16 天,管理 265 次提交、127 个 PR;125 小时复现并改进论文。
  • 基准成绩:PaperBench 93.0 分,OSWorld-Verified 86.1 分(第一),CAD 91.5 分,均超越或持平 GPT-5.6 Sol、Fable 5。
  • 短板:SWE-bench Pro 67.7 分(低于 Fable 5 的 80.0),TerminalBench 2.1 略低于 GPT-5.6 Sol。
  • 可用性:已上线千问平台,权重下周登陆 Hugging Face 与 ModelScope。

01旗舰登场 2.4万亿参数,开源可期

Qwen3.8-Max 的发布,是千问系列迄今为止最大的一次迭代。总参数 2.4万亿,激活参数 950 亿,聚焦编程、办公、科研、长程任务和多模态智能体五大方向。相比 Qwen3.7-Max,新模型不再只是“回答问题”,而是强调端到端完成复杂任务。

一个诚实的注脚:

它并非在所有测试中领先。在 TerminalBench 2.1 中得分 86.6,略低于 GPT-5.6 Sol 的 88.8;SWE-bench Pro 67.7 分,落后于 Fable 5 的 80.0 和 Claude Opus 4.8 的 69.2;长视频基准 VideoMME v2 中 68.3 分,低于 GPT-5.6 Sol 的 71.1。但它在 论文复现、电脑操作、CAD 和文档理解 等维度上,已经逼近甚至超越当前最强的闭源模型。

93.0PaperBench 论文复现
86.1OSWorld-Verified 电脑操作
91.5参数化 CAD 基准
67.7SWE-bench Pro

注:以上分数均为官方公布。PaperBench 中 Qwen3.8-Max 超过 GPT-5.6 Sol、Fable 5;OSWorld-Verified 中位列参评模型第一。SWE-bench Pro 仍落后于 Fable 5 和 Claude Opus 4.8。

02长程任务:16天自主编程,125小时复现论文

千问团队用几个极端案例来证明 Qwen3.8-Max 的“长程交付”能力——不是跑一个脚本,而是管理一个持续演化的项目。

💻 连续自主编程 16 天 265 commits

  • 从零创建 oh-my-cli 项目,搭建自进化 Agent 开发系统,包含完整任务状态机。
  • 模型自动处理 Issue、领取任务、修改代码、运行测试、提交 PR,无人持续介入。
  • 截至 7 月 30 日,累计 265 次代码提交、127 个 PR、151 个 Issue。
考察点:模型能否管理一个持续变化的工程项目,而非一次性输出。

📄 125 小时复现并改进论文 7600 行代码

  • 从零复现《Unified Data Selection for LLM Reasoning》,无初始代码和实验流水线。
  • 前 37 小时复现六项主要结论,新方法在 AIME 2024 上比随机选择高 7.7 个百分点
  • 后续 88 小时提出 18 种改进方案,最终将成绩再提升 2.7 分
模型不仅复现,还自主提出并验证了改进假设。

🏆 击败 87% 人类队伍 45 次提交

  • 参加阿里云天池 WWW 2025 多模态对话意图识别挑战赛,与 526 支人类队伍 竞争。
  • 24 小时内自行搭建文本模型、视觉模型和加权投票系统,准确率从 0.60 提升至 0.853
  • 最终击败 458 支队伍,超过参赛总数的 87%。

注:以上案例均为千问团队官方公布,评测细节以后续开源代码为准。

03它能做什么?从芯片设计到电商经营

除了编程和科研,Qwen3.8-Max 在专业领域的表现同样值得关注。以下两个案例展示了它的“跨天执行”和“多智能体调度”能力。

🔬 芯片设计:500 轮迭代,门数从 8298 降至 678

  • 设计一款 GCD/RSA 硬件加速器,初始材料只有任务说明和 RTL 接口骨架。
  • 经历约 500 轮交互、71 次正式评估,第一个通过验证的版本需要 8298 个门。
  • 第 22 轮将 16 位硬件取模除法器替换为迭代移位减法架构,门数一次减少 6288 个。
  • 最终版本仅 678 个门,芯片面积缩小 81%,在 500MHz 下实现时序闭合。
模型在数百轮交互后仍能进行算法级修改,而非仅修补语法错误。

🏪 电商经营:4.16 倍资金增长,超第二名 38%

  • E-Commerce Bench 模拟 365 天经营,包含 12 种店铺、60 个品类、近 600 家供应商。
  • 模型获得 10 万元启动资金,需自行选品、采购、定价、退货,并应对台风、欺诈等随机事件。
  • 在超过 2000 轮交互 后,最终获得 416,252 元现金,为初始资金的 4.16 倍
  • 成绩比第二名 GLM 5.2 高 38%,相比 Qwen3.7-Max 提高 152%。

这些案例共同指向一个方向:模型正在尝试能否在较少人工干预下,持续处理反馈并完成开放任务。

04为什么能做到?系统工程 + 强化学习环境

答案不复杂:千问团队为强化学习搭建了大规模真实任务环境,覆盖 QwenWork、Claude Code、Codex、OpenClaw 等多种 Agent 框架。这些训练环境不再只包含单文件、单步骤任务,而是加入多文件目录、跨天执行以及不同版本的工具和 Skill。

为了让模型在大量任务中获得相对统一的反馈,团队搭建了一套通用奖励系统,同时检查程序执行结果、文本质量、视觉渲染效果和 Agent 操作过程。这种“系统工程”思维,让模型在长程任务中的表现显著提升。

接收意图拆解任务调用工具验证结果自我修正

Qwen3.8-Max 还展示了大规模子 Agent 调度能力:在量化研究案例中,它仅根据六条因子描述,调度约 330 个子 Agent,完成约 6000 次回测,并根据阶段性结果调整搜索方向。最终入选因子的超额夏普比率介于 0.64 至 1.48 之间。

编辑核心判断

长程 Agent 能力正在成为旗舰模型的分水岭。参数规模仍是基础,但“能否自主完成一个跨天任务”才是下一轮竞争的关键。

05怎么判断?开源权重下周见

Qwen3.8-Max 的升级方向相当明确:参数规模继续扩大,但模型能力更多围绕复杂任务的实际交付展开。连续运行 16 天维护代码仓库、125 小时复现并改进论文、调度 330 个子 Agent 完成 6000 次回测——这些案例都反映出:模型正在尝试能否在较少人工干预下,持续处理反馈并完成开放任务。

从测试结果来看,Qwen3.8-Max 已经在论文复现、电脑操作、CAD、文档理解和部分多模态任务中达到前沿水平;在 SWE-bench Pro、TerminalB ench 2.1 和部分长视频测试中,它与最新闭源模型仍有差距。

下周开放权重后,开发者将能进一步检验其真实能力,包括 2.4 万亿参数模型的部署成本、Agent 长时间运行的稳定性,以及内部案例能否在外部环境中复现。

编辑核心判断

开源旗舰的竞争正在从“参数竞赛”转向“长程交付竞赛”。谁能用更少的提示词、更少的人工干预,把一件需要数天完成的事做好,谁就能定义下一代模型的标准。

现在就能用

Qwen3.8-Max 已上线千问 AI 平台,模型权重下周登陆 Hugging Face 与 ModelScope。

chat.qwen.ai → 选择 Qwen3.8-Max