Qwen3.8-Max 登场:2.4万亿参数,自主编程16天,市值暴涨1300亿
8月3日,阿里正式发布旗舰大模型 Qwen3.8-Max,总参数达 2.4万亿,激活参数950亿。这是千问首个计划开放权重的Max级模型。发布当天,阿里港股上涨7.26%,市值增加约1300亿港元。
8月3日,阿里正式发布旗舰大模型 Qwen3.8-Max,总参数达 2.4万亿,激活参数950亿。这是千问首个计划开放权重的Max级模型。发布当天,阿里港股上涨7.26%,市值增加约1300亿港元。
Qwen3.8-Max 的发布,是千问系列迄今为止最大的一次迭代。总参数 2.4万亿,激活参数 950 亿,聚焦编程、办公、科研、长程任务和多模态智能体五大方向。相比 Qwen3.7-Max,新模型不再只是“回答问题”,而是强调端到端完成复杂任务。
一个诚实的注脚:
它并非在所有测试中领先。在 TerminalBench 2.1 中得分 86.6,略低于 GPT-5.6 Sol 的 88.8;SWE-bench Pro 67.7 分,落后于 Fable 5 的 80.0 和 Claude Opus 4.8 的 69.2;长视频基准 VideoMME v2 中 68.3 分,低于 GPT-5.6 Sol 的 71.1。但它在 论文复现、电脑操作、CAD 和文档理解 等维度上,已经逼近甚至超越当前最强的闭源模型。
注:以上分数均为官方公布。PaperBench 中 Qwen3.8-Max 超过 GPT-5.6 Sol、Fable 5;OSWorld-Verified 中位列参评模型第一。SWE-bench Pro 仍落后于 Fable 5 和 Claude Opus 4.8。
千问团队用几个极端案例来证明 Qwen3.8-Max 的“长程交付”能力——不是跑一个脚本,而是管理一个持续演化的项目。
注:以上案例均为千问团队官方公布,评测细节以后续开源代码为准。
除了编程和科研,Qwen3.8-Max 在专业领域的表现同样值得关注。以下两个案例展示了它的“跨天执行”和“多智能体调度”能力。
这些案例共同指向一个方向:模型正在尝试能否在较少人工干预下,持续处理反馈并完成开放任务。
答案不复杂:千问团队为强化学习搭建了大规模真实任务环境,覆盖 QwenWork、Claude Code、Codex、OpenClaw 等多种 Agent 框架。这些训练环境不再只包含单文件、单步骤任务,而是加入多文件目录、跨天执行以及不同版本的工具和 Skill。
为了让模型在大量任务中获得相对统一的反馈,团队搭建了一套通用奖励系统,同时检查程序执行结果、文本质量、视觉渲染效果和 Agent 操作过程。这种“系统工程”思维,让模型在长程任务中的表现显著提升。
Qwen3.8-Max 还展示了大规模子 Agent 调度能力:在量化研究案例中,它仅根据六条因子描述,调度约 330 个子 Agent,完成约 6000 次回测,并根据阶段性结果调整搜索方向。最终入选因子的超额夏普比率介于 0.64 至 1.48 之间。
长程 Agent 能力正在成为旗舰模型的分水岭。参数规模仍是基础,但“能否自主完成一个跨天任务”才是下一轮竞争的关键。
Qwen3.8-Max 的升级方向相当明确:参数规模继续扩大,但模型能力更多围绕复杂任务的实际交付展开。连续运行 16 天维护代码仓库、125 小时复现并改进论文、调度 330 个子 Agent 完成 6000 次回测——这些案例都反映出:模型正在尝试能否在较少人工干预下,持续处理反馈并完成开放任务。
从测试结果来看,Qwen3.8-Max 已经在论文复现、电脑操作、CAD、文档理解和部分多模态任务中达到前沿水平;在 SWE-bench Pro、TerminalB ench 2.1 和部分长视频测试中,它与最新闭源模型仍有差距。
下周开放权重后,开发者将能进一步检验其真实能力,包括 2.4 万亿参数模型的部署成本、Agent 长时间运行的稳定性,以及内部案例能否在外部环境中复现。
开源旗舰的竞争正在从“参数竞赛”转向“长程交付竞赛”。谁能用更少的提示词、更少的人工干预,把一件需要数天完成的事做好,谁就能定义下一代模型的标准。
Qwen3.8-Max 已上线千问 AI 平台,模型权重下周登陆 Hugging Face 与 ModelScope。
chat.qwen.ai → 选择 Qwen3.8-Max