千问 Qwen3.8-Max 正式发布:2.4万亿参数旗舰,多项基准超越海外模型,真实工程仍存差距
8 月 3 日,阿里正式发布 Qwen3.8-Max,参数规模达 2.4 万亿,支持 100 万 Token 上下文。科研编程与 Agent 任务大幅跃升,PaperBench 从 64.8 分跃至 93 分,但 SWE-bench Pro 仍落后 Fable 5 约 12 分,真实软件工程能力尚存短板。
8 月 3 日,阿里正式发布 Qwen3.8-Max,参数规模达 2.4 万亿,支持 100 万 Token 上下文。科研编程与 Agent 任务大幅跃升,PaperBench 从 64.8 分跃至 93 分,但 SWE-bench Pro 仍落后 Fable 5 约 12 分,真实软件工程能力尚存短板。
千问官方将 Fable 5、Opus 4.8 和 GPT-5.6 Sol 等海外旗舰作为对标对象。从结果看,Qwen3.8-Max 进步明显,但尚未全面领先。
注:柱形宽度按比例缩放,PaperBench 以 Qwen3.8-Max 得分 93 为基准标定 100%,其余项目依此比例呈现。SWE-bench 对比显示,Qwen3.8-Max 在真实代码仓库中的跨文件修改与稳定性仍有差距。
一个诚实的注脚:官方编程基准成绩较好,但 Arena 用户盲选榜单中,Qwen3.8-Max 在 Code Arena 排名第四,比榜首低 37 分。前者反映解题与工程任务能力,后者更侧重生成结果的视觉效果与用户偏好——跑分与口碑之间,存在温差。
Qwen3.8-Max 的提升集中在需要 任务拆解、工具调用与连续执行 的场景,而在需要 全局理解与稳定修改 的真实工程项目中,仍与最强模型有距离。
PaperBench:64.8 → 93 分,理解论文并复现实验的能力大幅提升。
Agents' Last Exam:11.8% → 27%,多步 Agent 任务通过率翻倍。
工作流智能体:在与 Kimi K3 的对比中,该项唯一反超。
SWE-bench Pro:67.7 分,低于 Fable 5 约 12 分。
深度软件工程:跨文件修改、避免引入新问题,稳定性不足。
复杂工具调用:动态环境中的连续操作仍是短板。
大模型从业者王楠将长周期任务的难点概括为:远距离规划、状态追踪和错误恢复。每一步操作都会改变环境,一次错误可能数步之后才显现。Qwen3.8-Max 在这方面的能力有提升,但真正成熟还需社区验证。
Qwen3.8-Max 的对标名单已从国内厂商转向海外旗舰,但这不意味着它已甩开国产对手。与同期发布的 Kimi K3 和 DeepSeek V4 Flash 的对比,更能看清它的真实位置。
与 Kimi K3 对比:Qwen3.8-Max 只在工作流智能体任务上超过 Kimi K3,其余项目多数落后。差距较小的主要是终端操作和科学推理,说明基础能力处于相近区间;差距较大的则是深度软件工程和前沿工程任务。
与 DeepSeek V4 Flash 对比:Qwen3.8-Max 在所有可比项目中均占优势,覆盖编程、自动化和工具调用。但 V4 Flash 以更小规模、更低成本取得了"够用"的成绩——这场对比真正的信息量不在输赢,而在价格。
如果轻量模型的能力已经够用,中间价位的旗舰就要证明:多出来的能力值这个差价。Qwen3.8-Max 比 Kimi K3 便宜,却在部分复杂编程任务上落后;它的能力高于 DeepSeek V4 Flash,价格差距又远大于能力差距。真正的考验在于稳定性和实际交付质量。
阿里更难被复制的优势在模型之外。从底层算力到应用场景,阿里已经构建了一条完整的链路:
企业采购的不只是一项模型能力,还包括算力、数据存储、权限管理、安全合规、部署运维和服务保障。阿里能够把这些环节打包提供,把模型能力变成一套可以直接采购和部署的服务。对于已经使用阿里云或钉钉的企业,接入千问的迁移成本更低。
但生态不能替代模型能力。企业越来越倾向于在同一系统中调用多个模型,哪个效果更好、价格更低,就把任务分配给哪个。平台越开放,模型被替换也越容易。如果千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。
模型能力决定入场券,价格决定尝试意愿,生态决定留存——三者缺一不可。千问的竞争壁垒已不在单一模型,而在于模型、算力与应用的协同交付。但若模型长期落后于第一梯队,生态只能延缓流失,无法消除差距。
Qwen3.8-Max 已通过千问 AI 平台开放 API 服务,开发者可直接调用。27B 小尺寸模型即将开源,为本地部署提供更多选择。
千问 AI 平台 → 立即体验