Qwen3.8 正式发布:编程能力自主进化,专业办公全面突破,全球评测仅次于 Claude
8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量达 2.4 万亿,激活参数 95B。旗舰模型 Qwen3.8-Max 在 PaperBench 上以 93.0 分创下编程能力新高,全球综合评测仅次于 Anthropic 的 Claude 系列,正式跻身全球大模型第一梯队。
8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量达 2.4 万亿,激活参数 95B。旗舰模型 Qwen3.8-Max 在 PaperBench 上以 93.0 分创下编程能力新高,全球综合评测仅次于 Anthropic 的 Claude 系列,正式跻身全球大模型第一梯队。
排名只是坐标。真正值得关注的,是这些数字背后的能力跃迁。
注:柱形长度示意排名区间,非精确分数。Arena 综合评测中 Qwen 系列整体表现仅次于 Claude 系列,为全球第二梯队首位。
Qwen3.8 通过 稀疏 MoE 架构与混合注意力机制的联合优化,首次将千问系列总参数量拓展至 2.4T,激活参数 95B,在推理效率与速度上实现双重突破。上下文长度达到 1M Tokens,可一次性处理数百页文档或超长视频。
密集架构,参数规模受限,长上下文处理能力有限,推理成本较高。
稀疏 MoE + 混合注意力,2.4T 总参数 / 95B 激活,1M 上下文,推理速度与效率大幅提升。
关键评测分数一览
注:以上分数均为 Qwen3.8-Max 在对应评测集上的成绩。其中 BabyVision 为无工具条件得分,超出部分主流模型近两倍;OSWorld-Verified 中位居主流模型首位。
一个诚实的注脚:评测高分不等于真实场景的完美表现,但 PaperBench 和 OSWorld 这类「可验证交付物」的评测,比传统选择题式评测更接近真实使用体验。
那么,这些能力在真实任务中意味着什么?
如果说两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手,那么 Qwen3.8 做到的,是 从一个空文件夹出发,自主完成真实项目交付——全程无需人干预。
在权威编程评测 CodeArena 中,Qwen3.8 位居全球第四;在 PaperBench 科研复现评测中,以 93.0 分刷新纪录,较上代提升 28.2 分。这不仅是数字的进步,更意味着模型具备了 「从理解需求到交付成果」 的完整闭环能力。
Qwen3.8 通过真实环境和算力的联合强化学习,在数百种高价值、高频专业任务上实现了可验证的能力提升。以下是三个典型场景:
一支法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间。Qwen3.8 一小时内即可完成,且标注质量经专家复核达到可用标准。
一个数据分析团队逐帧标注 160 小时以上的比赛录像,Qwen3.8 数十分钟即可精准拆解 8400 多个攻防回合,并一次性输出球员战术画像和教练报告。
基于数年专业知识积累,Qwen3.8 自主调动并行智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续分析回测、动态修正,最终实现规模化盈利。
在长周期任务中,Qwen3.8 还涌现出 系统级自主规划与全栈闭环自适应学习能力——无论是在高精密、强物理约束的数字芯片设计,还是在高度动态、博弈激烈的商业模拟运营中,均能通过「执行-反馈-迭代」的自适应闭环,在数千轮超长程交互中实现算法与策略的深度重构。
Qwen3.8 的发布,让行业看到了一条不同于「堆参数」的进化路径:MoE 架构 + 系统工程优化 + 真实场景强化学习的组合,正在释放出惊人的协同效应。
但需要诚实面对的是:2.4T 参数带来的推理成本依然不低,虽然国际定价仅为 Opus5 的 40% 与 24%,但对于高频、长序列任务,实际支出仍需要仔细评估。此外,开源版本 Qwen3.8-Max 和 27B 版本下周才发布,社区复现和生态建设尚需时间。
当模型能力接近天花板时,架构创新与工程优化的价值正在超越参数竞赛。Qwen3.8 证明了「稀疏 MoE + 混合注意力」是一条可行的路径,但真正的考验在于:这种优势能否在持续迭代中保持,以及开源生态能否快速跟上。
Qwen3.8 的 API 已上线千问 AI 平台,并同步接入阿里全新 Agent 产品「千问办公」。国内定价每百万 tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元。
国际价格约为 Opus5 的 40%(输入)与 24%(输出),实现相近智能的更高性价比。
Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B,开发者可持续关注千问官方仓库。
千问 AI 平台 → 立即体验