🚀 模型发布 · 技术突破

Qwen3.8 正式发布:编程能力自主进化,专业办公全面突破,全球评测仅次于 Claude

8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量达 2.4 万亿,激活参数 95B。旗舰模型 Qwen3.8-Max 在 PaperBench 上以 93.0 分创下编程能力新高,全球综合评测仅次于 Anthropic 的 Claude 系列,正式跻身全球大模型第一梯队。

综合公开信息整理 2026-08-03 全文约 3 分钟读完
#Qwen3.8 #阿里巴巴 #大模型 #编程 #办公
2.4T / 95B 总参数量 · 激活参数
93.0 PaperBench 编程评测 · 较上代提升 28.2 分
仅次于 Claude 全球综合评测 · 第一梯队

⚡ 30 秒速览

  • 赢了多少:PaperBench 93.0 分创编程新高,CodeArena 全球第四,Vision Arena 全球第二,综合评测仅次于 Claude 系列。
  • 硬在哪:从空文件夹出发,自主完成十数天真实项目交付,16 天做出可用的自进化智能体框架,全程无需人工干预。
  • 专业办公:法务文档标注一周 → 1 小时,篮球录像分析 160 小时 → 数十分钟,金融策略研究数小时交付。
  • 价格优势:国内 API 输入 12 元 / 百万 tokens,输出 36 元,国际价格仅为 Opus5 的 40% 与 24%。
  • 架构突破:2.4T 总参数 + 混合注意力机制,上下文 1M Tokens,真武 M890 超节点适配带来 1.5 倍性能提升。

排名只是坐标。真正值得关注的,是这些数字背后的能力跃迁。

01全球评测定位 三大权威榜单均居前列

Arena 综合评测全球大模型排名
Top 2
CodeArena 编程榜代码能力专项
#4
Vision Arena 视觉榜多模态理解
#2

注:柱形长度示意排名区间,非精确分数。Arena 综合评测中 Qwen 系列整体表现仅次于 Claude 系列,为全球第二梯队首位。

02架构与性能突破 MoE + 混合注意力,2.4T 参数的新范式

Qwen3.8 通过 稀疏 MoE 架构混合注意力机制的联合优化,首次将千问系列总参数量拓展至 2.4T,激活参数 95B,在推理效率与速度上实现双重突破。上下文长度达到 1M Tokens,可一次性处理数百页文档或超长视频。

上一代旗舰模型

密集架构,参数规模受限,长上下文处理能力有限,推理成本较高。

Qwen3.8-Max

稀疏 MoE + 混合注意力,2.4T 总参数 / 95B 激活,1M 上下文,推理速度与效率大幅提升。

关键评测分数一览

93.0PaperBench
编程智能体
92.6GPQA Diamond
科学推理
82.8IF Bench
指令遵循
86.1OSWorld
电脑操作
82.0BabyVision
视觉推理

注:以上分数均为 Qwen3.8-Max 在对应评测集上的成绩。其中 BabyVision 为无工具条件得分,超出部分主流模型近两倍;OSWorld-Verified 中位居主流模型首位。

一个诚实的注脚:评测高分不等于真实场景的完美表现,但 PaperBench 和 OSWorld 这类「可验证交付物」的评测,比传统选择题式评测更接近真实使用体验。

那么,这些能力在真实任务中意味着什么?

03编程能力:从零到交付,16 天自主进化

如果说两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手,那么 Qwen3.8 做到的,是 从一个空文件夹出发,自主完成真实项目交付——全程无需人干预。

🤖 从零创建自进化智能体框架 标杆案例

  • 仅一句指令:「创建一个自进化的智能体 Harness」——Agent 从空文件夹起步,自主搭建循环工程框架。
  • 自主编排:自动设计智能体领取和执行任务的机制,并通过钉钉实时响应人类工程师的新要求。
  • 16 天不间断运行:连续自主编程,最终交付真实可用的自进化智能体框架 「oh-my-cli」,达到 Hermes Agent 级别。
  • 完全开源:完整过程公开保存在 GitHub 仓库,可供任何人查看、复现。
全部执行快照、交付物、迭代日志均已公开,可逐条验证

在权威编程评测 CodeArena 中,Qwen3.8 位居全球第四;在 PaperBench 科研复现评测中,以 93.0 分刷新纪录,较上代提升 28.2 分。这不仅是数字的进步,更意味着模型具备了 「从理解需求到交付成果」 的完整闭环能力。

04专业办公:数百种高价值任务的真实提效

Qwen3.8 通过真实环境和算力的联合强化学习,在数百种高价值、高频专业任务上实现了可验证的能力提升。以下是三个典型场景:

⚖️

法务文档标注 1 小时 vs 1 周

一支法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间。Qwen3.8 一小时内即可完成,且标注质量经专家复核达到可用标准。

🏀

篮球比赛录像分析 数十分钟 vs 160 小时

一个数据分析团队逐帧标注 160 小时以上的比赛录像,Qwen3.8 数十分钟即可精准拆解 8400 多个攻防回合,并一次性输出球员战术画像和教练报告。

📈

量化策略研究 数小时交付完整策略

基于数年专业知识积累,Qwen3.8 自主调动并行智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续分析回测、动态修正,最终实现规模化盈利。

在长周期任务中,Qwen3.8 还涌现出 系统级自主规划与全栈闭环自适应学习能力——无论是在高精密、强物理约束的数字芯片设计,还是在高度动态、博弈激烈的商业模拟运营中,均能通过「执行-反馈-迭代」的自适应闭环,在数千轮超长程交互中实现算法与策略的深度重构。

05编辑核心判断

Qwen3.8 的发布,让行业看到了一条不同于「堆参数」的进化路径:MoE 架构 + 系统工程优化 + 真实场景强化学习的组合,正在释放出惊人的协同效应。

但需要诚实面对的是:2.4T 参数带来的推理成本依然不低,虽然国际定价仅为 Opus5 的 40% 与 24%,但对于高频、长序列任务,实际支出仍需要仔细评估。此外,开源版本 Qwen3.8-Max 和 27B 版本下周才发布,社区复现和生态建设尚需时间。

编辑核心判断

当模型能力接近天花板时,架构创新与工程优化的价值正在超越参数竞赛。Qwen3.8 证明了「稀疏 MoE + 混合注意力」是一条可行的路径,但真正的考验在于:这种优势能否在持续迭代中保持,以及开源生态能否快速跟上。

现在就能用

Qwen3.8 的 API 已上线千问 AI 平台,并同步接入阿里全新 Agent 产品「千问办公」。国内定价每百万 tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元。

12 输入 / 百万 tokens 国内
36 输出 / 百万 tokens 国内
1.5 隐式缓存命中 国内

国际价格约为 Opus5 的 40%(输入)与 24%(输出),实现相近智能的更高性价比。

Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B,开发者可持续关注千问官方仓库。

千问 AI 平台 → 立即体验