🚀 大模型 · 架构演进

阿里 Qwen3.8 正式发布:2.4T 参数规模,自主编程 16 天“自建” Hermes 级智能体

8 月 3 日,阿里正式发布新一代旗舰基座大模型 Qwen3.8-Max。模型采用稀疏 MoE 架构拓展至 2.4 万亿总参数,在 Coding 和 Cowork 场景实现大幅跃升,并同步公测企业级 Agent 产品「千问办公」

来源:综合公开信息整理 2026-08-03 全文约 3 分钟读完
#阿里Qwen3.8 #2.4T大模型 #自主编程 #千问办公
2.4T 总参数量 · 激活 95B
16 从零自主跑完工程交付
1M 上下文 Tokens 长度

⚡ 30 秒速览

  • 模型能力:Qwen3.8-Max 在权威 Arena 榜单中位列全球大模型前列,仅次于 Claude 系列,视觉推理与电脑操作评测(OSWorld)居主流模型首位。
  • 自主编程突破:无需人工干预,从空文件夹起步自主运行 16 天,搭建出 Hermes 级自进化智能体项目「oh-my-cli」,过程已全量开源。
  • 企业级落地方案:同步公测 Agent 产品「千问办公」,支持百页财报理解、超百小时长视频拆解及复杂金融/法务长流程交付。
  • 部署与性价比:国内 API 每百万 Tokens 输入 12 元、输出 36 元;国际价格仅为 Opus5 的 24%~40%。下周将开源 27B 及 Max 版本。

01多维基准评测 性能跻身全球第一梯队

在最新的 Arena 综合评测中,阿里 Qwen3.8 整体性能仅次于 Anthropic 的 Claude 系列,进入全球大模型头部阵营。

🥇 Claude 4.5 系列Anthropic
Top 1
🥈 Qwen3.8-Max阿里千问
Top 2
GPT-5 系列OpenAI
Top 3
93.0PaperBench (+28.2)
86.1OSWorld 操作
92.6GPQA Diamond
82.8IF Bench 指令

数据来源:企业发布会披露及第三方评测基准数据。其中 OSWorld-Verified 评估智能体电脑操作能力,Qwen3.8-Max 录得 86.1 分位居主流模型首位。

02从打字回复到长周期交付 16 天自主编程案例

大模型的编程能力正经历质变:从“根据 Prompt 生成代码片段”,转向“基于目标自主执行长周期工程”。

输入单句指令构建 Loop 框架任务拆解与领取16天自适应运行开源项目交付

💻 实验案例:从空文件夹搭建「oh-my-cli」已全量开源

  • 零人工干预:接收“创建一个自进化的智能体 Harness”指令后,模型自主编排工程架构,从零开始搭建循环工程(Loop Engineering)框架。
  • 超长程执行:独立编程运行约 16 天,最终交付了一个 Hermes Agent 级别的自进化智能体项目。
  • 全透明验证:项目代码及完整自主开发过程已保存在 GitHub 仓库,供全球开发者复现。
测试评级:CodeArena 全球第四 · 验证了长程任务中的全栈闭环自适应能力。

03 Cowork 场景实测 复杂专业任务表现

面对高频、高价值的真实办公需求,Qwen3.8 通过真实环境与算力的联合强化学习(RL)扩展,实现了长流程任务的自动化:

传统人工团队处理

法务团队需 1 周完成数百份文档条款标注;体育分析团队需逐帧标注 160+ 小时录像。

Qwen3.8 处理表现

法务任务压缩至 1 小时内;录像拆解数十分钟完成 8400+ 攻防回合分析并输出教练报告。

📈 金融量化:动态 ETF 轮动策略生成闭环回测

  • 自主调动并行智能体,搜集资本市场实时变动数据。
  • 连续工作数小时后交付完整策略,并进行持续分析回测与动态修正

04算力优化与商业化部署

Qwen3.8 采用了稀疏 MoE 架构与混合注意力机制的联合优化,总参数量达 2.4T,但实际推理仅激活 95B 参数,大幅提升了推理速度与算力效率。

在硬件适配方面,真武 M890 超节点已完成对 Qwen3.8 的全链路优化,在 Agentic 推理场景中最高可实现 1.5 倍性能提升

¥12 / ¥36 国内每百万 Tokens (输入/输出)
24% - 40% 国际 API 价格(对比 Opus5)
EDITORS' JUDGMENT

大模型的竞争焦点正在从“单轮对话答题”转向“长周期自主工程交付”。自适应闭环能力与单位 Token 算力成本的结合,将决定 AI 能否真正落地为生产级数字员工。

服务获取方式

Qwen3.8 API 已在千问 AI 平台上线;企业级 Agent 产品「千问办公」现已开放网页版及 PC 客户端公测。

千问办公官网入口:qwenwork.cn