🚀 模型 · 开源发布

通义千问发布 Qwen3-Coder:480B MoE 开源模型 Agent 能力登顶,媲美 Claude Sonnet 4

7 月 21 日,通义千问正式发布 Qwen3-Coder 系列。最强版本 Qwen3-Coder-480B-A35B-Instruct 在 Agentic Coding、Browser-Use 和 Tool-Use 三大维度均取得开源模型 SOTA,综合能力可与 Anthropic 闭源标杆 Claude Sonnet 4 正面抗衡。

来源:综合公开信息整理 2026-07-22 全文约 4 分钟读完
#通义千问 #Qwen3-Coder #AI Agent #开源模型 #MoE
480B / 35B 总参 / 激活参数 · MoE 架构
256K→1M 原生上下文 · YaRN 可扩展
7.5T 训练数据 · 70% 代码
⚡ 30 秒速览
  • 什么水平:Agentic Coding / Browser-Use / Tool-Use 三大能力均达开源 SOTA,综合表现媲美 Claude Sonnet 4,SWE-bench Verified 开源第一。
  • 架构规格:480B 总参数、35B 激活的 MoE 模型,原生 256K 上下文,可扩展至 1M token,专为仓库级代码与长程 Agent 任务设计。
  • 技术路线:7.5T 代码数据预训练(70% 代码)+ Code RL(Hard to Solve, Easy to Verify)+ Long-Horizon Agent RL,后训练同时运行 20k 独立环境
  • 立刻能用:开源 CLI 工具 Qwen Code 已发布,同时支持接入 Claude Code、Cline 等主流编程工具,可通过阿里云百炼 API 直接调用。
  • 深层信号:开源代码模型在 Agent 能力上首次逼近闭源第一梯队,系统工程与 RL 训练基础设施的投入正在成为关键分水岭。
模型权重与评测流程已在社区开源,可复现验证。

01能力全景 四大维度均列开源榜首

Qwen3-Coder-480B-A35B-Instruct 在四个核心能力维度上均达到开源模型最高水平。这不是单一指标的领先,而是「代码生成 + 工具使用 + 环境交互」的综合能力跃升

🤖 Agentic Coding
开源 SOTA TOP 1
媲美 Claude Sonnet 4
🌐 Agentic Browser-Use
开源 SOTA
领先其他开源模型 12%+
🔧 Agentic Tool-Use
开源 SOTA
接近闭源最佳水平
🧪 SWE-bench Verified
开源 SOTA
开源模型首次突破关键阈值

注:以上对比基于公开评测数据。Agentic 能力评测涵盖多轮交互、工具调用、结果验证等维度,非单一代码生成指标。

但参数只是起点。真正让开发者兴奋的,是它「能用」——不是一个躺在论文里的模型,而是一个可以直接写进开发流程的工具。

02技术突破 预训练 + 后训练,双线 Scaling

Qwen3-Coder 的技术路线清晰而直接:在预训练阶段堆数据质量,在后训练阶段用 RL 释放 Agent 潜力。

预训练:三大扩展策略

7.5T总训练数据
70%代码占比
256K原生上下文
1MYaRN 扩展

合成数据扩展:利用 Qwen2.5-Coder 对低质数据清洗与重写,显著提升整体数据质量。

后训练:两层 RL 递进

传统代码 RL

聚焦竞赛类编程题,验证简单,但距离真实工程场景远。

Qwen 方法:Code RL + Agent RL

在真实代码任务上扩展 RL,自动构造测试样例;再通过 Long-Horizon RL 让模型在环境中自主规划、调用工具、迭代决策。

一个关键的工程细节:Qwen 团队实现了同时运行 20,000 个独立环境的 RL 基础设施,依托阿里云为大规模强化学习提供反馈和评测。这套系统直接支撑了 SWE-bench Verified 上的开源 SOTA 成绩。

—— 基础设施的投入,正在成为模型能力的隐形护城河。

03开发者工具链 三种方式,即刻上手

Qwen3-Coder 的价值不仅在于模型本身,更在于它已经嵌入到开发者熟悉的工具中。无需等待,现在就能用。

🖥️ Qwen Code CLI 官方推荐

  • 基于 Gemini Code 二次开发,针对 Qwen3-Coder 系列增强了解析器和工具支持。
  • 通过 npm 一键安装,支持 OpenAI SDK 调用,配置 API Key 即可使用。
  • 在终端中直接执行:自然语言描述需求 → Agent 自主完成编码任务
适合场景:日常开发、快速原型、代码重构。安装即用,零配置门槛。

🔄 Claude Code 集成 无缝替换

  • 将 Claude Code 的 backend 替换为 Qwen3-Coder,保留熟悉的交互界面。
  • 通过阿里云百炼提供的代理 API 或第三方路由工具 claude-code-router 接入。
  • 开发者无需改变工作流,即可获得 Qwen3-Coder 的代码能力。
适合场景:已习惯 Claude Code 的开发者,希望尝试开源模型能力。

🧩 Cline 开源生态 灵活扩展

  • 在 Cline 配置中选择 OpenAI Compatible 模式,填入百炼 API 地址与模型名。
  • 支持自定义基础 URL 与模型参数,完全适配 qwen3-coder-plus
  • 融入开源 Agent 编程生态,与其他工具链自由组合。
适合场景:追求灵活配置、希望深度定制开发流程的团队。

04它到底能做什么?三个典型场景

从物理模拟到网页开发,从游戏制作到测试工具——Qwen3-Coder 展示的是 「理解需求 → 自主编程 → 交付可运行结果」的完整闭环。

🎮

从零构建物理模拟

「创建一个基于物理引擎的烟囱爆破仿真,支持可控爆炸点与碎片轨迹。」——Agent 自主完成物理引擎选型、场景搭建、交互控制,输出可直接运行的 HTML 应用。

🌐

一句话生成网页应用

「帮我创建一个在线书店的网页,包含商品展示、购物车和结算功能。」——从 UI 到交互逻辑,Agent 自主拆解任务链,一次性交付完整站点。

测试工具即时生成

「用一段名人名言测试我的打字速度,显示 WPM 和准确率。」——Agent 理解需求后自主编码,生成带有实时统计的打字测试工具,零人工干预。

以上场景均来自 Qwen3-Coder 实际演示案例,展示 Agent 在真实需求下的自主编程能力。

05为什么是现在?

答案藏在两个趋势的交汇点:代码数据的 Scaling 红利尚未耗尽,但 RL 基础设施的 Scaling 正在成为新战场。

Qwen3-Coder 的 7.5T 训练数据中 70% 是代码,这是「数据扩展」的延续。但真正让它与众不同的,是后训练阶段同时运行 20,000 个环境的 RL 基础设施——这个数字背后是工程投入的规模级差异。

一个诚实的注脚:开源模型与闭源标杆的差距正在急剧缩小,但「缩小」不等于「消失」。在长尾工具调用、极端上下文理解、复杂多步规划等维度,Qwen3-Coder 仍有提升空间。开源社区的优势在于迭代速度——权重已发布,全球开发者都能参与改进。

编辑核心判断

Agent 时代,代码模型的能力上限不再只取决于参数量与训练数据,而越来越取决于「RL 基础设施的工程规模」——谁能用更高效的环境生成、更可靠的反馈信号、更大规模的并行训练,谁就能让模型在真实世界中真正「做对事」。

现在就能用

Qwen3-Coder 已通过阿里云百炼平台开放 API 调用,模型权重已在社区开源。
开发者可通过 Qwen Code CLI、Claude Code 或 Cline 等工具立即体验。

阿里云百炼 → 申请 API Key

开源社区可获取模型权重与评测流程,自行部署与验证。