通义千问发布 Qwen3-Coder:480B MoE 开源模型 Agent 能力登顶,媲美 Claude Sonnet 4
7 月 21 日,通义千问正式发布 Qwen3-Coder 系列。最强版本 Qwen3-Coder-480B-A35B-Instruct 在 Agentic Coding、Browser-Use 和 Tool-Use 三大维度均取得开源模型 SOTA,综合能力可与 Anthropic 闭源标杆 Claude Sonnet 4 正面抗衡。
7 月 21 日,通义千问正式发布 Qwen3-Coder 系列。最强版本 Qwen3-Coder-480B-A35B-Instruct 在 Agentic Coding、Browser-Use 和 Tool-Use 三大维度均取得开源模型 SOTA,综合能力可与 Anthropic 闭源标杆 Claude Sonnet 4 正面抗衡。
Qwen3-Coder-480B-A35B-Instruct 在四个核心能力维度上均达到开源模型最高水平。这不是单一指标的领先,而是「代码生成 + 工具使用 + 环境交互」的综合能力跃升。
注:以上对比基于公开评测数据。Agentic 能力评测涵盖多轮交互、工具调用、结果验证等维度,非单一代码生成指标。
但参数只是起点。真正让开发者兴奋的,是它「能用」——不是一个躺在论文里的模型,而是一个可以直接写进开发流程的工具。
Qwen3-Coder 的技术路线清晰而直接:在预训练阶段堆数据质量,在后训练阶段用 RL 释放 Agent 潜力。
合成数据扩展:利用 Qwen2.5-Coder 对低质数据清洗与重写,显著提升整体数据质量。
聚焦竞赛类编程题,验证简单,但距离真实工程场景远。
在真实代码任务上扩展 RL,自动构造测试样例;再通过 Long-Horizon RL 让模型在环境中自主规划、调用工具、迭代决策。
一个关键的工程细节:Qwen 团队实现了同时运行 20,000 个独立环境的 RL 基础设施,依托阿里云为大规模强化学习提供反馈和评测。这套系统直接支撑了 SWE-bench Verified 上的开源 SOTA 成绩。
—— 基础设施的投入,正在成为模型能力的隐形护城河。
Qwen3-Coder 的价值不仅在于模型本身,更在于它已经嵌入到开发者熟悉的工具中。无需等待,现在就能用。
从物理模拟到网页开发,从游戏制作到测试工具——Qwen3-Coder 展示的是 「理解需求 → 自主编程 → 交付可运行结果」的完整闭环。
「创建一个基于物理引擎的烟囱爆破仿真,支持可控爆炸点与碎片轨迹。」——Agent 自主完成物理引擎选型、场景搭建、交互控制,输出可直接运行的 HTML 应用。
「帮我创建一个在线书店的网页,包含商品展示、购物车和结算功能。」——从 UI 到交互逻辑,Agent 自主拆解任务链,一次性交付完整站点。
「用一段名人名言测试我的打字速度,显示 WPM 和准确率。」——Agent 理解需求后自主编码,生成带有实时统计的打字测试工具,零人工干预。
以上场景均来自 Qwen3-Coder 实际演示案例,展示 Agent 在真实需求下的自主编程能力。
答案藏在两个趋势的交汇点:代码数据的 Scaling 红利尚未耗尽,但 RL 基础设施的 Scaling 正在成为新战场。
Qwen3-Coder 的 7.5T 训练数据中 70% 是代码,这是「数据扩展」的延续。但真正让它与众不同的,是后训练阶段同时运行 20,000 个环境的 RL 基础设施——这个数字背后是工程投入的规模级差异。
一个诚实的注脚:开源模型与闭源标杆的差距正在急剧缩小,但「缩小」不等于「消失」。在长尾工具调用、极端上下文理解、复杂多步规划等维度,Qwen3-Coder 仍有提升空间。开源社区的优势在于迭代速度——权重已发布,全球开发者都能参与改进。
Agent 时代,代码模型的能力上限不再只取决于参数量与训练数据,而越来越取决于「RL 基础设施的工程规模」——谁能用更高效的环境生成、更可靠的反馈信号、更大规模的并行训练,谁就能让模型在真实世界中真正「做对事」。
Qwen3-Coder 已通过阿里云百炼平台开放 API 调用,模型权重已在社区开源。
开发者可通过 Qwen Code CLI、Claude Code 或 Cline 等工具立即体验。
开源社区可获取模型权重与评测流程,自行部署与验证。