🧪 算法 · 强化学习

GSPO 算法发布:序列级优化终结 RL 训练崩溃,Qwen3 率先受益

通义千问团队提出 Group Sequence Policy Optimization (GSPO),在序列层面定义重要性比率并执行优化,从根本上解决了 GRPO 等算法在长期训练中的不稳定性与模型崩溃问题。GSPO 已成功应用于 Qwen3 全系列(Instruct / Coder / Thinking),训练效率显著提升,且彻底消除了 MoE 模型 RL 训练对 Routing Replay 策略的依赖。

综合公开信息整理 2025-07-22 全文约 4 分钟读完
#GSPO #强化学习 #Qwen3 #MoE #RL Scaling
🧠 序列级优化 GSPO 核心:在序列而非 token 层面定义重要性比率
稳定收敛 彻底解决 MoE 模型 RL 训练崩溃,无需 Routing Replay
✅ 已落地 Qwen3-Instruct / Coder / Thinking 全系受益

⚡ 30 秒速览

  • 核心突破:GSPO 在序列级别定义重要性比率并进行裁剪与优化,从根本上解决了 GRPO 在长期训练中的不稳定性与模型崩溃问题。
  • 效率领先:同等计算开销下,GSPO 训练效率显著高于 GRPO,且可通过增加算力获得持续性能提升——RL Scaling 真正可落地。
  • MoE 不再崩溃:彻底解决了混合专家模型的专家激活波动性问题,无需 Routing Replay 策略,训练更稳定,模型容量发挥更充分。
  • 基础设施友好:序列级优化对精度容忍度更高,可直接使用推理引擎返回的似然进行优化,有望简化训推分离框架与多轮 RL 的基础设施。
  • 已大规模验证:GSPO 成功应用于 Qwen3-30B-A3B-Base 及更大规模模型,在 AIME'24、LiveCodeBench、CodeForces 等基准上持续领先。

01两种范式,两种命运 Token 级 vs 序列级

GRPO 是当前主流的语言模型 RL 算法之一,但它有一个致命短板:在长期训练中暴露出严重的不稳定性,导致不可逆转的模型崩溃。这让 RL Scaling 的推进变得异常困难——算力投进去,模型却越训越差。

GSPO 给出了完全不同的答案。

GRPO(Token 级优化)

在 token 层面定义重要性比率,对每个 token 的似然进行裁剪与优化。训练信号噪声大,长期训练不稳定,MoE 模型尤甚。需 Routing Replay

GSPO(序列级优化)

在序列层面定义重要性比率,长度归一化后统一优化。训练信号更可靠,稳定性大幅提升,MoE 模型无需额外策略。无需 Routing Replay

一个反直觉的发现:GSPO 所裁剪的 token 比例比 GRPO 高出两个数量级,但训练效率反而更高。这说明 GRPO 的 token 级优化目标充满了噪声,而 GSPO 的序列级信号更干净、更有效。

被裁剪的 token 比例
GRPO
GSPO
~100×

注:柱形宽度代表被裁剪 token 的相对比例,GSPO 比 GRPO 高出约两个数量级。更高的裁剪比例反而伴随更高的训练效率,表明 GRPO 的 token 级优化信噪比低,大量裁剪是无效的。

02训练效率与可扩展性 算力投进去,性能真的能继续涨

团队基于 Qwen3-30B-A3B-Base 微调得到的冷启动模型进行实验,对比 GRPO 与 GSPO 的训练奖励曲线及多项基准性能。结论非常清晰:GSPO 在同等计算开销下全面领先,且随着算力增加持续提升——这正是 RL Scaling 所追求的理想状态。

AIME'24 GSPO 持续领先 GRPO
LiveCodeBench 提升幅度随算力递增
CodeForces 稳定增长,无崩溃
训练效率 显著高于 GRPO

注:以上数据基于 Qwen3-30B-A3B-Base 冷启动模型实验,GSPO 在所有基准上均优于 GRPO,且性能曲线随算力增加持续上升,未出现 GRPO 常见的收益递减或崩溃现象。

更关键的是,GSPO 的收益曲线没有出现 GRPO 那样的"天花板"——投入更多算力,性能就继续增长。这意味着 RL Scaling 从一个美好的愿望变成了可工程实现的目标。

03MoE 模型的 RL 训练:从"必须抢救"到"自然收敛"

混合专家模型在 RL 训练中有一个臭名昭著的问题:专家激活的波动性导致训练无法正常收敛。过去,团队不得不采用 Routing Replay 策略——缓存旧策略中激活的专家,在计算重要性比率时"回放"这些路由模式——才能让 GRPO 训练 MoE 模型不崩溃。

但 Routing Replay 是"抢救",不是"治愈"。

它带来了额外的内存与通信开销,并限制了 MoE 模型的实际可用容量。GSPO 则从根本上消除了这一需求。

🎯 MoE 训练稳定性:GRPO vs GSPO 关键突破

  • GRPO + Routing Replay:必须依赖路由回放才能收敛,专家激活模式被"冻结",模型容量受限,训练效率低。
  • GRPO 无 Routing Replay:训练完全无法收敛,模型崩溃不可逆转。
  • GSPO(无需 Routing Replay):自然收敛,训练稳定,模型容量完全释放,无需额外策略。
核心洞见:GSPO 仅关注序列级似然,对个别 token 的似然不敏感,因此专家激活波动不再影响整体优化方向。

这意味着 MoE 模型在 RL 训练中可以充分发挥其架构优势,而不需要为了稳定性牺牲容量或增加工程复杂度。对于动辄数百亿参数的 MoE 模型来说,这是一个实质性的效率提升。

04序列级优化:为什么更稳定,也更高效

GSPO 的核心思想并不复杂:将优化单元从 token 提升到序列。在 GRPO 中,每个 token 的似然都被单独计算、裁剪和优化,这引入了大量噪声——因为单个 token 的概率波动往往与整体质量无关。GSPO 则对整条序列的似然进行长度归一化后统一优化,信号更集中,方差更低。

从优化流程看,GSPO 的链路更简洁:

采样回复组计算序列级似然长度归一化序列级裁剪组内优势估计优化

注:与 GRPO 的 token 级优化相比,GSPO 省去了逐 token 裁剪与重计算的步骤,训练信号更稳定,对精度差异的容忍度更高。

额外的好处来自基础设施层面。由于 GSPO 只使用序列级似然进行优化,对精度差异的容忍度远高于 token 级方法。这使得直接使用推理引擎返回的似然进行优化成为可能,无需训练引擎重计算——在 partial rollout、多轮 RL 以及训推分离框架中,这能显著降低工程复杂度。

编辑核心判断

序列级优化解决了 RL 训练的核心矛盾,但 token 级信息并非完全无用。

GSPO 在效率上的胜利,本质上是工程权衡的胜利——当稳定性成为瓶颈时,粗粒度的优化反而更有效。当前阶段,让训练先稳定跑起来,比追求极致的 token 级精度更重要。但长期来看,序列级与 token 级信号的融合,可能是下一个突破方向。

📄论文与资源

GSPO 论文已公开,相关代码与评测细节将在 Qwen 项目仓库中逐步开放。Qwen3 系列模型已全面应用 GSPO 算法,可通过通义千问官方渠道体验。

arXiv 论文