GSPO 算法发布:序列级优化终结 RL 训练崩溃,Qwen3 率先受益
通义千问团队提出 Group Sequence Policy Optimization (GSPO),在序列层面定义重要性比率并执行优化,从根本上解决了 GRPO 等算法在长期训练中的不稳定性与模型崩溃问题。GSPO 已成功应用于 Qwen3 全系列(Instruct / Coder / Thinking),训练效率显著提升,且彻底消除了 MoE 模型 RL 训练对 Routing Replay 策略的依赖。
通义千问团队提出 Group Sequence Policy Optimization (GSPO),在序列层面定义重要性比率并执行优化,从根本上解决了 GRPO 等算法在长期训练中的不稳定性与模型崩溃问题。GSPO 已成功应用于 Qwen3 全系列(Instruct / Coder / Thinking),训练效率显著提升,且彻底消除了 MoE 模型 RL 训练对 Routing Replay 策略的依赖。
GRPO 是当前主流的语言模型 RL 算法之一,但它有一个致命短板:在长期训练中暴露出严重的不稳定性,导致不可逆转的模型崩溃。这让 RL Scaling 的推进变得异常困难——算力投进去,模型却越训越差。
在 token 层面定义重要性比率,对每个 token 的似然进行裁剪与优化。训练信号噪声大,长期训练不稳定,MoE 模型尤甚。需 Routing Replay
在序列层面定义重要性比率,长度归一化后统一优化。训练信号更可靠,稳定性大幅提升,MoE 模型无需额外策略。无需 Routing Replay
一个反直觉的发现:GSPO 所裁剪的 token 比例比 GRPO 高出两个数量级,但训练效率反而更高。这说明 GRPO 的 token 级优化目标充满了噪声,而 GSPO 的序列级信号更干净、更有效。
注:柱形宽度代表被裁剪 token 的相对比例,GSPO 比 GRPO 高出约两个数量级。更高的裁剪比例反而伴随更高的训练效率,表明 GRPO 的 token 级优化信噪比低,大量裁剪是无效的。
团队基于 Qwen3-30B-A3B-Base 微调得到的冷启动模型进行实验,对比 GRPO 与 GSPO 的训练奖励曲线及多项基准性能。结论非常清晰:GSPO 在同等计算开销下全面领先,且随着算力增加持续提升——这正是 RL Scaling 所追求的理想状态。
注:以上数据基于 Qwen3-30B-A3B-Base 冷启动模型实验,GSPO 在所有基准上均优于 GRPO,且性能曲线随算力增加持续上升,未出现 GRPO 常见的收益递减或崩溃现象。
更关键的是,GSPO 的收益曲线没有出现 GRPO 那样的"天花板"——投入更多算力,性能就继续增长。这意味着 RL Scaling 从一个美好的愿望变成了可工程实现的目标。
混合专家模型在 RL 训练中有一个臭名昭著的问题:专家激活的波动性导致训练无法正常收敛。过去,团队不得不采用 Routing Replay 策略——缓存旧策略中激活的专家,在计算重要性比率时"回放"这些路由模式——才能让 GRPO 训练 MoE 模型不崩溃。
它带来了额外的内存与通信开销,并限制了 MoE 模型的实际可用容量。GSPO 则从根本上消除了这一需求。
这意味着 MoE 模型在 RL 训练中可以充分发挥其架构优势,而不需要为了稳定性牺牲容量或增加工程复杂度。对于动辄数百亿参数的 MoE 模型来说,这是一个实质性的效率提升。
GSPO 的核心思想并不复杂:将优化单元从 token 提升到序列。在 GRPO 中,每个 token 的似然都被单独计算、裁剪和优化,这引入了大量噪声——因为单个 token 的概率波动往往与整体质量无关。GSPO 则对整条序列的似然进行长度归一化后统一优化,信号更集中,方差更低。
从优化流程看,GSPO 的链路更简洁:
注:与 GRPO 的 token 级优化相比,GSPO 省去了逐 token 裁剪与重计算的步骤,训练信号更稳定,对精度差异的容忍度更高。
额外的好处来自基础设施层面。由于 GSPO 只使用序列级似然进行优化,对精度差异的容忍度远高于 token 级方法。这使得直接使用推理引擎返回的似然进行优化成为可能,无需训练引擎重计算——在 partial rollout、多轮 RL 以及训推分离框架中,这能显著降低工程复杂度。
序列级优化解决了 RL 训练的核心矛盾,但 token 级信息并非完全无用。
GSPO 论文已公开,相关代码与评测细节将在 Qwen 项目仓库中逐步开放。Qwen3 系列模型已全面应用 GSPO 算法,可通过通义千问官方渠道体验。
arXiv 论文 →