⚙️ AI 基础设施 · 系统拆解

以 GLM-5 为例:强化学习基础设施正在把“训推一致”变成一条智能生产线

当模型能力越来越依赖后训练强化学习,决定效果的就不再只是模型和 GPU 数量,而是能否让生成、环境反馈、训练、状态管理与推理服务持续协同。九章智算云给出的答案,是把这套闭环做成统一的 AI Runtime。

综合公开信息整理技术观察全文约 4 分钟读完
#强化学习 #训推一致 #GLM-5 #AI Infra
62.1 GLM-5.2 · SWE-bench Pro
81.0 GLM-5.2 · Terminal-Bench 3.0
1.5× 前沿模型首日速度提升

⚡ 30 秒速览

  • 发生了什么:大模型 Scaling 正从预训练扩展到后训练强化学习,模型需要持续生成、反馈与更新。
  • 核心矛盾:Generator 生成 Rollout,Trainer 消费样本;两者速度不匹配,就会出现 GPU 空转或数据陈旧。
  • 系统解法:统一调度 Generator、Environment、Trainer、模型权重、KV Cache 与任务状态,而不是只寻找空闲 GPU。
  • 公开数据:GLM-5.2 在 SWE-bench Pro 得分 62.1、Terminal-Bench 3.0 得分 81.0;相关系统在部分模型上实现首日 1.5 倍速度提升。
  • 真正指标:AI 云的竞争焦点,正在从“提供多少算力”转向“单位算力能生产多少有效 Token,并转化为多少模型能力”。

01发生了什么?模型能力进入持续生产阶段

过去的大模型竞争,更多围绕更大的参数规模、更丰富的数据和更强的 GPU 集群展开。但当预训练的边际收益逐渐下降,数学推理、代码生成、复杂决策和长时序 Agent 能力,越来越依赖后训练强化学习。RL 通过生成、执行、反馈和奖励,让模型持续学习规划与自我纠错。

模型不再是“训完即交付”。

GLM-5.2SWE-bench Pro
62.1
GLM-5.2Terminal-Bench 3.0
81.0

注:两项分数属于不同评测,柱形仅用于展示各自相对 100 分满分的位置,不代表跨榜单排名。

这带来了产业链关系的变化:模型厂商负责不断挑战 RL 算法和策略边界,AI 基础设施则要负责把生成、训练、推理和状态管理稳定地串起来。两者不是“模型采购算力”的单向关系,而是共同推动后训练 Scaling。

02为什么可信?先看 RL 的系统结构

RL 与传统预训练的区别,不只是多了一种算法,而是改变了训练系统的结构。一个完整的强化学习闭环,至少包含三个角色:负责生成轨迹的 Generator、负责执行任务并返回奖励的 Environment,以及负责更新模型权重的 Trainer。

Generator接收 Prompt,生成 Rollout 与候选行动
Environment执行代码、工具调用或任务模拟,返回 Reward
Trainer依据轨迹与奖励更新权重,再回传 Generator
Generate → Reward → Train → Update → Generate

注:箭头代表持续循环,而非一次性流水线;新权重和新数据会不断进入下一轮生成。

如果 Trainer 每秒能消费 100 个样本,而 Generator 只能生成 60 个,训练资源就会等待;反过来,如果 Generator 过快,Rollout 会堆积并产生 Policy Staleness,也就是训练使用的数据逐渐落后于当前策略。

因此,系统优化目标不再是孤立地追求某一侧的 GPU 利用率,而是动态匹配 Trainer ThroughputEffective Generator Throughput,同时控制数据新鲜度和状态搬运成本。

03它能做什么?从研究闭环走向工程效率

持续 RL 释放推理能力

  • 公开研究显示,Qwen2.5-32BDeepSeek-R1-Distill-Qwen-1.5B 等模型可以通过持续 RL 迭代释放潜在推理能力。
  • 其中后者在 AIME 2024 上达到 39.33% 准确率,说明小规模模型也可能通过后训练获得更强的推理表现。
研究提示:On-policy 学习是持续提升性能的重要机制;单纯鼓励更长回答,可能引发 length hacking。

动态奖励抑制 Reward Hacking

  • 当奖励模型长期不变,模型可能学会迎合评分规则,而不是提升任务本身的质量。
  • 通过动态更新 Reward Model 的 Cooper 方法,可以缓解 Reward Hacking,改善端到端 RL 效果。
工程含义:奖励、环境、生成策略和训练权重必须被视为一个耦合系统,不能只优化其中一个模块。

在线投机者学习进入生产环境

  • 传统部署往往把投机者模型离线训练后冻结,流量和目标模型变化后,原有预测容易失效。
  • 新的方案将接受与拒绝 Token 作为奖励信号,训练服务器持续更新投机者,并把新权重热插拔到服务端。
  • 目标是实现零停机更新,让推理优化随着线上数据持续适应。
这不是简单的模型替换,而是把推理优化也纳入异步强化学习闭环。

04为什么能做到?调度对象从 GPU 变成完整状态

九章智算云的工程思路,是将 Generator、Environment 和 Trainer 纳入统一工作流:生成环节成为瓶颈时增加推理资源,训练进入高峰时重新分配算力,Environment 等待时释放闲置 GPU。调度系统关注的因此不再是“哪台机器有空”,而是“下一步计算、模型、轨迹和状态应该在哪里组合”。

1.5×部分模型首日速度提升
1.25×相较静态预测器再提升
229BMiniMax M2.1 参数规模
80BQwen3-Coder-Next 参数规模

注:速度数据为报道中的系统测试结果,适用于对应模型与工作负载,不应直接理解为所有场景的固定增益。

更容易被忽视的资源,是运行状态。Agent 上下文、KV Cache、RL 轨迹、奖励信号和实时模型权重,如果被绑定在单一 GPU 或节点,跨节点搬运、重复 Prefill 与数据复制就会放大非计算开销。

DingoFS 分布式文件底座+ DFKV 分布式缓存+ 零拷贝链路+ RDMA 高速网络

注:标签展示的是系统能力构成,不代表单项技术可以独立解决训推一致问题。

其中,DFKV 将 KV Cache 从单 GPU 的临时缓存,转变为可定位、可迁移、可跨任务复用的状态资源。已有上下文可以继续创造价值,训练与推理间的权重交换也能借助高速数据路径降低搬运成本。

05怎么判断?有效 Token 才是共同目标

Prefill 与 Decode 具有不同的计算特征,PD 分离可以把负载匹配到更合适的资源池;Chunked Prefill 能拆解超长上下文;Speculative Decoding 则让小模型先生成候选 Token,再由大模型批量验证。

这些技术看似分散,本质上都在回答同一个问题:有限算力究竟能生产多少有效 Token。在 RL 场景中,Token 不是最终答案,而是下一轮训练的原材料;生成得越快,Rollout 越多,模型迭代就拥有更多反馈。

传统“模型 + 算力”

训练、推理、缓存和状态各自优化。局部指标可能很好,但跨模块搬运与等待会吞掉整体效率。

训推一致的 AI Runtime

Generator、Trainer、Environment、权重、KV Cache 和 GPU 被纳入同一调度视图,围绕有效 Token 统一优化。

注:对比卡强调的是系统边界变化,不代表传统架构在所有负载下都低效。

这也解释了为什么 RL 基础设施可能延伸到具身智能:Agent 的工具调用、多轮决策,以及机器人的感知、推理、行动与反馈,本质上都需要弹性算力、实时推理、状态管理和高频反馈。

编辑核心判断

“训推一致”不是把训练 GPU 和推理 GPU 放进同一个资源池,而是让模型、Token、状态与反馈在同一条可调度的生产线上流动;但它的价值最终仍要由单位有效 Token 成本、模型能力增益和线上稳定性共同验证。

获取方式

原始信息聚焦于系统架构、研究验证与工程实践,未提供面向公众的独立体验地址。

建议关注后续公开的技术报告、研究项目与产品接入信息