🏆 强化学习 · 框架创新

人大高瓴团队提出 ClawGym II:黑盒强化学习框架让Agent在真实Harness中自我进化

将Claude Code、OpenClaw等复杂Agent Harness直接接入强化学习闭环,无需改动内部实现。在PinchBench上最高提升 17.28分,在ClawGym-Bench上最高提升 14.81分,并首次实现跨异构Harness联合训练

综合公开信息整理 2026-08-18 全文约 4 分钟读完
#ClawGym II #黑盒强化学习 #Agent Harness #人大高瓴 #Claude Code
17.28 PinchBench 最高提升 · Claude Code 黑盒 RL
62.62 黑盒 RL 在 OpenClaw 上最终得分
4 跨任务验证 · JobBench / OfficeQA 等

⚡ 30 秒速览

  • 核心创新:ClawGym II 将真实 Agent Harness(Claude Code、OpenClaw)直接纳入强化学习闭环,无需修改 Harness 内部实现,即可通过其真实执行过程优化策略模型。
  • 技术突破:解决三大难题——可扩展执行基础设施、碎片化黑盒轨迹重建、跨异构 Harness 联合训练。前缀树轨迹重建 + Mix-Harness Training 是关键技术。
  • 实验效果:在 PinchBench 上最高提升 17.28 分(Claude Code),在 ClawGym-Bench 上最高提升 14.81 分;直接黑盒 RL 得分 62.62,远高于白盒训练的迁移效果(50.33)。
  • 跨任务验证:在 JobBench 和 OfficeQA 两类差异显著的任务上同样实现稳定提升,JobBench-Easy 提升 6.74 分OfficeQA-Full 提升 13.01 分
  • 开源开放:论文已公开,相关工作已开源,评测流程与训练框架可查可复现。

01核心创新:黑盒强化学习 让 Harness 从执行载体变为学习环境

Agent Harness 已成为现代智能体系统的执行基础——它把系统提示、工具接口、上下文管理、工作流和错误恢复整合在一起。但更强的 Harness 并不意味着模型能自然用好这些能力。ClawGym II 的核心思路是:将 Harness 执行与策略优化彻底解耦,让训练系统在模型服务边界捕获信息,不触碰 Harness 内部逻辑。

传统做法 vs. ClawGym II 的路径差异:

传统方法

利用 Harness 产生的交互数据训练模型——数据是静态的,训练与执行环境存在 gap,模型难以充分适应真实 Harness 的复杂机制。

ClawGym II

直接通过 Harness 进行强化学习——模型在真实执行过程中持续优化,Harness 的复杂交互协议、工具调用和错误恢复机制成为训练信号的一部分。

这一路径的核心优势在于:无需重新实现 Harness 内部复杂的控制流程,即可直接通过不同 Harness 对模型进行强化学习。训练系统只关心模型服务边界上的输入输出和任务奖励,Harness 内部的一切——包括 subagent 调度、context compaction、retry 机制——都作为黑盒存在。

注:ClawGym II 延续了 ClawGym 系列围绕真实 Agent 系统训练模型的研究路线,但将问题从"利用 Harness 产生的数据训练"推进到"直接通过 Harness 进行强化学习"。

02三道坎与解法 直接通过黑盒 Harness 做 RL 要克服什么

直接通过复杂黑盒 Harness 做强化学习,首先要过三道坎。ClawGym II 给出了对应的工程化解法:

坎 01
可扩展的执行基础设施

通用 Agent 任务依赖独立且有状态的运行环境,大规模并发 rollout 中的延迟、异常和失败影响训练稳定性。

坎 02
碎片化黑盒轨迹优化

Harness 暴露的只是分散的模型调用,完整轨迹不可见,retry 和 subagent 机制导致轨迹分叉。

坎 03
跨异构 Harness 可扩展性

不同 Harness 在交互协议、工具接口、上下文管理上差异显著,难以统一训练。

解法:执行与优化解耦 + 前缀树重建 + Mix-Harness Training

Sandbox 隔离执行 Serving Proxy 捕获 前缀树轨迹重建 Mix-Harness 联合优化

具体来说:每个任务环境与对应 Harness 在临时 Sandbox 中运行,rollout 结束后释放;Serving Proxy 在 Harness 与策略模型之间部署,记录输入 token、生成 token、rollout log-probability 和任务信息;前缀树重建将同一次 rollout 中捕获的碎片调用组织成树结构,共享历史合并为公共前缀,不同分支保留为独立路径;Mix-Harness Training 将不同 Harness 产生的 rollout 随机混合进入同一个 training batch,共享策略模型可同时从多个异构 Harness 中学习。

注:框架还引入了 token-level importance-sampling rollout correction,从 token 序列和 probability 两个层面降低 off-policy bias,保证训练与推理的一致性。

03关键实验数据 黑盒 RL 在多个 Harness 上均带来显著提升

团队以 Qwen3-30B-A3B 为主要骨干模型,分别在 OpenClaw 与 Claude Code 两个结构差异显著的 Harness 上验证了黑盒 RL 的效果。以下为核心提升数据:

17.28 PinchBench 提升
(Claude Code)
14.81 ClawGym-Bench 提升
(Claude Code)
11.71 PinchBench 提升
(OpenClaw)
9.98 ClawGym-Bench 提升
(OpenClaw)

更关键的是 白盒 vs 黑盒 的对比实验:在显式构建的简单 White-box AgentLoop 上训练的模型,切换到未参与训练的 OpenClaw 上执行时,得分从 59.90 降至 50.33(仅提升 5.22 分);而直接通过 OpenClaw 进行黑盒 RL 的模型在同一评测下达到 62.62 分,提升幅度是前者的 3 倍以上。

这说明:直接通过目标 Harness 进行优化,才能充分适应其实际执行机制——简单环境中习得的能力,并不足以迁移到复杂 Harness 上。

注:所有提升均为与初始模型 Qwen3-30B-A3B 的对比。训练过程约 200–400 个 optimization steps,GRPO 与 PPO 两种算法均能稳定训练,最终性能接近。

04三个实验场景 从单一 Harness 到联合训练,再到跨任务泛化

🔧 OpenClaw 黑盒 RL PinchBench +11.71 分

  • 设定:以 Qwen3-30B-A3B 为骨干,通过 OpenClaw Harness 进行黑盒强化学习,训练约 300 个 optimization steps。
  • 结果:在 ClawGym-Bench 上提升 9.98 分,在 PinchBench 上提升 11.71 分,训练 reward 稳定上升。
  • 意义:验证了通过复杂黑盒 Harness 进行 RL 的可行性,模型学到的能力可迁移到新的任务分布。
结论:OpenClaw 作为黑盒 Harness,能够为策略模型提供有效的训练信号,且无需修改其内部逻辑。

🤖 Claude Code 黑盒 RL PinchBench +17.28 分

  • 设定:同一骨干模型,通过 Claude Code Harness 进行黑盒 RL,训练设置与 OpenClaw 实验保持一致。
  • 结果:在 ClawGym-Bench 上提升 14.81 分,在 PinchBench 上提升 17.28 分,为所有实验中最高。
  • 意义:Claude Code 与 OpenClaw 在交互协议和工具接口上差异显著,两个 Harness 上均取得显著提升,说明方法具有通用性。
结论:不同形态的 Harness 都能接入统一优化框架,且各自带来可观收益。

🔄 Mix-Harness 联合训练 共享策略同时适配两个 Harness

  • 设定:将 OpenClaw 与 Claude Code 产生的 rollout 随机混合进入同一 training batch,共同优化一个共享策略模型。
  • 结果:共享模型在两个 Harness 上均保持与对应单 Harness 训练相当的 reward 和下游评测表现,训练过程稳定。
  • 意义:来自不同 Harness 的学习信号可以在统一框架中被有效联合优化,一个模型同时适配多个异构 Harness
结论:跨 Harness 联合训练不会导致信号冲突,反而让模型获得更全面的交互能力。

此外,团队还将黑盒 RL 扩展到 JobBenchOfficeQA 两类任务上。JobBench-Easy 从 20.46 提升至 27.20,OfficeQA-Full 从 8.53 提升至 21.54,两组训练的 reward 均保持稳定上升。这表明 ClawGym II 能够跨越不同任务形式,从复杂 Workspace 操作到长文档检索与推理,都可以在同一套框架下进行有效优化。

注:三个实验均采用相同的骨干模型 Qwen3-30B-A3B,训练超参数保持一致,以确保对比的公平性。

05为什么重要:Harness 从执行载体变为学习环境

ClawGym II 的实验验证了一个正在发生的范式转变:Agent Harness 不再只是模型能力的执行载体,也可以直接成为模型学习和提升的环境

过去,Agent 系统的能力提升主要依赖更好的基础模型、更大的数据集或更精巧的 prompt。ClawGym II 展示了一条新路径:通过 Harness 本身进行强化学习,让模型在真实执行过程中持续适应和进化。这意味着 Agent 能力的提升不再完全依赖外部强模型或离线数据,而是可以在自身的交互环境中持续学习。

一个诚实的注脚:白盒训练的实验表明,在简单环境中习得的 Agent 能力,切换到复杂 Harness 后会有明显衰减(59.90 → 50.33)。这说明直接通过目标 Harness 优化是不可绕过的关键步骤——"先训练再适配"的效率远不如"在目标环境中直接训练"。

团队长期愿景是构建一套面向 General Agent 持续训练、能力演进与可靠评测的完整基础设施。ClawGym II 是这一愿景的重要一步:它证明了不同形态的真实 Harness 能够接入统一的优化框架,并共同推动同一个策略模型学习。

编辑核心判断

当 Harness 成为训练环境,Agent 能力的进化将从"被教"转向"自学"——这可能是通向通用智能体的关键一步。直接通过真实执行环境进行强化学习,正在成为比模型参数比拼更高效的进化路径。