人大高瓴团队提出 ClawGym II:黑盒强化学习框架让Agent在真实Harness中自我进化
将Claude Code、OpenClaw等复杂Agent Harness直接接入强化学习闭环,无需改动内部实现。在PinchBench上最高提升 17.28分,在ClawGym-Bench上最高提升 14.81分,并首次实现跨异构Harness联合训练。
将Claude Code、OpenClaw等复杂Agent Harness直接接入强化学习闭环,无需改动内部实现。在PinchBench上最高提升 17.28分,在ClawGym-Bench上最高提升 14.81分,并首次实现跨异构Harness联合训练。
Agent Harness 已成为现代智能体系统的执行基础——它把系统提示、工具接口、上下文管理、工作流和错误恢复整合在一起。但更强的 Harness 并不意味着模型能自然用好这些能力。ClawGym II 的核心思路是:将 Harness 执行与策略优化彻底解耦,让训练系统在模型服务边界捕获信息,不触碰 Harness 内部逻辑。
传统做法 vs. ClawGym II 的路径差异:
利用 Harness 产生的交互数据训练模型——数据是静态的,训练与执行环境存在 gap,模型难以充分适应真实 Harness 的复杂机制。
直接通过 Harness 进行强化学习——模型在真实执行过程中持续优化,Harness 的复杂交互协议、工具调用和错误恢复机制成为训练信号的一部分。
这一路径的核心优势在于:无需重新实现 Harness 内部复杂的控制流程,即可直接通过不同 Harness 对模型进行强化学习。训练系统只关心模型服务边界上的输入输出和任务奖励,Harness 内部的一切——包括 subagent 调度、context compaction、retry 机制——都作为黑盒存在。
直接通过复杂黑盒 Harness 做强化学习,首先要过三道坎。ClawGym II 给出了对应的工程化解法:
通用 Agent 任务依赖独立且有状态的运行环境,大规模并发 rollout 中的延迟、异常和失败影响训练稳定性。
Harness 暴露的只是分散的模型调用,完整轨迹不可见,retry 和 subagent 机制导致轨迹分叉。
不同 Harness 在交互协议、工具接口、上下文管理上差异显著,难以统一训练。
解法:执行与优化解耦 + 前缀树重建 + Mix-Harness Training
具体来说:每个任务环境与对应 Harness 在临时 Sandbox 中运行,rollout 结束后释放;Serving Proxy 在 Harness 与策略模型之间部署,记录输入 token、生成 token、rollout log-probability 和任务信息;前缀树重建将同一次 rollout 中捕获的碎片调用组织成树结构,共享历史合并为公共前缀,不同分支保留为独立路径;Mix-Harness Training 将不同 Harness 产生的 rollout 随机混合进入同一个 training batch,共享策略模型可同时从多个异构 Harness 中学习。
团队以 Qwen3-30B-A3B 为主要骨干模型,分别在 OpenClaw 与 Claude Code 两个结构差异显著的 Harness 上验证了黑盒 RL 的效果。以下为核心提升数据:
更关键的是 白盒 vs 黑盒 的对比实验:在显式构建的简单 White-box AgentLoop 上训练的模型,切换到未参与训练的 OpenClaw 上执行时,得分从 59.90 降至 50.33(仅提升 5.22 分);而直接通过 OpenClaw 进行黑盒 RL 的模型在同一评测下达到 62.62 分,提升幅度是前者的 3 倍以上。
这说明:直接通过目标 Harness 进行优化,才能充分适应其实际执行机制——简单环境中习得的能力,并不足以迁移到复杂 Harness 上。
此外,团队还将黑盒 RL 扩展到 JobBench 和 OfficeQA 两类任务上。JobBench-Easy 从 20.46 提升至 27.20,OfficeQA-Full 从 8.53 提升至 21.54,两组训练的 reward 均保持稳定上升。这表明 ClawGym II 能够跨越不同任务形式,从复杂 Workspace 操作到长文档检索与推理,都可以在同一套框架下进行有效优化。
ClawGym II 的实验验证了一个正在发生的范式转变:Agent Harness 不再只是模型能力的执行载体,也可以直接成为模型学习和提升的环境。
过去,Agent 系统的能力提升主要依赖更好的基础模型、更大的数据集或更精巧的 prompt。ClawGym II 展示了一条新路径:通过 Harness 本身进行强化学习,让模型在真实执行过程中持续适应和进化。这意味着 Agent 能力的提升不再完全依赖外部强模型或离线数据,而是可以在自身的交互环境中持续学习。
一个诚实的注脚:白盒训练的实验表明,在简单环境中习得的 Agent 能力,切换到复杂 Harness 后会有明显衰减(59.90 → 50.33)。这说明直接通过目标 Harness 优化是不可绕过的关键步骤——"先训练再适配"的效率远不如"在目标环境中直接训练"。
团队长期愿景是构建一套面向 General Agent 持续训练、能力演进与可靠评测的完整基础设施。ClawGym II 是这一愿景的重要一步:它证明了不同形态的真实 Harness 能够接入统一的优化框架,并共同推动同一个策略模型学习。
当 Harness 成为训练环境,Agent 能力的进化将从"被教"转向"自学"——这可能是通向通用智能体的关键一步。直接通过真实执行环境进行强化学习,正在成为比模型参数比拼更高效的进化路径。