ClawGym II: 探索 Agent Harness 上的黑盒强化学习
Agent harness 通过协调智能体与环境的交互,在长程任务上显著提升了性能。然而,通过复杂 harness 进行强化学习仍鲜有探索,因为将此类训练扩展到长程智能体任务会带来根本性挑战。 本工作提出一个统一的黑盒强化学习框架,通过复杂 harness 实现通用智能体的稳定、可扩展优化。具体而言,我们首先构建基于沙箱的执行基础设施,将任务环境和 harness 隔离在临时沙箱中,以支持大规模并发回放;随后将策略优化与不透明的 harness 执行解耦,并在模型边界放置服务代理以捕获模型调用。为重建多轮轨迹并提升训练效率,我们将捕获的调用组织为前缀树,并进一步适配基于评论家的 PPO 与无评论家的 GRPO,以在恢复的树结构上优化。同时,我们全程保持训练与推理的一致性。最后,我们引入混合 harness 训练,使单一模型可通过异构 harness 联合优化。 使用 Qwen3-30A3B,黑盒 RL 在 ClawGym-Bench 上通过 OpenClaw 和 Claude Code 分别将 Pass@1 提升了 9.98 和 14.81 个点,且在 200-400 步优化中保持稳定。此外,该框架在 JobBench 和 OfficeQA 等更具挑战性的任务上取得了一致提升。 总体而言,本框架通过黑盒 harness 实现了通用智能体的有效、稳定且可扩展的优化,支持跨异构执行系统的统一训练。
论文精读
TL;DR 首个统一黑盒 RL 框架,通过沙盒执行、前缀树轨迹重构与混合 harness 训练,稳定优化长程 Agent;在 ClawGym-Bench 上 Pass@1 分别提升 9.98 和 14.81 点。
问题
问题背景
当前 AI agent 研究正从 prompt engineering 转向用强化学习优化长程任务表现,agent harness(如 OpenClaw、Claude Code)负责协调模型与环境的交互,但 RL 训练大多假设能白盒访问模型内部。
现有方法局限
- 传统 PPO/GRPO 需要模型 logits 或 hidden state,而生产级 harness 将模型调用封装在沙盒与第三方服务中,外部只能看到输入输出,黑盒阻碍了梯度流动。
- 现有 agentic RL 通常绑定单一执行系统(如 agentloop),训练与部署 harness 不一致,导致策略在实际使用中性能下降。
- 长任务 rollout 涉及多轮工具调用和多分支执行,直接对 flatten 序列优化会丢失树状结构信息;大规模并发执行时难以稳定收集和重建轨迹。
为什么这个问题难/重要
复杂 harness 内部有大量环境交互、条件分支、错误重试逻辑,模型调用点隐蔽,修复训练信号需要额外的 serving proxy 和前缀树重建,工程复杂度高。业界对 generalist agent 的持续优化需求强烈,但多数团队无法修改 harness 源码,黑盒 RL 是现实路径。训练稳定性、异构 harness 联合优化、数百步不退化,是落地关键。
行业类比
类似在只开放 API 的代码托管平台(如 GitHub Actions)上优化自动化 agent,无法改动 orchestrator,只能通过外部日志和退出码做策略学习。
核心洞察
- 黑盒 RL 框架通过引入 serving proxy 与沙箱化执行,将策略优化从不透明的 harness 执行中解耦,实现对任意复杂 agent harness 的稳定优化。这与以往白盒方法需要修改 agent loop 或直接访问环境状态不同,为在真实部署的异构执行系统上做 RL 提供了工程可行性,显著降低接入成本。
- 将捕获的多轮模型调用组织为前缀树,并在树结构上适配 PPO/GRPO,有效利用了并发 rollout 中共享前缀的样本,缓解了长程任务中样本效率低下的问题。相比传统按完整轨迹训练的 RL,前缀树重建和过滤机制能更细致地分配信用,并支持混合 harness 训练,使单一模型从多个执行系统中联合学习,提升泛化能力。
方法
输入与整体框架
给定一个通用 Agent 模型与一个或多个异构 agent harness(如 OpenClaw、Claude Code),目标是在不侵入 harness 内部逻辑的前提下,通过黑盒强化学习提升 Agent 在长程任务上的表现。
关键模块与流程
沙箱执行基础设施
将每个任务环境与 harness 隔离在临时沙箱中,支持大规模并发 rollout。此层屏蔽底层执行差异,为上层提供统一的交互接口。服务代理捕获模型调用
在模型与 harness 之间插入 serving proxy,不修改 harness 代码即可记录所有模型请求与响应。由于 harness 内部逻辑对优化器不可见,proxy 是获取轨迹数据的唯一通道。前缀树轨迹重建
将捕获的调用按时间与内容组织成 prefix tree。树中共享相同前缀的节点合并,从而在并发 rollout 中高效去重并恢复多轮交互轨迹。随后从树中提取有效轨迹并进行过滤(如去除异常终止或重复分支)。策略优化适配
将重建的树结构作为优化样本,同时适配 PPO(critic-based)与 GRPO(critic-free)。对树中每个决策节点计算优势值或组内相对奖励,并反向传播更新策略模型。训练-推理一致性
在优化过程中强制保持模型训练与部署时的输入输出格式、采样方式一致,避免因黑盒代理导致分布偏移。混合 harness 训练
将多个异构 harness 的轨迹混合到同一批优化中,使单一模型能够同时适应不同执行系统。
输出与差异点
输出为一个经过黑盒 RL 优化的通用 Agent 模型,可直接部署到目标 harness 上。与同类白盒 AgentLoop RL 方法相比,本框架不要求 harness 开源或可控,而是通过沙箱隔离与代理捕获实现完全黑盒下的稳定优化,并首次展示异构 harness 联合训练的可行性。
实验
实验设计
- 基础模型:
Qwen3-30A3B - Benchmarks:
ClawGym-Bench、JobBench、OfficeQA - Harness:
OpenClaw与Claude Code - 优化算法:
PPO与GRPO,基于 prefix tree 重建的多轮轨迹 - 框架组件:sandbox 并发执行、serving proxy 捕获模型调用、mix-harness 联合训练
- 对照:与白盒 AgentLoop RL 比较,并考察冷启动初始化与白盒到黑盒迁移
关键发现
- 黑盒 RL 显著提升
Pass@1:在ClawGym-Bench上,通过OpenClaw提升 +9.98,通过Claude Code提升 +14.81。 - 训练过程在 200–400 优化步内保持稳定,未出现崩溃或大幅波动。
- 在更具挑战性的
JobBench与OfficeQA任务上同样取得一致提升,验证了框架的泛化能力。 - 混合 harness 训练(mix-harness)允许单一模型被异构执行系统联合优化,进一步拓宽了应用场景。
与基线对比解读
- 相对于传统的 白盒 AgentLoop RL,本框架无需侵入 harness 内部,通过 serving proxy 在模型边界截获调用,实现黑盒优化,降低了工程复杂度与对特定框架的依赖。
- 尽管黑盒设置下可观测信息更少,但借助 prefix tree 重构轨迹与训练–推理一致性维护,仍能取得有竞争力的提升,且稳定性优于直接对复杂 harness 进行端到端训练。
- 该框架的价值在于:将复杂的多轮 agent 交互抽象为可优化的 tree 结构,支持 PPO 和 GRPO,便于在不同 harness 间迁移与联合训练。
行业影响
落地场景
该框架可直接用于依赖 agent harness 的复杂任务产品,例如:
- AI 编程助手(基于 Claude Code / OpenClaw 等 harness):优化多步代码编辑、测试、提交流程的决策质量。
- 企业自动化 agent:长周期业务流程(如工单处理、数据管道编排)中,提升工具调用与任务分解效率。
- 多轮交互客服或电商导购 agent:在订单查询、售后处理等 harness 上,通过 RL 学习更优的对话-工具协调策略。
商业价值
- 降本:减少无效探索与失败重试,降低 token 消耗和 harness 执行成本;同时减少人工编写 prompt / 示例的迭代开销。
- 增收:任务成功率提升直接带来更高的自动化完成率,可扩大 agent 服务的付费场景,例如缩短代码审核周期、提高工单自动解决率。
- 体验提升:在长程任务中保持策略稳定(论文显示 200-400 步优化不退化),减少用户等待与错误率。
与现有产品/工作流的接口
框架通过 serving proxy 在模型边界捕获调用,无需侵入 harness 内部;训练侧可将捕获的调用重建为 prefix tree 并适配 PPO / GRPO。
- 现有推理服务(如 vLLM、SGLang)可作 proxy 后端,策略模型训练后直接部署回相同 harness,保持训练-推理一致性。
- 支持 mix-harness training,可将多种异构 harness 统一到一个训练流程,适合多产品线共用的基础 agent 模型。
具体 use case:
- 电商导购 agent:在商品搜索、比价、下单等 harness 上,通过 RL 优化商品推荐与优惠组合策略,提升转化率与客单价。
- 企业服务工单系统:结合内部 API harness,训练 agent 在故障排查、资源申请等长流程中减少人工升级,缩短平均解决时间。
局限
- 黑盒 RL 依赖 **serving proxy** 捕获模型调用并通过 **prefix tree** 重建轨迹,但该方法无法完全还原 harness 内部的非确定性执行分支或隐式状态变化,可能导致部分有效交互被丢弃或轨迹语义失真,进而影响策略更新的准确性和样本效率。
- 相较于白盒方法,黑盒 RL 无法利用 harness 内部状态或可微环境,通常需要更多 rollout 来估计梯度,收敛更慢;沙箱并发执行虽然提升吞吐,但临时沙箱的创建、隔离与销毁会带来显著基础设施开销,在大规模部署时可能成为瓶颈。
- 论文在 **ClawGym-Bench**、**JobBench** 和 **OfficeQA** 上验证了框架有效性,但未系统分析不同 harness 特性(如工具调用频率、上下文长度、失败模式)对训练动态的影响;**mix-harness training** 仅展示初步结果,缺乏对负迁移或不同 harness 间梯度冲突的深入讨论。