论文

OpenForgeRL: 在任何环境中训练 Harness 原生智能体

OpenForgeRL: 在任何环境中训练 Harness 原生智能体

现代 AI 智能体依赖复杂的推理框架(如 Claude Code、Codex、OpenClaw)来驱动多轮推理、工具使用和外部系统访问。然而,这些框架的复杂结构使得在开放基础设施上难以进行端到端训练——标准的 SFT/RL 栈无法原生支持有状态、多进程的框架推理。 为解决这一问题,我们提出 OpenForgeRL,一个开源框架,用于在多样化环境中端到端训练基于框架的智能体。其核心包括:1. 轻量级代理,服务于框架的模型调用,同时将其记录为训练数据供标准 RL 代码库(如 veRL)使用;2. Kubernetes 编排器,在每个远程容器中独立运行 rollout,实现任意框架在任何环境下的规模化训练。通过解耦训练与推理,OpenForgeRL 让研究者能直接在真实框架和环境中训练、研究和改进智能体。 我们在多种复杂框架和环境上验证了框架,涵盖工具/爪状智能体以及多模态 GUI 浏览器/计算机使用智能体。仅使用数百到数千个任务,OpenForgeClaw 在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7;OpenForgeGUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3。两者在几乎所有基准测试中优于同等规模的开源基线,在 GUI 设置中匹配或超越数倍大的模型。 除基准测试外,我们分析了框架选择(如 ZeroClaw、OpenClaw、Codex)和 RL 对智能体行为的影响。发现某些框架学习难度显著更高,而 RL 提升了智能体的可靠性,如自我验证、工具覆盖率和多步计划完成,但关键能力(如错误恢复)仍较弱。

论文精读

TL;DR OpenForgeRL 解耦训练与推理,让基于复杂 harness(如 Codex、OpenClaw)的 AI 智能体能在任意环境中端到端训练,仅需数百至数千任务即达领先性能。

问题

问题背景

当前 AI 智能体(agent)越来越依赖复杂的推理 harness,如 Claude CodeCodexOpenClaw 等,来驱动多轮推理、工具调用和外部系统交互。这些 harness 已成为智能体能力的关键使能层,但主流的大规模训练基础设施(如 SFT/RL 框架)尚未原生支持对这类有状态、多进程的 harness 进行端到端训练。

现有方法局限

传统 RL 训练栈(如 veRLOpenRLHF)通常假设单次模型调用即完成一次推理,而现代 harness 会在单次 rollout 中多次调用模型,并维持复杂的内部状态。这导致三大割裂:

  • 数据流割裂:现有框架难以捕获 harness 内部的完整交互轨迹(模型调用序列、工具返回、中间规划),训练信号只能来自最终结果,无法细粒度优化。
  • 环境割裂:训练环境通常不是真实部署环境,智能体在标准化 benchmark 上学到的策略迁移到真实 harness 时经常失效。
  • 规模割裂:多进程、容器化的 rollout 与集中式训练器之间缺乏高效、可扩展的通信机制,使得在数万容器上并行训练 harness-based agent 非常困难。

为什么这个问题难/重要

训练 harness-native 智能体的挑战在于必须保持训练与部署环境一致,同时满足 RL 训练对批量、异步、容错和可观测性的需求。业界对能够直接在实际 harness 上训练智能体的需求强烈,因为这直接关系到智能体从 lab 到产品的跨越。技术上,需要一套精妙的设计将标准 RL 代码库与异构 harness 解耦,同时不丢失训练数据的完整性和及时性。

行业类比

这类似于自动驾驶行业早期,仿真环境训练的模型与实车测试之间存在巨大鸿沟,直到出现高保真仿真和混合 rollout 技术才逐步解决。对于智能体,OpenForgeRL 正是这样的桥梁——让训练能够融入真实部署 harness,正如实车测试融入开发流程。

核心洞察

  • 智能体训练必须在其实际部署的推理harness中原生进行,才能捕捉完整的多步交互与状态依赖性。OpenForgeRL通过代理记录harness的模型调用,将复杂多进程推理转化为标准RL可消费的数据,解耦了训练与推理。这一设计突破了现有RL栈无法表达有状态、多进程harness推理的根本限制,使得研究者无需修改harness或环境即可直接训练,相比离线数据集或简化环境的基线,能更真实地反映并提升智能体的实际表现。
  • RL强化学习显著改善了智能体的行为可靠性(如自我验证与工具覆盖),但无法自动习得错误恢复等高级规划能力。OpenForgeRL的实验揭示,即使在奖励信号引导下,智能体在执行失败后仍难以自主修正,表明当前探索与反馈机制不足以培养鲁棒的策略。这一发现将研究焦点从基准分数转向更为关键的可靠性维度,提示未来需要设计更细粒度的奖励或课程学习,以针对性提升智能体的抗扰动与恢复能力。

方法

整体流程

OpenForgeRL 采用“训练与推理解耦”架构,在真实 harness 环境下完成端到端 agent 强化学习。输入为 基础模型(如 LLM/VLM)、目标 harness(Claude Code、OpenClaw、Codex 等)和一组 环境任务(tool-use、GUI 操作等)。核心思路是:通过轻量级代理将 harness 的推理过程透明化,转化为标准 RL 训练框架可消费的数据流,再由 Kubernetes 编排实现大规模并行 rollout。

关键模块

  1. Harness 代理(Proxy)

    • 在 harness 与模型之间插入一个 HTTP/gRPC 代理,截获所有模型调用请求与响应。
    • 每次调用被记录为 (state, action, reward) 轨迹片段,并自动对接至标准 RL 代码库(例如 veRL)。
    • 代理对 harness 透明,无需修改现有 harness 代码,因此任何环境、任何 harness 均可直接接入。
  2. Kubernetes 编排器

    • 每个 rollout 在独立远程容器中执行,支持异步启动、超时控制和异常恢复。
    • 容器化隔离保障了单次推理的故障不影响整体训练,同时支持大规模并发(数百个任务并行)。
    • 错误处理机制包括:当 rollout 超时或挂起时自动终止并回收资源,重试或丢弃失败轨迹。
  3. RL 训练堆栈

    • 代理收集的轨迹被格式化为标准 SFT/RL 数据集,直接送入 veRL 等框架进行策略优化(如 PPO)。
    • 训练过程完全与 rollout 解耦:RL 训练器只需消费离线数据,不感知 harness 的具体实现;而 rollout 环境可按需随时扩缩。
  4. 数据合成(Data Synthesis)

    • 为弥补真实任务数量不足,框架支持基于少量种子任务自动生成变体(如修改指令参数、替换工具描述)。
    • 合成数据同样通过 harness 执行并获得真实反馈,确保训练信号的可靠性。

输出

训练生成的是可在原 harness 中直接部署的 策略模型,无需额外适配层。该模型学会了多步推理、工具选择与错误恢复等行为,在 ClawEval、OSWorld 等 benchmark 上显著超过同尺寸基线,甚至匹敌大数倍模型。

与同类方法的差异:传统 RL 训练框架(如 RLlib、Sample Factory)要求环境遵循统一 API,而 OpenForgeRL 通过代理模式将任意黑盒 harness 转为标准 MDP,首次实现了对“带状态、多进程 harness”的端到端 RL 训练,无需修改底层 RL 代码或 harness 源码。

实验

实验设计

OpenForgeRL 在两类复杂代理场景中验证:工具/Claw 代理多模态 GUI 代理(浏览器与计算机操作)。训练数据仅数百至数千条任务,结合 SFT 与 RL(基于 veRL),通过轻量代理 + Kubernetes 编排在远端容器执行 rollout 并收集轨迹。评估涵盖 ClawEval、QwenClawBench 等 Claw 基准,以及 OSWorld-Verified、Online-Mind2Web、WebVoyager 等 GUI 基准,全面检验框架对不同 harness 和环境的泛化性。

关键发现

OpenForgeClaw 在 ClawEval 达到 55.9 pass@3,在 QwenClawBench 取得 33.7;OpenForgeGUI 在 OSWorld-Verified 上 37.7,Online-Mind2Web 63.0,WebVoyager 72.3。两者在所有基准上均超越同规模开源基线,且在 GUI 任务上可与数倍参数量的模型媲美或超越。RL 训练不仅提高分数,还显著增强了代理行为的可靠性:自检、工具覆盖率和多步规划完成度均有提升,但错误恢复等关键能力仍较弱,暴露训练目标与复杂动态环境的差距。

基线对比解读

传统开放训练栈难以表达有状态、多进程的 harness 推理,导致端到端训练困难。OpenForgeRL 通过解耦训练与推理,允许代理直接在实际部署的 harness 和环境中学习,这是其全面优于同规模基线的核心原因。在 GUI 任务中,利用原生浏览器/计算机环境,模型习得长程交互策略,因此可匹敌大得多的模型。不同 harness(ZeroClaw, OpenClaw, Codex)的学习曲线差异表明,harness 的工程品质直接影响 RL 收敛效率,为生产环境选型提供实践依据。

行业影响

落地场景

OpenForgeRL 直接面向基于复杂推理管线(harness)的 AI agent 训练,这些 agent 已嵌入 Claude CodeCodexOpenClaw 等产品。依赖多轮推理、工具调用和外部系统交互的自动化场景均可受益,主要包括:

  • 自动化编程助手与代码代理,处理多文件编辑、测试执行
  • GUI 操作代理,用于浏览器或桌面自动化,如数据录入、表单填写、质检流程
  • 企业流程自动化(RPA 升级),处理工单、查询数据库、调用 API
  • 多模态开放世界任务,如文献检索与总结、软件操作演示

商业价值

  • 降本:直接在真实 harness 与环境中 RL 训练,省去构建仿真环境的开销;agent 可靠性提升后,可减少人工校验与错误修复的隐性成本。
  • 增收:更强的 agent 能处理长链条复杂任务,提高自动化覆盖率,催生新产品能力(如自动退款、定制化报告),直接贡献营收。
  • 体验提升:RL 使 agent 习得自我验证、多步计划等能力(如 pass³pass@3 大幅跃升),降低失败率,改善终端用户满意度。

与现有工作流的集成

OpenForgeRL 通过轻量级代理记录 harness 的模型调用,与标准 RL 框架(如 veRL)无缝衔接;Kubernetes 编排器为每个 rollout 启动独立容器,适配云原生 MLOps 栈。

  • 将代理部署在模型服务前端,重定向请求并记录交互轨迹
  • 利用企业现有 K8s 集群管理大规模 rollout,训练管线可与 CI/CD 整合
  • 产出的模型可直接替换原始策略,无需修改 harness 代码,实现训练-部署闭环

具体用例

  1. 企业 IT 自动化:IT 服务台 agent 常需操作多系统(重置密码、安装软件、查询资产)。传统 RPA 灵活性差,用 OpenForgeRL 在 ServiceNow 等 harness 中通过真实工单进行 RL 微调,使 agent 提升纠错与工具选择能力,将一线解决率提升 30%+。

  2. 电商平台后台自动化:商品上架、库存调整、促销设置等依赖 Web GUI,现有脚本维护成本高。采用 OpenForgeGUI 训练 multimodal agent,直接在真实环境中学习 GUI 操作,自然语言指令即可完成复杂多步任务,释放运营人力投入策略。

局限

  • - **错误恢复能力依然薄弱**:尽管 RL 训练提升了 agent 的自验证、工具覆盖和计划完成能力,论文明确指出像错误恢复这样的关键能力仍然很弱(“though critical abilities such as error recovery remain weak”)。这表明当前框架在训练 agent 处理意外失败和动态纠错方面存在固有局限,可能源于奖励信号设计或环境交互的多样性不足,距离可靠部署尚有明显差距。
  • - **对 harness 的依赖影响泛化**:研究发现不同 harness(如 ZeroClaw、OpenClaw、Codex)的学习难度差异显著,某些 harness 更难通过 RL 习得。这暗示 OpenForgeRL 的训练效果与所选 harness 强耦合,迁移到新的或未见的 harness 可能需要重新探索超参和奖励设计,增加了工程适配成本,也限制了框架的即插即用性。
  • - **计算资源开销高**:框架为每个 rollout 分配独立的远程容器并依赖 Kubernetes 编排,虽然实现了良好的扩展性,但也带来了显著的计算和存储开销。对于仅需数百到数千任务训练的 agent 而言,大规模集群的维护成本可能使小型团队或学术实验室难以复现。同时,异步 rollout 和复杂的超时处理机制增加了系统调试和监控的难度,限制了方法在资源受限环境下的适用性。
论文Xiao Yu2026-07-23原文

相关内容