论文

CUA-Gym: 扩展计算机使用智能体的可验证训练环境与任务规模

CUA-Gym: 扩展计算机使用智能体的可验证训练环境与任务规模

在数学、工具使用和软件工程等领域,可验证奖励的强化学习(RLVR) 已推动了突破性进展,但其在 计算机使用智能体(CUA) 上的应用受限于缺乏可扩展的训练数据(具备确定性奖励)。构建此类数据需要一致的任务指令、可执行环境和可验证奖励。然而,手工构建的基准虽奖励保真度高,但覆盖应用范围有限;基于大语言模型(LLM)作为评判的数据集虽可大规模扩展,但缺乏可靠的验证。 我们提出 CUA-Gym,一种可扩展的流水线,可协同生成任务指令、环境状态和奖励函数。具体而言,一个 生成器 Agent 构建初始和黄金环境状态,另一个独立的 判别器 Agent 根据任务规范编写奖励函数。一个 编排器 Agent 驱动两者通过迭代轮次执行。生成的元组经过最终过滤器(结合 LLM 多数投票 和 Agent 模拟),确保质量超越每任务对抗循环。为解决训练环境稀缺问题,我们进一步合成了 CUA-Gym-Hub,一套基于现实软件使用分布的高保真模拟 Web 应用套件,将 CUA RLVR 数据规模提升了一个数量级。 利用该流水线,我们构建了包含 110 个环境中 32,112 个已验证 RLVR 训练元组的 CUA-Gym 数据集。在 CUA-Gym 上使用 GSPO 训练的 CUA-Gym-A3B 和 CUA-Gym-A17B 在 OSWorld-Verified 上分别达到 62.1% 和 72.6%,优于同等规模的开源 CUA,性能随数据量和环境多样性平滑扩展。同一检查点在保留的 WebArena 基准上也有所提升,表明具有超出训练环境的迁移能力。我们将开源完整的合成流水线、数据集、CUA-Gym-Hub 环境和模型。

论文精读

TL;DR CUA-Gym 自动生成 32K 可验证训练数据和 110 个模拟环境,使 RLVR 驱动的计算机使用智能体性能超越同规模开源模型,并随数据规模平滑扩展。

问题

当前计算机使用代理(CUAs)领域聚焦于通过强化学习与可验证奖励(RLVR)提升图形界面任务的自主决策能力。手工构建的基准如 OSWorld 提供确定性奖励,但仅覆盖数十个应用,无法支撑大规模训练;基于 LLM-as-judge 的数据集虽能扩展任务数量,其奖励信号噪声大、易被模型投机利用。CUA 的 RLVR 训练需 任务指令、可执行环境、可验证奖励 三元组严格对齐,自动生成该三元组面临指令模糊、环境模拟不准确、奖励函数不可靠等挑战,但一旦突破即可解锁海量训练数据,推动 CUA 从狭窄基准迈向通用计算机使用。这一思路类似于自动驾驶仿真引擎——通过程序化生成大规模、高保真、可自动评估的驾驶场景,替代昂贵道路采集,支撑端到端模型闭环进化;CUA-Gym 正是为 GUI 代理构建的“虚拟测试场”。

核心洞察

  • **对抗式生成管道实现可验证奖励的规模化构造**。CUA-Gym 通过 Generator、Discriminator 与 Orchestrator 三个 agent 的迭代协作,自动生成任务指令、环境状态和奖励函数三元组,并利用 LLM 多数投票与 agent rollout 进行最终过滤,确保奖励的确定性。这解决了 CUAs 领域 RLVR 数据的两难——手工基准覆盖应用少但奖励可信,LLM-as-judge 数据规模大但验证不可靠。该管道首次在通用计算机操作任务上实现了规模与质量平衡的 RLVR 训练数据生产。
  • **合成环境生态突破真实交互环境瓶颈**。CUA-Gym-Hub 合成了一系列高保真模拟 Web 应用,覆盖真实软件使用分布,极大扩充了可执行环境的多样性与数量。基于这些环境生成的训练数据不仅让模型在 OSWorld-Verified 上取得领先性能,还迁移到未见过的 WebArena 基准上表现提升,证明合成环境能够有效替代有限真实网站,支撑 CUAs 的规模化 RLVR 训练与泛化。

方法

CUA-Gym 提出一种可扩展的任务–环境–奖励协同生成流水线,解决计算机使用智能体(CUA)在验证奖励强化学习(RLVR)中训练数据稀缺的难题。

生成流水线

  • Generator agent:接收高层任务描述,构建初始和黄金(目标)环境状态,使任务目标可执行。
  • Discriminator agent:根据任务规格自动编写确定性奖励函数,保证执行结果的正确性可判定。
  • Orchestrator agent:驱动生成器和判别器进行多轮迭代,通过执行反馈优化指令与奖励的一致性。

生成的 (指令, 状态, 奖励) 元组随后进入混合过滤器:联合LLM 多数投票agent rollouts(实际运行智能体收集轨迹),剔除歧义或不可靠样本,最终数据质量超越单任务对抗循环。

环境扩充

额外构建 CUA-Gym-Hub:一组高保真模拟 Web 应用,模拟真实软件使用分布,大幅提升环境多样性与数据规模。

训练与输出

流水线产出的 CUA-Gym 数据集包含 32,112 个已验证训练元组,覆盖 110 个环境。在此之上用 GSPO 训练,得到 CUA-Gym-A3B 和 A17B 模型,在 OSWorld-Verified 和 WebArena 上取得领先性能,且随数据量和环境多样性增加平滑提升。

与同类方法的核心差异:现有方案要么依赖手工基准(奖励保真但覆盖窄),要么用 LLM-as-judge(可扩展但验证不可靠);CUA-Gym 通过对抗生成与混合过滤,首次实现高保真、可验证、大规模的 CUA 训练数据,并在迁移基准上展现泛化性。

实验

实验设计

训练数据通过 CUA-Gym 管道生成,包括任务指令、环境状态和可验证奖励函数,共 32,112 条 元组,涵盖 110 个 合成环境。模型使用 GSPO 训练,评估在 OSWorld-VerifiedWebArena 两个基准上进行,对比其他开源计算机使用智能体。

关键发现

  • CUA-Gym-A3B 在 OSWorld-Verified 上达到 62.1%,CUA-Gym-A17B 达到 72.6%,均优于先前同规模开源 CUAs。
  • 性能随 数据量环境多样性 平滑扩展,显示合成管道具有良好的可扩展性。
  • 在训练未覆盖的 WebArena 基准上也有性能提升,表明模型学习了可迁移的计算机操作能力。

与基线的对比解读

传统方法中,手工标注基准(如 OSWorld)奖励验证可靠但覆盖面窄,基于 LLM 评判的数据集(如 AgentBench)扩展性强但缺乏确定性验证。CUA-Gym 通过生成器与判别器的对抗循环,生成可执行环境和确定性奖励函数,兼顾了 大规模高验证可靠性。这为 RLVR 在计算机使用智能体领域的大规模应用提供了可行路径,其平滑扩展特性也证明了合成数据的有效性。

行业影响

落地场景

CUA-Gym 提供的 RLVR (Reinforcement Learning with Verifiable Rewards) 训练范式和合成环境,直接赋能需要 GUI 自动化 的产品。典型用例包括:

  • 电商运营自动化:自动处理订单、更新库存、抓取竞品信息,可通过 CUA 代理 直接操作各类网页后台,无需人工介入。
  • 企业流程自动化 (RPA):跨国 HR 系统、财务软件中的重复性数据录入与报表生成,由 CUA 代理 跨应用完成,降低对专用 API 的依赖。
  • 软件测试与 QA:基于真实工作流分布生成的模拟环境 CUA-Gym-Hub,可批量生成可验证测试任务,提升回归测试覆盖率与效率。

商业价值

  • 降本增效:训练后的模型在 OSWorld-Verified 上达 62.1-72.6% 成功率,已在真实应用场景中替代人工操作,减少重复性劳动成本;合成环境使训练数据生成规模可达 32k+ 元组,大幅降低人工标注成本。
  • 体验与可靠性提升可验证奖励 机制避免了基于 LLM 评分的不确定性,确保代理行为精准匹配预期结果,在金融对账、合规操作等高风险场景中减少差错。
  • 生态扩展:开源全套 合成管线、数据集、模型及环境,允许企业基于自有应用快速定制训练环境,形成可持续演进的自动化能力。

与现有产品/工作流的集成

  • RPA 平台集成:可作为 UiPathPower Automate 的智能决策后端,通过 CUA 模型 驱动界面操作,替代部分基于规则或 CV 的模块,增强对动态网页的鲁棒性。
  • 测试框架嵌入:将 CUA-Gym-Hub 环境与 SeleniumPlaywright 等工具结合,训练代理执行端到端测试,输出可验证的奖励信号,使测试回归自动生成并持续优化。
  • 浏览器助手插件:直接嵌入 ChromeEdge 扩展,为用户提供“一句话完成复杂多步操作”的服务,后端调用训练好的 CUA-Gym-A3B/A17B 模型,实时响应用户指令。

局限

  • 合成任务与环境的分布存在偏斜:CUA-Gym-Hub 的应用模拟基于现实软件使用频率分布,但该分布本身来自有限采样,可能低估长尾、冷门或高度专业化的交互模式。生成的指令与状态若偏离真实用户的复杂多步工作流,模型习得的策略在开放域部署时可能难以泛化到未见过的应用逻辑。
  • 奖励函数验证仍有假阳性风险:尽管采用了 LLM 多数投票和 agent 回滚的多重过滤,但两者均依赖语言模型的判断能力。当任务完成的判定涉及细微的界面状态差异或非直观的副作用时,奖励函数可能错误地给予奖励,导致策略被稀疏但有噪声的信号训练,影响最终可靠性与安全性。
  • 环境与任务的扩展成本未充分讨论:论文强调从 10 个环境扩展到 110 个并生成 3.2 万条数据,但生成链路中 Generator、Discriminator 与 Orchestrator 的迭代交互、人工巡检以及最终过滤的成本并未量化。在实际场景中,若要将该管道迁移到全新应用域,这些隐性开销可能限制其作为通用数据工厂的可行性。
论文Bowen Wang2026-05-25原文

相关内容