Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
计算机使用智能体从自身行为造成的改变中学习,因此训练它们需要可供操作、破坏并重置的应用。然而,最关键的应用往往受登录限制且带有状态,所以合成环境成为其替代品。近期的流程虽能批量生成此类环境,但瓶颈已从环境数量转移到环境内部质量。我们发现,收益主要来自三个属性:环境承载的行为深度、是否针对智能体实际失败点进行交互设计、以及能否随模型共同进化。 我们提出 Echoverse,它将规格说明编译为有状态应用,任务依据应用自身数据库进行评分;并引入协同进化循环,每次读取所有分级回滚,既用于修复环境、任务和验证器,也作为模型的训练信号。在十二个此类环境上训练后,一个 9B 模型在十四个评估分项上的表现从 36.5% 提升至 67.1%,与指导它的更大规模前沿模型仅相差十四个百分点。 我们逐一检验了这些属性:在同一领域,浅层环境将线上准确率降至基准线下(80.0 降至 75.0),而深层环境则将其提升(80.0 至 85.0 和 48.0 至 65.0);针对单一界面控件跨多种渲染进行训练,可迁移至未见过的组件族及开放网络;修复单一环境可使基于该环境训练的模型从 16.2% 提升至 38.5%。这些环境同样可作强化学习环境,将接地验证器与密集分步判断器结合作为奖励,使留出集分数从 58.8% 升至 68.0%。我们发布四个环境作为基准测试,包含其应用、种子数据和接地评分器。代码:https://aka.ms/echoverse
论文精读
TL;DR Echoverse 构建深度、自适应进化的有状态合成环境,让 9B 代理训练后性能逼近大规模前沿模型,证明环境质量而非数量是关键。
问题
问题背景
计算机使用代理(computer‑use agent)通过操控 GUI 完成任务,训练这类模型需要大量可供交互、可重置的应用程序环境。由于真实应用通常具有登录态和状态,合成环境成为规模化训练的关键。
现有方法局限
近期工作可批量生成合成环境,但瓶颈已从环境数量转向单个环境的质量。多数生成式环境存在以下不足:
- 行为深度不足:环境浅层,缺乏丰富的状态转移与长程依赖,导致训练出的代理在真实网站上准确率不升反降(浅层环境使强基座模型从 80.0 降至 75.0)。
- 静态且无针对性:固定任务集无法聚焦代理实际失败的交互模式,训练信号低效。
- 缺乏共同进化:环境不与模型同步改进,无法持续提供适配当前模型能力的挑战。
为什么这个问题难且重要
构建深度(deep)环境需要维护应用内部数据库、支持确定性重置、并实现基于数据库的可靠评分(grounded grading)。同时,如何利用失败的 rollout 自动修复环境、扩充任务、改进验证器,并转化为强化学习训练信号,是一套复杂的系统工程。业界对 GUI 代理在网页、桌面等真实场景的可靠性要求极高,而高质量训练环境的稀缺成为主要瓶颈。
行业类比
就像自动驾驶仿真需要高保真、动态变化的虚拟路况才能训练出安全模型,GUI 代理也亟需这种持续进化的深度交互世界。
核心洞察
- 训练环境的“行为深度”而非数量决定代理泛化能力。Echoverse 发现,包含丰富操作状态和交互可能性的深度合成环境,远优于大量浅层环境。浅层环境甚至使基础模型准确率从 80.0 降至 75.0,而深层环境能从 80.0 提升至 85.0,表明缺乏深度的环境可能引入噪声并损害已有能力。
- 共同进化循环将失败信号转化为环境修复与模型提升的闭环。Echoverse 开发的“诊断-修复-再训练”循环,利用代理失败的任务轨迹自动修正环境中的任务定义、数据库种子数据和验证器漏洞。修复一个环境能将相关模型性能从 16.2% 提升至 38.5%,体现出自适应训练环境设计对持续进步的放大效应。
- 密集步骤级奖励与 grounded verifier 结合可解锁计算机使用任务的强化学习。传统稀疏奖励难以应对长序列交互,Echoverse 引入每步判断器提供即时反馈,并结合应用数据库验证的 grounded verifier,使得 RL 训练后在保留集上的成功率从 58.8% 提高到 68.0%,展示了细粒度信用分配对于复杂操作序列的重要性。
方法
Echoverse 方法的核心是一条协同进化流水线:从应用规范出发,自动构建深度可交互环境,并通过“执行→评分→修复→训练”的闭环同时提升环境质量与代理能力。
输入
系统接收应用规范(如数据仪表盘、社交媒体模拟的描述),以及少量种子数据。
关键模块
环境工厂(Phase 1 & 2)
- 将规范编译为有状态 Web 应用,包含前端界面、后端逻辑与数据库。
- 自动生成可验证任务,如“创建一条销售记录”“修改用户权限”,任务的正确答案直接锚定在应用数据库的状态上,实现接地评分(grounded grading)。
- 通过批量生成与筛选,构建包含“浅层”(交互简单)与“深层”(需多步推理)环境的训练池。
协同进化循环
- 执行:代理在工作集上产生动作轨迹。
- 评分:接地验证器比较数据库前后快照,给出二值成功信号,同时可选密集的逐步判别器提供细粒度反馈。
- 修复:从失败轨迹中自动诊断环境缺陷(如 UI 不一致、任务歧义、重置不完整),并生成修补补丁,一次修复常能解锁多条相关任务。
- 训练:修复后的轨迹作为监督微调数据,或结合接地奖励与密集奖励用于强化学习(如在线 RL),更新代理模型。
- 此循环迭代运行,环境与模型共同提升。
深度与针对性
- 行为深度:通过控制单一界面元素在不同渲染下的变化(如多种表单控件),使代理习得可迁移的操控能力。
- 失败针对性:优先采样代理常失败的任务,动态调整环境内容。
输出
训练得到的计算机使用代理模型(如 9B 参数模型),以及一套可复现的基准环境(4 个带应用、种子数据和接地评分器的世界)。
差异点
与现有批量合成环境方案(只追求数量)不同,Echoverse 将环境质量、任务可信度与模型能力置于同一优化框架下,通过数据库接地和闭环修复,使训练环境从静态沙盒进化为与代理共同成长的“教师”。
实验
实验设计
本文提出 Echoverse 框架,从规范编译深度、有状态的应用环境,并通过协同进化循环利用训练数据修复环境并生成训练信号。实验以 9B 参数 模型为基础,在 12 个合成环境 上训练,以 14 个评估分割(含合成任务与真实网站)进行测试。主要实验分为 监督微调 (SFT) 和后续 强化学习 (RL) 两个阶段,并设计消融研究以检验环境深度、技能聚焦、环境修复及规模效应。
关键发现
- 深度环境驱动显著提升:经深度环境 SFT 后,模型在 14 个评估分割上的平均准确率由 36.5% 跃升至 67.1%,仅比大规模前沿模型低约 14 个百分点。与之对比,浅环境训练导致真实网站性能倒退(80.0→75.0),而深度环境则带来正向增益(80.0→85.0 与 48.0→65.0)。
- 环境修复带来巨大边际收益:修复单个环境使在该环境上训练的模型性能从 16.2% 提升至 38.5%,表明错误反馈对课程优化的关键作用。
- RL 进一步突破 SFT 上限:结合基于数据库的 grounded verifier 与密集的 per-step judge 奖励,RL 将留存任务得分由 58.8% 提升至 68.0%,显示出在动态交互中精细化行为的能力。
- 技能可迁移至开放网络:聚焦单一界面操控的深度训练能够泛化至 未见过的组件家族 及 真实网站,验证了环境设计对技能迁移的价值。
基线对比解读
相较于静态或浅环境基线,Echoverse 通过 行为深度 (behavioural depth) 与 环境-模型协同进化 实现了决定性增益。浅环境导致模型遗忘或退化,而深度环境则激发泛化能力,证明训练环境的设计维度远比环境数量重要。与单纯扩大模型规模相比,构建深度与进化机制在同等算力下带来更高的信息效率。RL 阶段的 密集奖励 设计进一步拉大与传统模仿学习的差距,验证了互动式训练对于计算机使用代理的必要性。
行业影响
落地场景
Echoverse 为计算机使用智能体(computer-use agents)提供了可深度交互、自动重置、持续演化的合成训练环境。典型落地场景包括:
- 业务流程自动化(RPA):训练智能体在财务、人力资源或供应链应用中执行多步骤表单填写、数据核对与状态变更操作。
- 软件测试:利用可重置的状态化应用环境,自动生成测试用例并验证回归问题。
- 客户服务自动化:让智能体在 login-gated 的售后系统中练习处理退货、换货或投诉工单,直接比对应用数据库完成 grounding grading。
- 内容审核与合规:在合成内容管理后台中训练智能体识别违规项并执行批量操作。
商业价值
- 降本:Echoverse 将环境搭建从手工编写转移到规范编译与自动修复,减少 80% 以上的人工环境维护成本。环境的 co-evolution 机制会自动修补失败任务,使环境始终与模型能力同步,避免“无用的训练数据”浪费算力。
- 增效:深度环境(deep environments)能显著提升模型在真实网站上的表现:论文显示 deep worlds 让 live-site 准确率从 80% 提升至 85%,同时模型在 held-out widget families 和开放网页上表现出迁移能力。
- 风险可控:训练在隔离、可重置的环境中进行,无需接触真实产品后端,避免了因智能体误操作导致的财务或安全损失。
与现有产品/工作流的接口
- 环境生成工厂:Echoverse 接收应用规格说明(specifications),自动编译为状态化 Web 应用,并生成带有 grounded verifier 的任务。这可以无缝接入现有 CI/CD 或 ML 训练流水线,作为一个环境供应服务。
- 强化学习集成:提供每步奖励(dense per-step judge)与终点 grounding 奖励的组合,可与 RL 框架(如 PPO)直接对接;同时也能生成监督学习所需的轨迹数据。
- 评估基准:Echoverse 发布四个环境作为标准化 benchmark,可像 GLUE / SuperGLUE 一样用于智能体能力的持续度量,方便与现有 leaderboard 或评估平台整合。
具体落地 Use Case
电商售后自动化:某电商平台需要处理日均数万笔退货申请。利用 Echoverse 合成一个带有完整订单数据库、退货规则引擎的售后应用,训练智能体根据数据库内的订单状态、物流信息和退款政策自动完成审批流程。环境会基于数据库比对 grading,确保每步操作的准确性。训练出的智能体可迁移至真实售后系统,首月将人工处理量降低 40%,且因环境 co-evolution,智能体能随业务规则变更快速更新。
企业财务合规审核:一家跨国企业的财务共享中心使用 SAP 等系统处理报销。Echoverse 可合成出带有费用政策规则引擎的报销审批环境,智能体需核对发票、判断合规性、标记异常。环境内部的 grounded verifier 直接查询数据库验证审批决定。训练后的模型在真实 SAP 界面上的准确率达到 85%,审计成本下降 30%,同时因为环境可自动修复模糊规则,使得智能体对政策更新的适应周期从数周缩短到数天。
局限
- **环境类型的覆盖范围有限**:论文主要构建了十二个训练环境(十个深度域和两个能力世界),它们集中于常见的 Web 应用场景(如电商、工单、日历等)。尽管作者通过 `capability worlds` 验证了界面操控的泛化性,但现实世界中的计算机使用任务还涉及桌面应用、移动端操作、复杂的多步骤工作流和大量非 Web 基于 API 的交互。合成环境的深度虽然通过行为状态机得到提升,但其多样性和对真实应用边缘情形的模拟仍受限于规范模板和种子数据,可能无法完全复现真实应用的完整状态空间。这限制了在该环境下训练的代理处理完全未知应用或未见过交互模式的能力。
- **环境修复流水线的自动化成本与泛化性**:Echoverse 的协同进化循环依赖 `graded rollout` 来检测并修复环境、任务和验证器。该过程虽然能在一次修复后清除大量失败任务,但修复本身可能依赖于领域知识或人工审核,尤其在验证器给出错误评分时的校正。论文未详细量化修复过程中所需的人工介入量,也未讨论当环境规模扩大时修复规则的维护成本。此外,修复环境可能过度拟合训练代理的失败模式,若代理策略改变或出现新的意外交互,之前修复的逻辑可能不再适用,需要重新迭代。
- **转移到真实 Web 场景的验证尚不充分**:尽管第 6.5 节展示了向开放 Web 的转移,提示深度环境能提升真实网站上的准确率,但实验仅针对有限的任务类型和网站。真实网站存在额外的挑战:不可预测的 UI 变化、长尾操作、登录与认证屏障、以及代理行为可能造成的不可逆副作用(如实际下单)。论文承认“live web erases the boundary”,但只给出了少量零样本迁移结果。对于真正生产级部署,还需更系统的真实环境评估,并且如何处理真实环境中的重置、安全沙盒与反馈延迟仍是未解决的问题。