论文

AsyncWebRL:面向视觉Web智能体的高效多步强化学习

AsyncWebRL:面向视觉Web智能体的高效多步强化学习

训练视觉语言Web智能体的多步强化学习是计算密集型的,存在两种主要低效形式:同步RL中的GPU空闲,以及比必要使用更多步骤和令牌的轨迹。我们提出 AsyncWebRL,同时解决这两个问题。 在系统层面,异步设计 重叠了迭代间的rollout、梯度更新和策略刷新,并搭配两种Web智能体特定适配:永久rollout池和轻量截图处理,相比于先前最快的开源同步流水线(WebGym),端到端训练吞吐量提升高达2.9倍。 在算法层面,我们发现多步 GRPO 中的每个轨迹归一化器 1/|τi| 是轨迹级别和令牌级别低效的根本原因:因为失败轨迹系统性地比成功轨迹更长,它降低了失败令牌上的负梯度权重,导致策略持续生成冗长的记忆模式。将 1/|τi| 替换为常数 1/k 打破了这种耦合,在保持整体成功率的同时缩短了轨迹。 这些贡献共同在 WebGym 分布外测试集上创造了新的开源最优结果(相对先前最佳42.9%提升5.8%),在更困难的任务上提升更大(中等难度相对提升42%,困难难度相对提升48%)。

论文精读

TL;DR 通过异步RL系统与恒定归一化因子破解多步GRPO的轨迹冗长问题,训练视觉网页智能体实现吞吐量提升2.9倍、困难任务成功率提升48%。

问题

问题背景

训练能在真实网页上自主完成长程任务的视觉-语言智能体(Visual Web Agent),已成为 AI 与 Web 自动化交叉领域的研究热点。近年来,基于多步强化学习(multi-step RL)的微调方法显著提升了这类智能体的泛化与规划能力,但其训练效率仍是制约规模化应用的关键瓶颈。

现有方法的局限

当前主流方案存在两类低效:

  • 系统层面:同步 RL 框架将 rollout(采集轨迹)、梯度更新、策略刷新三个环节串行执行,导致 GPU 长时间空闲,计算资源利用率低下。即使较优化的同步管线(如 WebGym),吞吐量仍有明显优化空间。
  • 算法层面:多步 GRPO(Group Relative Policy Optimization)使用轨迹长度倒数 1/|τ_i| 作为 per-trajectory normalizer。由于失败轨迹往往比成功轨迹更长,该归一化因子会系统性削弱失败 token 上的负梯度,使得策略持续保留冗长且无效的认知记忆(如反复输出 memory schema),既浪费 steps,又消耗大量 token,形成轨迹级与 token 级双重低效。

困难与重要性

真实 Web 任务遵循长尾分布,探索空间巨大,失败轨迹天然偏长。若规范化机制不当,负反馈被稀释,智能体无法有效辨识并压缩无效行为,会陷入“越失败越啰嗦”的恶性循环,阻碍性能收敛。同时,高昂的训练成本(数十至数百 GPU 小时)限制了快速迭代与大规模部署,因此系统与算法的协同效率优化对推动 Web Agent 从学术研究走向工业级应用至关重要。

类比:这类似于自动驾驶训练中,若不对碰撞样本进行针对性加权,长尾危险场景的梯度更新会被平滑驾驶帧淹没,导致系统难以从失败中学习关键纠正策略。

核心洞察

  • **多步GRPO中的per-trajectory normalizer(1/|τ|)会系统性地稀释失败轨迹的梯度,导致策略陷入冗长记忆生成的恶性循环。** 失败轨迹通常比成功轨迹更长,而梯度除以轨迹长度使得每一步的负梯度反比于长度,失败样本的惩罚信号被大幅削弱。因此策略持续产出冗余的 memory schema,进一步拉长轨迹、增加 token 开销。这一发现不同于以往只关注奖励设计或优势估计的工作,直接揭示了归一化因子与轨迹长度的耦合是 token 级低效的根源。替换为常数 1/k 解耦后,轨迹自然收缩,成功率保持甚至提升,且无需额外约束,为多步 RL 的梯度设计提供了新的原则。
  • **异步 RL 系统通过 everlasting rollout pool 和轻量截图处理专门适配 web agent 的训练特性,实现了 2.9 倍端到端吞吐提升。** 通用异步 RL 框架通常只解决 GPU 空闲问题,但 AsyncWebRL 更进一步:everlasting rollout pool 让 rollout 进程跨迭代复用环境状态,避免重复初始化开销;轻量截图处理压缩视觉输入而不损失关键信息,降低数据传输与处理压力。这些设计充分利用了 web 任务中页面重复访问和视觉冗余的特点,使得异步流水线在 GPU 利用率之外额外获得系统性加速,为视觉-语言 agent 的大规模在线 RL 训练提供了可复现的高效基础设施,尤其适合需要长交互周期的复杂 web 任务。

方法

AsyncWebRL 针对视觉语言 web agent 的多步强化学习训练,从系统架构与算法优化两个层面消除效率瓶颈。

输入:视觉语言模型(VLM)作为策略,接收浏览器截图、DOM 信息与任务描述,在真实网页环境中执行多步操作(点击、输入等),并获取环境返回的奖励信号。一批完整的交互轨迹 τ_i(长度不一,成功轨迹通常短于失败轨迹)构成一轮训练数据。

关键模块

  • 系统层——异步框架:将原本串行的 rollout 采样、梯度更新、策略参数刷新三个阶段解耦,通过重叠执行消除 GPU 空闲。引入两个 web-agent 专用适配:

    • 持久化 rollout 池:长期维护一组活跃的环境会话,避免每轮重建浏览器实例的高开销,同时支持持续生成新轨迹。
    • 轻量截图处理:用压缩/缓存机制降低视觉输入的传输与预处理成本,进一步提升吞吐。 这套设计相对同步方案最高实现 2.9 倍 端到端训练速度提升。
  • 算法层——归一化修正:原始 多步 GRPO 使用 1/|τ_i| 作为每轨迹的梯度归一化因子,导致失败轨迹(步数更长)的负梯度被严重缩小,使策略维持冗长的记忆模式与低效操作。AsyncWebRL 将其替换为常数 1/k,打破轨迹长度与梯度权重的耦合,让失败 token 获得一致的负反馈,从而自然缩短轨迹长度,同时保持总成功率不降。

输出:训练得到的 web agent 策略,在 WebGym 测试集上取得开放源代码的 state-of-the-art,尤其在中/高难度子集上相对提升 +42%+48%

与之前最快的同步流水线(WebGym)相比,AsyncWebRL 不仅通过异步化大幅提升训练吞吐,还通过归一化修正从根本上缓解了长失败轨迹的“惰性”学习问题,避免仅靠系统加速而延续低效行为模式。

实验

实验设计与设置

AsyncWebRL 在 WebGym 的 out-of-distribution (OOD) 测试集上评估,并按难度划分为 Medium、Hard 切片,以衡量方法在真实长尾任务上的泛化能力。基线包括先前最快的开源同步 RL 管线 WebGym(使用 GRPO 算法),以及 RAFT++ 等。主要指标为任务成功率(aggregate success);同时从系统层面统计了端到端训练吞吐量(样本数/时间),从行为层面分析了轨迹长度(步数)和 token 数。

关键发现

  • 异步系统大幅提升硬件效率:通过 everlasting rollout poollightweight screenshot handling,AsyncWebRL 让 rollout、梯度更新、策略刷新三个阶段重叠执行,消除了 GPU 空闲,训练吞吐最高达到同步管线的 2.9 倍
  • 常数归一化解耦失败惩罚:GRPO 原有的 1/|τ_i| 归一化因子使失败轨迹(通常更长)的 token 级梯度被人为缩小,导致策略持续产生冗余的记忆 schema。将归一化替换为常数 1/k 后,失败 token 的负梯度得到正确放大,促使策略学会压缩步数,轨迹长度显著缩短,同时总成功率不降反升。
  • 困难任务收益更突出:在主测试集上相对提升 +5.8%(从 42.9% 提升至约 45.4%),但 Medium 切片提升 +42%,Hard 切片提升 +48%,表明方法在复杂场景下释放了更大的潜能。

与基线的深度对比

同步 GRPO 管线的致命缺陷在于 GPU 等待 rollout 完成才能启动梯度更新,且 1/|τ_i| 导致失败样本的有效学习率远低于成功样本——因为失败轨迹天然更长,归一化后每个失败 token 的梯度贡献反而更小。AsyncWebRL 从系统和算法两侧协同消除了这一耦合:

  • 系统侧:异步设计使 GPU 持续满载,近乎线性地利用多卡,与同步方案相比,在相同的墙钟时间内可处理更多交互数据。
  • 算法侧:常数归一化迫使 RL 优化器平等对待所有 token,模型无法通过输出更多 token 来“逃避”惩罚,从而自然收敛到更简洁的交互策略。

相比单纯扩大模型或堆数据,AsyncWebRL 提供了另一种思路:通过减少无效计算和无效 token 来同时提升训练效率和智能体行为质量,这对工程落地和资源受限场景有明确的参考价值。

行业影响

落地场景

AsyncWebRL 直接赋能所有依赖视觉网页智能体的自动化业务。典型场景包括:

  • 电商运营:自动比价、库存监控、批量商品上架,替代人工在复杂页面间重复操作。
  • 金融合规:自动从监管网站抓取披露文件、填充合规报告,减少人工错误与延迟。
  • 企业 RPA 升级:传统 RPA 依赖固定选择器,遇到动态页面极易断裂;基于 VLM 的 agent 可理解屏幕,AsyncWebRL 提供高效训练方案,让 agent 适应频繁改版的内部系统。
  • 数据采集:长尾网站的信息提取,无需为每个站点编写定制爬虫。

商业价值

  • 降本:多步 RL 训练吞吐提升 2.9 倍,相同硬件下单位时间产出更多模型;推理时通过约束轨迹长度减少 token 消耗,直接降低 API 调用或本地推理成本。
  • 增收:agent 在困难任务上的相对成功率提升 40%+,可覆盖更多高价值自动化场景,扩展服务范围与收入来源。
  • 体验提升:用户等待时间缩短(轨迹压缩),成功率上升,用户留存与付费意愿增强。

与现有产品/工作流的接口

AsyncWebRL 的异步设计可无缝嵌入现有 RL 训练栈(如 WebGym、RLlib、Ray)。具体集成路径:

  1. 环境侧:复用 Playwright/Puppeteer 驱动浏览器,替换同步 rollout 为 everlasting rollout pool,持续产生轨迹而不 wait 更新。
  2. 训练侧:将标准 GRPO 的 1/|τ_i| 归一化改为 1/k 常数,无需改动模型架构。
  3. 部署:训练好的 agent 可直接导出为 vLLM 或 TGI 服务,与现有网关集成。

具体用例

  1. 电商自动下单:用户给出商品链接与购买指令,agent 自动识别页面元素、点击、填写表单。使用 AsyncWebRL 训练的 agent 在复杂结账流程中步骤更少、成功率更高,直接降低人工接管率。
  2. 金融报告自动生成:从多个数据供应商网站抓取财务数据,填入统一模板。agent 能适应各网站的不同布局,异步训练使迭代周期从数天缩短至数小时,快速响应上游网站变更。

局限

  • **异步系统依赖多 GPU 并发与大量环境实例**:`AsyncWebRL` 的加速效果依赖于 GPU 间并行 rollout 与梯度更新,以及 `everlasting rollout pool` 长期维护数百个环境实例。这在实际部署中会显著提高内存与通信开销,且轻量级截图处理可能牺牲视觉细节,对需要高精度图像理解的任务(如验证码或细粒度 UI 元素定位)可能引入额外挑战。该方法未讨论在单机或资源受限条件下的性能退化情况。
  • **常数归一化因子 `k` 的选择缺乏自适应机制**:算法层面将 `1/|τ_i|` 替换为固定常数 `1/k` 虽然解耦了轨迹长度与梯度权重,但 `k` 仍需手工调整,且不同任务或训练阶段的最优 `k` 可能不同。论文未提供自动化选择策略,也未分析 `k` 对最终策略质量(如成功率-效率权衡)的敏感度,这限制了其在未知任务上的易用性。
  • **评估仅限于单一 benchmark,绝对成功率仍偏低**:所有实验均在 `WebGym` 的 OOD 测试集上进行,虽相对提升显著,但绝对成功率仍只有约 48.7%(基线 42.9% + 5.8%)。未在更广泛 web agent 基准(如 `MiniWoB++` 或 `WebArena`)或与最新同类方法(如 `LASER`、`WebRL` 等)进行全面比较,难以判断该方法的跨任务泛化能力与真实生产环境下的可靠性。
论文Hao Bai2026-06-04原文

相关内容