论文

OpenWebRL: 揭秘视觉网页代理的在线多轮强化学习

OpenWebRL: 揭秘视觉网页代理的在线多轮强化学习

构建能力强的视觉网页代理需要长程推理、精确接地以及动态真实网站的稳健交互。尽管进展迅速,最强系统仍主要是专有的,而开源代理严重依赖在大型策划的网页轨迹集上的监督后训练,造成可扩展性瓶颈:高质量演示收集成本高,静态数据集覆盖有限。虽然在线 RL 在文本代理中显示出潜力,但其直接在真实网站上训练视觉网页代理的潜力尚未充分探索。 本文介绍 OpenWebRL,一个用于在真实网站上使用在线多轮 RL 训练视觉网页代理的开放框架。OpenWebRL 涵盖完整训练流程,包括可扩展的实时代理基础设施、监督初始化、多模态上下文管理、轨迹级成功判断和高效多轮策略优化。 使用该框架,我们训练 OpenWebRL-4B,在具有挑战性的实时代理基准测试上建立了新的开源最先进水平。仅使用 0.4K 初始化轨迹和 2.2K 开放式 RL 训练任务,OpenWebRL-4B 在 Online-Mind2Web 上达到 67.0% 成功率,在 DeepShop 上达到 64.0%,优于先前类似或更大规模的开源代理,并与专有系统(包括 OpenAI CUA 和 Gemini CUA)竞争。 除强劲基准性能外,我们系统研究使在线 RL 对视觉网页代理有效的关键设计选择,并分析 RL 如何改进代理推理。总体而言,我们的工作为构建更强大、可复制、成本效益高的开放网页代理提供了实用路径。我们将发布训练数据、模型和代码以支持未来研究。

论文精读

TL;DR OpenWebRL 提出首个开源的在线多轮 RL 框架,直接在真实网站上训练视觉 web 代理,仅用千级监督样本即在新基准上达到 SOTA,大幅降低了对昂贵人工演示的依赖。

问题

问题背景

视觉网页智能体旨在自主操作浏览器完成复杂任务,如购物、信息检索和表单填写。随着多模态大模型的发展,该领域正从理论走向落地,但训练出能可靠处理长时交互、动态页面和细粒度视觉定位的智能体仍是开放挑战。

现有方法的局限

当前开源视觉网页智能体普遍依赖监督微调 (SFT),即从大量人工标注或人工筛选的网页交互轨迹中学习。这一范式存在三个根本性瓶颈:

  1. 数据获取成本高:高质量演示需要专业标注员逐步操作,且每个任务网站不同,无法批量生产。
  2. 分布覆盖窄:静态数据集难以反映真实开放网络的多样性(网站布局频繁更新、A/B 测试、个性化内容),导致智能体在未见网站上崩溃式遗忘。
  3. 缺乏探索反馈:SFT 只是行为克隆,无法让智能体从试错中理解“为什么某些操作会失败”,因此策略容易被无关视觉噪声误导,鲁棒性差。 相比之下,以 GPT-4VGemini 驱动的闭源系统虽性能更强,但其训练细节不透明,且受限于 API 调用与隐私约束,无法用于敏感场景的本地部署。

为什么这个问题难且重要

训练视觉网页智能体需要同时解决多模态理解(解析截图与 HTML)、长程规划(跨多步操作达成目标)、精确视觉定位(在密集页面中定位按钮/输入框)和实时交互鲁棒性(处理弹窗、加载延迟)。将在线强化学习 (RL) 引入该任务面临三大工程挑战:

  • 环境构建:必须搭建可扩展、安全且能捕获状态变化的真实浏览器沙箱;
  • 奖励设计:网页任务的成功判定往往是稀疏且二元的,信号噪声需通过轨迹级评判模型滤除;
  • 样本效率:多轮 RL 在高维动作空间下易发散,需要精心设计策略优化算法以在少量交互中收敛。

业界对该问题的关注度极高:OpenAI CUAGoogle Gemini CUA 等专有代理已进入产品化阶段,但开源社区始终缺乏一套完整的在线 RL 训练框架,导致研究与产业落地之间存在断层。

行业类比

这类似于自动驾驶从静态驾驶数据训练转向在模拟器中在线学习:仅依靠人类驾驶录像无法应对未知路况,只有让车辆在虚拟环境中探索、碰撞并接受反馈,才能习得稳健的策略。同理,网页智能体必须在真实网站的即时交互中打磨其决策推理能力。

核心洞察

  • 在线多轮强化学习(RL)用极少量监督示例即可训练高性能视觉网络代理,打破了“海量演示数据是必须”的认知。OpenWebRL仅用0.4K初始轨迹和2.2K在线任务,就让4B模型在 Online-Mind2Web 达到67.0%,超越了许多依赖数十万演示的同类开源代理。其独特之处在于将训练直接搬到真实网站上,通过与环境实时交互让模型自我纠错,从而在动态网页变化中学习更鲁棒的推理策略,大幅降低了对静态离线数据集规模和质量的依赖。
  • 轨迹级成功判断(judge)与混合奖励设计是实现在线RL的核心工程突破。OpenWebRL设计了一个融合规则检查与LLM语义评估的 judge 模型,为每个多轮交互轨迹自动生成可靠奖励信号,克服了网络代理任务中奖励稀疏、延迟的瓶颈。这与其他工作依赖任务完成信号或人工标注不同,它使得多轮GRPO策略优化能够在无外部信号干预下稳定收敛,为开放世界视觉代理的RL训练提供了可复现的奖励工程范式。

方法

方法概述

OpenWebRL 是一个端到端的在线多轮强化学习框架,用于训练视觉 Web 智能体。它摒弃了传统依赖大规模静态人工示范的监督范式,转而通过少量**监督微调 (SFT)**初始化和大量在线交互自动完成策略提升,核心流程为:少量初始数据 → SFT 初始化 → 在线交互采集与裁判 → 多模态多轮 GRPO 优化 → 最终策略

输入与智能体框架

框架接收真实网站任务描述,智能体通过浏览器实时获取页面截图、可访问性树等多模态观察。动作空间覆盖点击、输入、滚动等低层操作。环境反馈除浏览器状态外,还包含文本化的错误信息与超时处理,确保交互鲁棒性。

关键模块

  • 监督初始化 (SFT):仅使用 0.4K 条高质量示范轨迹进行微调,为 RL 提供可靠起点,避免冷启动发散。
  • 奖励与裁判模型:轨迹级成功判断由三部分组成:基于规则的格式校验、状态过滤,以及专用的 OpenWebRL-Judge-8B 裁判模型。该模型以 LLM-as-a-judge 方式评估任务完成度,组合奖励信号有效滤除无效或不可靠样本。
  • 多模态多轮 GRPO (MM-GRPO):核心在线 RL 算法。将 GRPO 扩展至多模态多轮场景,显式管理历史观察、动作的上下文窗口,避免冗长序列下的遗忘。每次交互生成动作后,结合环境奖励与裁判反馈计算轨迹级优势,分组进行策略梯度更新。这一设计既保证了多轮推理的连贯性,又维持了训练的高效性。

输出与差异点

最终产出 OpenWebRL-4B 模型,在在线基准 Online-Mind2Web (67.0%) 和 DeepShop (64.0%) 上达到开源新 SOTA,性能与闭源系统(如 OpenAI CUA)可比。与纯监督方法的关键差异在于:不依赖昂贵大规模示范,而是利用在线 RL 直接探索真实动态网站,以极少的初始标签成本实现更强的泛化与效率。

实验

实验设计

OpenWebRL 使用在线 RL 框架,在真实网站上训练视觉 web agent。实验流程分为两个阶段:

  • 监督初始化:仅使用 0.4K 条精心选择的示范轨迹对模型进行监督微调 (SFT)。
  • 在线 RL 训练:在 2.2K 个开放式的在线任务 (Online-Mind2Web 和 DeepShop) 上进行多模态多轮 GRPO 优化。

训练中引入了自定义 judge 模型 (OpenWebRL-Judge-8B) 对完整轨迹进行成功评判,并集成了实时浏览器基础设施多模态上下文管理失败诊断等工程组件。最终得到的模型为 OpenWebRL-4B 。

关键发现

  1. 小规模监督 + 在线 RL 即可达到领先性能:仅用 0.4K 初始化轨迹,OpenWebRL-4B 在 Online-Mind2Web 上取得 67.0% 成功率,DeepShop 上取得 64.0% ,远超其他使用更大规模监督数据的开源 agent。
  2. 在线 RL 提升 agent 推理能力:通过分析学习动态和推理链,发现 RL 训练使模型学会更有效的多步规划错误恢复,而不是简单模仿行为。
  3. 框架成本效益高:仅需 2.2K 个 RL 训练任务,无需海量昂贵标注,训练流程可复现。

基线对比深度解读

与前期开源视觉 web agent 相比,OpenWebRL-4B 在相同或更小模型规模下实现了显著提升(Online-Mind2Web 上约 +10~20 个百分点,具体取决于基线),而其中许多基线使用了数万条有监督轨迹。与专有系统相比,OpenWebRL-4B 与 OpenAI CUA 和 Gemini CUA 的性能差距已缩小到可竞争范围,但具体数值论文未直接给出。这表明在线 RL 具有弥补数据和模型规模差距的潜力。此外,消融实验证实了多轮上下文管理轨迹级 judge 对最终性能至关重要。

行业影响

落地场景

OpenWebRL 提供了一套低成本、高适应性的视觉 Web 代理训练方案,尤其适合需要与动态网站进行多步交互的自动化场景。典型应用包括:

  • 电商自动化:自动比价、库存监控、批量下单、退货处理,直接消化真实页面变动,无需频繁维护脚本。
  • RPA 升级:为传统机器人流程自动化注入视觉理解与在线学习能力,处理非结构化网页、动态表单,减少人工处理异常。
  • 数字助理:集成到浏览器插件或企业 SaaS 中,帮助用户完成跨站事务(如从多个平台汇总发票、自动填写报销单)。
  • Web 测试:智能回归测试,能够适应前端频繁迭代,自动发现 UI 变化带来的功能缺陷。

商业价值

核心价值在于大幅降低标注与维护成本,同时提升自动化覆盖率

  • 降本:仅需 0.4K 条监督微调轨迹与 2.2K 个 RL 任务即可训练出 SOTA 模型,远少于传统行为克隆所需的海量人工演示。在线 RL 令代理从失败中持续学习,减少人工修正。
  • 增收/体验:更高成功率的自动化直接缩短任务处理时间,提升客户服务效率(如智能客服自主操作网页解决问题),带来更好的用户体验,间接增加转化。
  • 可复制性:全开源框架让中小团队也能构建定制化 Web 代理,打破专有系统的垄断,加速整个行业的自动化水平。

与现有工作流的接口

OpenWebRL 可作为一个可训练的浏览器交互模块,嵌入现有技术栈:

  • Playwright / Selenium 等工具无缝衔接,利用其沙箱执行、超时恢复等基础设施,通过交互式浏览器环境提供实时反馈。
  • 可作为 LangChain / AutoGPT 等 Agent 框架的“视觉 Web 执行器”,提供可靠的动作执行与在线学习能力。
  • 在企业级 RPA 平台(如 UiPath、Automation Anywhere)中,可替代脆弱的选取器,通过视觉理解适应 UI 变化,并持续从操作日志中学习改进。
  • 输出标准化动作空间(点击、输入、滚动等),可轻松被上层业务编排流程消费。

具体用例:

  1. 金融合规报告自动填报:从内部数据库抽取数据,代理自动登录监管平台,适应每年变动的表单字段与页面结构,成功提交报告,错误率远低于硬编码脚本。
  2. 内容平台舆情监控自动化:代理定期爬取指定新闻网站评论区、论坛,根据视觉布局自适应提取帖子与回复,无需针对每个站点单独开发解析器,新站点上线后可快速泛化。

局限

  • - **奖励模型依赖与泛化风险**:OpenWebRL 使用 **LLM-as-a-judge** (OpenWebRL-Judge-8B) 自动评估轨迹成功,但该判别器本身可能引入系统性偏差,尤其在开放域任务中其判断标准不完全对齐人类意图;论文虽验证了 Judge 与人工标注的较高一致性,但在分布外网站或新颖的用户指令下,奖励信号的可靠性会显著下降,这限制了 RL 训练的可扩展上限。
  • - **视觉输入的单一性与鲁棒性**:当前框架仅依赖网页截图作为视觉输入,没有利用 DOM 结构、HTML 或可访问性树等额外模态,因此对视觉噪声、遮挡、布局剧烈变化等真实场景的鲁棒性不足;从错误分析可见,智能体因视觉歧义导致动作不准确的案例占比不小,表明纯视觉策略在复杂动态环境中仍有明显短板。
  • - **训练规模与任务多样性有限**:虽然仅用 0.4K 初始化轨迹与 2.2K RL 训练任务即取得强结果,但任务集主要来自 **Online-Mind2Web** 和 **DeepShop** 两个基准,覆盖面有限;这种低成本优势可能过度拟合到特定网站类型(如电商、信息检索),在更广泛的真实 web 任务上(例如表单填充、长流程跨站交互)的性能尚不明确,泛化性存疑。
论文Rui Yang2026-06-01原文

相关内容