论文

WebChallenger: 一个可靠高效的通用型 Web Agent

WebChallenger: 一个可靠高效的通用型 Web Agent

自主网页导航对 LLM Agent 而言仍然具有挑战性,目前最强的通用系统依赖专有推理模型,其推理成本对于此类 Agent 最适用的重复性任务来说过高。我们认为这一差距并非源于模型能力不足,而是 Agent 架构未能复现人类的三种认知优势:对相关页面区域的选择性注意、对网站结构的持久记忆、以及常见交互模式的程序化熟练度。 我们提出 WebChallenger 框架,通过架构设计而非模型规模来填补这些空白。其核心是 PageMem:一种从 DOM 确定性构建的结构化页面表示,将每个页面展现为带有简短摘要的语义区域层次结构。在这一共享基础上,我们构建了三种机制来镜像上述三种认知优势: 1. 分治观察流水线:让 Agent 浏览区域摘要,仅从任务相关区域提取细节; 2. 轻量探索与记忆系统:对每个网站遍历一次,构建页面和元素行为的可复用地图; 3. 复合动作工作流:将常见多步交互折叠为单个 Agent 动作,自动处理部分状态变化。 由于三者均基于 PageMem,该框架无需站点特定适配器即可跨网站泛化。使用未经微调的现成开源模型,我们的系统在 WebArena 上达到 56.3%,在 VisualWebArena 上达到 48.7%,在 Online-Mind2Web 上达到 51.0%,在 WorkArena 上达到 70.9%,以极低的成本接近前沿专有系统。代码已开源。

论文精读

TL;DR WebChallenger 通过 PageMem 结构化表示和认知启发,让开源模型在 WebArena 达到 56.3%,成本仅为闭源几十分之一。

问题

问题背景

利用 LLM agents 实现自主 web 导航(如表单填写、信息提取、多步业务流程)是当前前沿方向,但通用 agent 在效率与成本之间仍存在巨大鸿沟。

现有方法局限

当前领先的通用 web agent(如 SeeAct、WebVoyager)依赖闭源推理模型(如 GPT-4 系列Claude 3.5),以高 token 成本换取高成功率,难以推广至需要大量重复交互的生产场景。开源模型方案受限于 agent 架构设计,存在三个具体缺陷:

  • 感知低效:将整页渲染为截图或长文本输入,导致注意力分散、token 浪费,关键细节淹没在无关元素中。
  • 记忆缺失:每次任务从零开始探索,未复用已访问网站的页面结构与元素行为,重复消耗计算资源。
  • 动作原子化:操作空间仅含单一 DOM 事件,无法原生处理文件上传、动态表单、级联选择等需要多步状态回调的复合交互。

问题难度与重要性

Web 环境的动态性(页面结构变更、异步加载)和信息过载(上千个 DOM 节点)要求 agent 具备选择性注意与持久记忆。跨网站泛化则无法依赖站点特定适配器,必须从原始 DOM 中提炼通用结构。业界对 web agent 的需求强烈(RPA、自动化测试、数字助理),而推理成本与成功率是落地的核心瓶颈,因此通过架构创新在开源模型上实现高可靠、低成本的通用 web 导航具有重要工程价值。

行业类比

如同 RAG 通过外部知识索引减少模型幻觉与重复计算,WebChallenger 以预构建的页面记忆(PageMem)让 agent 聚焦关键区域,避免每次任务重新解析全页。

核心洞察

  • 将结构化页面表示 PageMem 作为代理的观察基础,实现符合人类认知的“选择性注意”。与现有普遍使用全量 DOM 或截图输入的代理不同,PageMem 从 DOM 确定性构建页面的语义区域层次,并为每个区域生成简洁摘要。这使得代理能够采用分治策略:先快速浏览摘要定位相关区域,再深入提取细节,大幅压缩无关信息的处理开销。该机制不依赖大模型扩展上下文窗口,而是通过架构设计直接反映人类阅读网页时的注意力分配方式,因此用低成本开放模型即可接近专有前沿系统的性能。
  • 引入离线探索与持久记忆 WebsiteMem,让代理像人一样积累网站结构知识,避免每次任务都“从零开始”。传统网页代理在每次交互中即时解析页面,缺乏跨会话的记忆,导致大量重复推理。WebChallenger 在首次访问网站时执行轻量级遍历,记录页面拓扑和元素行为,形成可复用的记忆。后续任务直接加载该记忆,显著降低在线推理的 token 量和步骤数。这种“一次探索,多次利用”的模式特别适合需要重复执行任务的场景,并使得开放模型在效率与效果上逼近专有推理模型。
  • 将复合动作工作流抽象为代理的原子动作,模拟人类执行常规交互时的“程序流畅性”。目前多数代理需要为每个微观操作(如点击、逐字输入)逐步规划,容易在长序列中累积错误。WebChallenger 把表单填写、下拉选择等常见多步交互封装为预定义工作流,代理只需调用工作流,内部自动处理状态变化和异常。这不仅减少了 agent loop 中的决策次数,也避免了因局部失败导致的整体任务中断,使得动作序列更加稳定,同时大幅节省推理成本,让开放模型在复杂网页任务中更具竞争力。

方法

输入:WebChallenger 接收原始网页 DOM 与自然语言任务描述,无需任何站点特定适配器。

核心模块

框架建立在 PageMem 之上——一种从 DOM 确定性构建的结构化页面表示。PageMem 将页面建模为语义分区层次树,每个分区携带简短摘要,剔除冗余视觉信息,暴露任务相关结构。

基于 PageMem,三个认知启发机制协同运作:

  1. 分治式观察流水线(Divide-and-Conquer Observation)
    代理先浏览分区摘要,快速定位与任务相关区域;随后仅从这些区域提取详细元素信息,大幅压缩上下文长度。流水线包含 PageMem 检索与更新、区域选择、细节提取和摘要合成四个阶段。

  2. 探索与记忆系统(Exploration and Memory)
    在每个网站首次访问时,离线遍历一次以构建可复用的页面连接图与元素行为记忆。在线推理时,系统直接利用已有地图,避免重复探索,显著降低步骤开销。遍历过程使用模板匹配过滤无关元素,并记录点击性谓词。

  3. 复合动作工作流(Compound Action Workflows)
    将常见多步交互(如表单填充、下拉选择)封装为单一代理动作。工作流自动处理中间状态变化,无需代理逐步执行,提升动作效率并减少错误累积。

所有模块共享 PageMem 表示,因此框架可跨网站泛化,无需额外适配。

输出:代理按循环执行观察-动作阶段,产生最终动作序列并通过端任务验证。

原作者论断:性能差距源于架构未能复制人类认知优势,而非模型能力不足。WebChallenger 仅用现成开源模型(如 Llama-3)即达到 WebArena 56.3%VisualWebArena 48.7%,逼近专有推理系统,且推理成本仅为后者零头。

与同类方法的差异:现有通用 web agent 多依赖昂贵的专有推理模型或微调,而 WebChallenger 通过架构创新(结构化表示+记忆+分层处理)在开源模型上实现高效泛化,证明认知启发设计可比拼模型规模扩张。

实验

实验设计

WebChallenger 在四个标准 Web 代理基准上评估:WebArena(通用网站导航)、VisualWebArena(视觉化网页任务)、Online-Mind2Web(实时网页操作)和 WorkArena(企业级工作流自动化)。所有实验使用现成的开源权重模型(如 Llama-3 等),不做任何微调,直接测试框架架构的泛化能力。消融实验剥离了三个核心机制——分治观察管线(divide-and-conquer observation)、探索与记忆系统(exploration & memory)以及组合动作工作流(compound action workflows),以验证每个模块的独立贡献。同时对比了不同规模开源模型与专有推理模型(如 GPT-4o 等闭源系统)的成本及成功率。

关键发现

  • 在无微调条件下,WebChallenger 达到 56.3%(WebArena)、48.7%(VisualWebArena)、51.0%(Online-Mind2Web)和 70.9%(WorkArena)的成功率。
  • 消融实验表明,移除记忆系统或组合动作后性能显著下降,验证了认知启发设计的有效性。
  • 框架极大压缩了推理 token 消耗与步骤数,展现出大幅优于同类开源方案的效率

基线对比解读

对比依赖昂贵闭源推理 API 的前沿系统,WebChallenger 以极低推理成本实现了非微调开源模型下的接近性能。这直接挑战了“更大模型或高成本推理才是提高网页智能体能力唯一途径”的假设,证明通过结构化页面表示(PageMem)、持久记忆与模式化动作抽象,架构创新能有效缩小与闭源系统的差距。该范式为将网页代理从实验室推向实际批量化任务提供了可行路径,尤其适合对推理成本敏感的生产场景。

行业影响

落地场景

WebChallenger 在电商运营企业 SaaS 自动化领域有直接应用。电商场景中,可对商品页面进行自主库存监控竞品价格抓取用户评论摘要,无需为每个网站定制爬虫或适配器。企业服务侧,可用于自动化 HR 入职流程(跨多个内部系统填写表单)、客户支持 ticket 路由(从 CRM 网页提取关键信息并操作)或 SaaS 产品配置向导。得益于 PageMem 的网站地图记忆,一次探索即可在新任务中复用,适合长尾网站的规模化信息抽取与交互。

商业价值

核心价值在推理成本大幅降低。论文使用开源模型(如 Llama-3)达到接近 GPT-4o 等闭源模型的效果,且显存与 token 消耗可控(平均每步约 3,000 tokens),使重复性高、调用量大的 web agent 任务在成本上可行。在客户支持数据采集场景,可替代人工操作,实现人力成本节约;在自动化测试中,加速迭代并提高覆盖率。对 SaaS 厂商而言,可将该框架嵌入产品作为无代码自动化能力,提升 ARPU 和用户粘性。

与现有产品/工作流的接口

WebChallenger 可直接以浏览器扩展Playwright 插件形态集成,输出结构化操作序列与页面理解结果。其确定性 DOM 解析结构化记忆适合对接现有 RPA 平台(如 UiPath)、低代码编排器(如 LangChain)或企业数据管道。通过 REST API 暴露 PageMem 查询和动作指令,前端工程师可将 agent 能力嵌入内部后台,实现“一句话任务”驱动网页交互。与依赖视觉模型定位的方案相比,DOM 级操作更可靠、审计日志更清晰,便于在金融、医疗等合规场景落地。

具体落地用例

  • 电商选品与动态定价:每日自动遍历竞品网站,利用 PageMem 记忆商品列表结构,仅提取价格变化区域(divide-and-conquer 观测),通过复合工作流完成搜索-筛选-抓取-填表,将价格情报直接写入内部 BI 数据库。相比全页截图+多模态模型,成本降低一个数量级。
  • 医疗平台预约自动化:帮助诊所助手在第三方医疗预约系统上完成“选择科室-查看排班-预约时间”的多步流程。探索与记忆系统在首次访问时构建网站地图,后续用户只需提供日期和科室,agent 即可自动完成剩余交互,并通过工作流处理可能的弹窗或状态变化,减少人工操作差错。

局限

  • **DOM 依赖与动态页面的局限**:PageMem 的构建完全依赖 DOM 树,对重度依赖 JavaScript 动态渲染、Shadow DOM 或 Canvas 的页面解析能力有限,且离线探索阶段假设站点结构相对稳定,频繁更新的页面可能导致记忆失效,需要重新遍历。
  • **视觉理解不足与多模态瓶颈**:尽管支持 VisualWebArena,但整体性能仅 48.7%,远低于纯文本 WebArena 的 56.3%,说明在需要细粒度视觉信息(如布局、图片语义)的任务中,当前基于 DOM 摘要的表示仍不足以完全替代屏幕截图或像素级理解,限制了在复杂 UI 场景的泛化。
  • **计算开销与初始化成本**:离线探索阶段需对每个目标站点执行完整的页面遍历与模板匹配,对于大型网站(如电商、社交平台)可能引入较高的一次性预处理开销与额外 token 消耗;此外,若任务涉及之前未遍历过的站点,则无法复用记忆,需实时构建,影响效率。
论文Jayoo Hwang2026-06-09原文

相关内容