论文

通过 State-Grounded Dynamic Retrieval 的 Web Agent 在线技能学习

通过 State-Grounded Dynamic Retrieval 的 Web Agent 在线技能学习

语言 Agent 日益依赖可重用技能来提升多步 Web 自动化的跨任务性能。现有在线技能学习方法主要在任务级别重用技能:基于初始指令检索固定技能集,并在整个执行过程中保持不变。这种静态策略与 Web 执行不匹配,因为合适的下一步动作不仅取决于任务目标,还取决于当前网页状态,而状态经常转换到初始技能无法覆盖的情况。 为解决此问题,本文提出 State-Grounded Dynamic Retrieval (SGDR),一种支持 Web Agent 逐步重用技能的在线学习方法。SGDR 包含三个组件: 1. 滑动窗口提取:将已完成轨迹转化为可在中间执行状态调用的可重用子过程; 2. 双文本-代码表示:连接技能检索与可执行动作; 3. 状态接地动态检索:根据任务目标和当前网页状态匹配技能。 在 WebArena 五个域上的实验表明,SGDR 一致优于强基线:GPT-4.1 达到 37.5% 成功率,Qwen3-4B 达到 24.3%,分别相对提升 10.6% 和 10.0%。代码已开源。

论文精读

TL;DR SGDR 让 Web Agent 根据当前网页状态动态检索可重用技能片段,实现步骤级自适应复用,在 WebArena 多域任务上显著超越静态任务级检索基线。

问题

问题背景

语言代理(language agents)在 web 自动化中正越来越多地依赖可复用的技能(skills),这些技能从已完成的任务轨迹中抽象提取,用于指导未来相似任务的执行。在线技能学习(online skill learning)允许代理持续从新轨迹中归纳技能,并在新任务中实时调用,从而不断提高跨任务泛化能力。

现有方法局限

当前的在线技能学习方法普遍采用任务级静态检索(task-level static retrieval):在任务开始时,根据初始指令从技能库中召回一组固定的技能,随后在整个执行过程中不再更新。这一策略忽视了 web 交互的本质——合适的下一步动作不仅取决于任务目标,还高度依赖当前的网页状态。状态会随着操作不断变化,常进入初始技能集无法覆盖的情景,导致动作选择错误或执行中断。例如,在表单填写任务中,从页面 A 跳转到页面 B 后,所需的填写技能可能与初始检索的技能无关。这种静态技能复用与实际执行过程的脱节,构成了明显的技术瓶颈。

为什么这个问题难且重要

Web 自动化面临状态空间巨大、动态性强且高度异构的挑战,技能库规模随任务增多不断扩大,如何根据当前状态(而非仅任务目标)在庞大的技能空间中快速精准匹配,是一个非平凡的检索问题。同时,技能必须既要能嵌入自然语言描述以用于语义匹配,又要包含可执行代码以便直接调用,这种双模表示增加了建模复杂度。在线学习场景更要求整个提取、检索、注入流程必须在执行中实时完成,不能引入过高延迟。业界中,智能 web 代理在自动化测试、RPA、数据采集、表单填写等场景需求强烈,技能复用效率直接决定代理的成功率与成本,因此该问题兼具研究价值与应用紧迫性。

行业类比

这一挑战类似于大模型 Agent 在长程任务中需要根据对话历史当前语境动态检索相关记忆或工具,而非仅在对话发起时选定一组固定工具,唯有动态适配上下文,才能应对复杂多变的实际执行流。

核心洞察

  • 动态技能检索打破了任务级静态假设。现有在线技能学习方法在任务开始时基于初始指令检索一组固定技能,并在整个执行过程中保持不变。SGDR 提出在每一步都根据当前网页状态动态检索技能,这更贴近真实 web 交互——随着页面跳转,所需的子操作可能完全不同。这一变化直接解决了静态策略在状态转换后技能失配的问题,使得代理能够动态适应执行中涌现的新子任务,显著提升了复杂多步任务的完成率。
  • 状态-目标联合检索与滑动窗口提取实现了细粒度、高适应性的技能复用。SGDR 不仅考虑任务目标,还将当前网页状态嵌入检索过程,并通过 MMR 重排序保证检索结果的多样性与相关性,避免冗余技能干扰。同时,滑动窗口将完整轨迹切割为可在中间状态调用的子程序,并用双表示(文本+代码)连接检索与可执行行动,使技能注入更直接、执行更可靠。这种从轨迹粒度、表示方式到检索时机的全链路设计,区别于以往仅基于任务级或单一表示的方法,为在线技能学习提供了更工程化的参照路径。

方法

方法概述

SGDR 是一种面向 Web 智能体的在线技能学习方法,核心目标是在多步网络自动化任务中实现逐步的动态技能重用。其设计围绕三个关键模块展开:基于滑动窗口的技能提取与表示、基于状态的动态检索,以及技能注入执行。

输入 → 关键模块 → 输出

  1. 技能提取与表示
    智能体从已完成的任务轨迹中抽取可复用的子过程。使用 滑动窗口提取 (sliding-window extraction) 将长轨迹切分为多个片段,每个片段对应一个在中间执行状态可调用的子技能。技能被编码为 双重文本–代码表示 (dual text–code representation):文本描述用于后续语义匹配,可执行代码用于指引动作生成。

  2. 状态基础动态检索 (State-Grounded Dynamic Retrieval)
    这是方法的核心创新。在任务执行的每一步,检索机制会同时考虑当前任务目标与当前网页状态(而非仅初始指令)。它首先进行相关性检索,再通过 MMR 重排序 (Maximal Marginal Relevance reranking) 平衡相关性与多样性,得到一组最适合当下情境的技能集合。与现有方法在整个任务开始时选择一组固定技能不同,SGDR 在每个执行步都动态更新技能集,从而应对网页状态转移带来的新需求。

  3. 技能注入与执行 (Skill Injection and Execution)
    将检索到的技能文本描述注入语言模型的提示中,指导模型生成下一步动作。智能体执行动作后进入新状态,重复执行动态检索和注入过程,直至任务完成。

输出

智能体在每个步骤获得贴合当前状态的动作建议,最终完成整个网络任务。相比静态任务级技能重用方法,SGDR 将技能检索从固定的前置步骤转变为执行过程中的自适应环节,使技能复用更贴合 Web 任务的动态特性。

实验

实验设计

WebArena 基准的五个领域(购物、CMS、Reddit、Git、地图)上评估 SGDR。与任务级技能检索基线(静态检索)对比,使用 GPT-4.1Qwen3-4B 作为基座模型。主要指标为任务成功率,辅以执行效率、在线性能与消融分析。

关键发现

  • SGDR 在 GPT-4.1 下平均成功率达 37.5%,相对最强基线提升 10.6%;在 Qwen3-4B 下达 24.3%,相对提升 10.0%
  • 消融实验证实 滑动窗口提取MMR 重排序双文本-代码表示 均带来显著增益,移除任一部分均导致性能下降。
  • 动态检索降低了无效技能调用,提高了执行效率;在线性能分析显示,随着技能池增长,SGDR 的累积优势持续扩大,验证了终身学习的潜力。

基线对比深度解读

传统任务级检索仅在任务初选固定技能集,难以应对网页执行中频繁的状态转换,导致中间步骤缺乏合适技能。SGDR 通过 状态接地动态检索,每一步都结合当前网页状态与任务目标检索最匹配的子过程,在关键转折点提供精准引导。双文本-代码表示将自然语言描述与可执行代码绑定,确保检索结果可直接激活。与静态基线的对比表明,SGDR 的增益主要源于执行上下文敏感的技能匹配,这为 web agent 的在线技能学习提供了更高效的实用框架。

行业影响

落地场景

SGDR 所提出的状态感知动态技能检索,可直接应用于需要跨步骤、跨页面交互的 Web 自动化产品中。典型场景包括:

  • 电商运营自动化:批量下单、退货处理、商品上架等 workflow,页面状态频繁跳转(登录、购物车、支付确认),SGDR 可根据当前页表单项动态调用对应填写技能,减少因固定策略导致的执行中断。
  • 企业 SaaS 流程机器人:如 CRM 数据批量录入、HR 系统多页面审批,不同客户实例的界面微调常导致传统固定脚本失效,SGDR 根据实时 DOM 状态匹配相近子流程,提升鲁棒性。
  • 内容审核与发布:跨平台内容分发需适应各平台后台上传、标签设置、发布确认的差异,动态技能复用可避免为每个平台单独编写流程。

商业价值

  • 降低自动化构建与维护成本:传统 RPA 或自动化脚本需针对每个网页元素硬编码,页面改版即失效。SGDR 通过在线从历史执行轨迹抽取子技能并动态检索匹配,使同一技能库可跨相似任务复用,大幅减少人工重写和维护投入。
  • 提升执行成功率与吞吐量:在 WebArena 基准上,GPT-4.1 搭配 SGDR 相对最强基线有 10.6% 的相对提升。更高的自动化成功率直接转化为客服、运营团队的人力释放,以及更快的业务响应速度。
  • 拓展可编排的业务范围:许多长尾 Web 流程因 ROI 低未被自动化,SGDR 降低研发难度后,更多流程可被编排,扩大自动化覆盖面。

与现有工作流的接口

SGDR 可作为独立 技能检索与注入模块 集成到现有 LLM-based agent 框架中(如 LangChain、AutoGPT、BrowserGym)。集成方式:

  1. 输入:agent 在当前步骤的初始指令 task_instruction 与当前网页可访问性树或截图文描述 state_representation
  2. 处理:SGDR 利用双编码器(文本-代码表示)进行稠密检索 + MMR 重排,动态返回 top-k 相关历史子技能(代码片段与激活条件)。
  3. 输出:将检索到的技能以 function 单元注入 agent 的 prompt(类似工具调用),让 agent 选择执行或生成变体。

该模块可直接替换现有基于整体任务检索的静态技能库,无需改动 agent 推理引擎,即可将任务级别的固定技能集升级为步级别的动态匹配。对于已有大量历史执行轨迹的企业,只需运行一次性滑动窗口提取构建技能库,即可持续受益。

具体落地用例

  • 跨境电商退货处理:客服 agent 需依次进入订单页面、选择退货原因、生成退货单、确认退款。不同市场的退货门户界面差异大,SGDR 根据当前页面局部元素(如“退货原因”下拉框内容),从历史成功操作中检索相似子序列,精准选择对应选项,避免因界面布局变化而失败。
  • 金融表单合规报送:在监管平台定期提交多份结构化财报,每份表单字段类似但页面跳转逻辑不同。SGDR 可在某表单确认页匹配到过去另一表单的“核对汇总-提交”子技能,自动完成执行,降低人工核对工作量。

局限

  • - **缺乏真实世界环境验证**:实验仅在 WebArena 模拟平台上进行,虽然覆盖了五个域,但任务仍为合成式,难以代表真实网页交互的复杂性和多样性。真实网页包含动态内容加载、反爬机制、登录鉴权等挑战,这些都可能破坏技能检索与执行的假设。此外,仅评估 GPT-4.1 和 Qwen3-4B 两种模型,未探索其他参数规模或架构,模型的规模敏感性和跨模型泛化能力仍未知。
  • - **技能提取与表示的泛化性受限**:滑动窗口提取依赖完整的高质量轨迹,并要求子任务边界相对清晰。双重文本-代码表示虽然连接了语义与可执行操作,但在实际构建中,并非所有网页操作都有易提取的代码片段,特别当动作空间复杂或步骤粒度粗细不一时。动态检索中的 MMR 重排增加了在线推理的计算开销,可能在高并发场景下影响实时响应,而论文对此开销的分析仅限于单次轨迹,缺少大规模部署的估计。
论文Jiaxi Li2026-06-03原文

相关内容