论文

PANDO: 高效多模态AI代理通过在线技能蒸馏

PANDO: 高效多模态AI代理通过在线技能蒸馏

近期多模态网页代理的进展常依赖增加推理计算,包括rollout搜索、验证器传递、离线技能发现和专家模型堆栈。这引发一个核心问题:网页代理能否通过积累经验变得更高效,而非更昂贵?我们首先分析VisualWebArena轨迹,识别三个重复的低效来源:重复动作循环、隐藏发现成本和低提示缓存重用。 我们提出PANDO,一个单rollout在线技能蒸馏框架,维护结构化的技能库,并结合进度反思、基于置信度的技能降级、层次路由、视觉压缩和缓存感知提示。在全部910个VisualWebArena任务上,PANDO达到58.3%成功率,优于SGV(54.0%)和WALT(45.2%),同时使用比SGV少58%的token,比WALT少61%的token,且无预评估发现预算。300任务消融显示,规则和惯例贡献了大部分成功提升,而路由、压缩和缓存感知提示将更大的技能库转化为更低的边际token成本。 最后,我们引入三个轨迹级效率指标:动作重复率、步骤开销比和提示缓存利用率,使效率在终端成功之外可见。

论文精读

TL;DR PANDO 通过在线技能蒸馏让多模态 web 代理在任务积累中持续减少推理开销,在 VisualWebArena 上以更少 token 实现更高成功率,首次将效率指标纳入代理评估。

问题

问题背景

多模态 Web Agent 正逐渐成为自动化复杂网页任务的核心技术,在 VisualWebArena 等评测基准上,系统需结合视觉理解与动作规划完成多步交互。当前主流方案为提升任务成功率,普遍采用更高成本的推理策略,如多路 rollout 搜索、独立验证器、离线技能发现或专家模型堆栈,形成了“成功率越高、推理成本越昂贵”的惯性路径。

现有方法局限

VisualWebArena 轨迹分析可识别出三类反复出现的效率瓶颈:(1) 重复动作循环 — Agent 陷入无效反复操作,大量生成重叠步骤但未推进任务;(2) 隐藏发现成本 — 离线技能挖掘需预先投入巨额 token 预算,且技能无法在线进化;(3) 低提示缓存复用 — 每次调用均重新构造上下文,未利用相似状态下的共享信息。此外,现有方法缺乏对 经验累积 的有效利用:Agent 不会因为处理更多任务而变得更“省”,反而因为更复杂的推理堆叠而持续膨胀 token 开销,这与自适应系统的长期效率目标背道而驰。

为什么这个问题难且重要

Web 环境高度动态且动作空间巨大,多模态输入(截图、DOM、文本)使得成本敏感的在线推理极具挑战。难点在于如何在不牺牲成功率的前提下,将过去任务中的经验固化为可复用的 Skill Library,并在新任务中动态选择合适技能,同时通过路由、压缩与缓存机制降低边际成本。业界对 token 经济 关注度持续上升,因为真实部署中每千次任务调用可能产生数百万 token 开销,直接决定系统可扩展性与商业可行性。如何在终身学习过程中实现“越做越省”而非“越做越贵”,是迈向可持续 Agent 系统的关键问题。

行业类比

类似对话式 AI 助手通过缓存频繁请求的上下文、复用用户画像来降低重复推理成本,多模态 Agent 也亟需一套 在线技能蒸馏 + 分层路由 + 缓存感知提示 的机制,将经验转化为可量化效率提升,而非单纯堆叠算力。

核心洞察

  • PANDO 证明 Web Agent 可以通过经验积累实现效率正循环,而非依赖更昂贵的推理时计算。现有方法如 SGV、WALT 普遍通过增加 rollout 搜索、验证器或预评估发现来提升成功率,导致 token 消耗不减反增。PANDO 创新性地将每次执行轨迹实时蒸馏为结构化的技能库(规则与例程),配合分层路由、视觉压缩和缓存感知提示,首次在 VisualWebArena 全量 910 任务上以比 SGV 少 58%、比 WALT 少 61% 的 token 开销,将成功率推至 58.3%,打破了“性能-成本”跷跷板。
  • 轨迹级效率指标让优化方向从只看最终成功率转向可测量的过程效率。论文引入动作重复率(ARR)、步骤开销比(SOR)和提示缓存利用率(PCU),直接量化了以往被忽略的重复动作、隐藏发现成本和缓存浪费,这些正是传统方法成本膨胀的根源。通过消融实验进一步揭示,规则和例程对成功率提升贡献最大,而路由、压缩和缓存感知提示则负责任务规模扩大时的边际 token 成本压缩,为技能库的实时增长与低成本执行提供了可分离、可优化的工程路径。

方法

PANDO 框架围绕在线技能蒸馏构建,将单次 rollout 的经验转化为可复用的技能库 (Skill Library),从而在后续任务中降低推理开销。

输入与状态表示

Agent 接收网页截图、DOM 结构及自然语言指令。通过视觉压缩模块减少图像 token 数量,同时利用缓存感知提示重用上一次交互的提示缓存,避免重复编码。

核心模块

  1. 技能表示与检索:技能库包含两类技能——规则 (rules)(条件-动作映射)和例程 (routines)(动作序列),通过极性对合并将正反例程(如“点击登录”与“点击退出”)统一为一条可参数化的技能。检索时基于当前状态计算相似度。
  2. 分层路由:每次决策时,先尝试匹配高置信技能;若失败则回退到通用模型推理。路由会考虑任务进度和技能成功率,动态调整探索-利用平衡。
  3. 进度反思与技能蒸馏:每步执行后评估任务进展,当达到预设里程碑(如页面跳转、表单填写完成)时,将当前轨迹片段蒸馏为新的规则或例程并存入技能库。
  4. 置信度降级:每个技能附带置信度分数,若连续导致错误或无效动作,则被降级或移入黑名单,防止污染后续决策。
  5. 执行经济:单次 rollout 期间,路由、压缩和缓存协同控制 token 生成量,杜绝重复的动作循环(repeat-action loops)。

输出与运行时

Agent 仅执行单次 rollout,输出动作序列,无需多轮搜索或验证器。每完成任务后,离线更新技能库,无需额外的预评估发现预算

与 SGV、WALT 等需要大规模推理时搜索或多模型堆叠的方法相比,PANDO 通过在线蒸馏将经验固化为结构化技能,在维持高成功率的同时大幅降低 token 消耗,实现了“越用越便宜”的终身学习范式。

实验

实验设计

PANDO 在 VisualWebArena (VWA) 全部 910 项任务上评估,对比基线 SGVWALT。实验采用单次 rollout 在线技能蒸馏,无预评估发现预算。消融实验在 300 任务子集上进行,分析组件贡献。同时引入 Action Repetition RateStep Overhead RatioPrompt Cache Utilization 三项轨迹级效率指标,将效率度量从终端成功率扩展到推理过程。

关键发现

  1. 成功率与效率双提升:PANDO 以 58.3% 成功率击败 SGV (54.0%) 与 WALT (45.2%),同时 token 消耗比 SGV 低 58%、比 WALT 低 61%。
  2. 经验积累降本:通过 结构化技能库进度反思信心驱动退化层次化路由视觉压缩缓存感知提示,PANDO 随着任务积累变得更廉价,而非更昂贵。
  3. 消融归因:规则与例程(rules & routines)贡献了大部分成功率增益;路由、压缩和缓存感知将更大的技能库转化为更低的边际 token 成本。

基线对比解读

SGV 和 WALT 代表两类主流方案:前者依赖 rollout 搜索与验证器过次,后者使用离线技能发现与专用模型堆栈,均以增加推理计算换取性能。PANDO 反过来,通过 在线技能蒸馏 把历史轨迹转化为可复用的技能,避免重复探索。其 58.3% 成功率高于两者,且 token 开销大幅降低,这意味着 从经验中提炼可复用知识 比单纯扩大推理搜索更具扩展性。消融进一步揭示,效率优势源于技能库的组织与查询优化(路由、压缩、缓存),而不仅仅是技能数量。这为构建经济型多模态 agent 提供了清晰路径:经验的可复用性与检索效率同等重要

行业影响

落地场景

PANDO 所代表的在线技能蒸馏框架,可直接用于需要持续与环境交互的多模态 agent 产品:

  • 浏览器任务自动化:电商平台商品搜索 / 比价 / 下单、差旅预订、表单填充等流程自动化,通过经验积累逐步降低每次任务的 token 消耗,让 agent 越用越便宜。
  • 企业 RPA 升级:从规则驱动转向 LLM 驱动,但成本可控,适用于财务报告抓取、竞品监控、合规审计等需频繁访问 Web 界面的场景。
  • 内容与数据平台:自动采集结构化信息、监控价格波动、跨站点聚合数据,通过缓存感知提示视觉压缩在大规模抓取中显著压缩开销。

商业价值

原作者指出,SGV 和 WALT 的 token 成本中约 50–60% 来自重复动作和低效缓存利用,PANDO 将其削减至原来的 42% 以下,同时成功率反超。

  • 直接降本:单任务 token 用量减少 58–61%,对应 API 调用费用大幅下降,使 agent 服务在定价上更具竞争力。
  • 可预测的运营曲线:学习曲线显示 token 成本随任务数收敛,与无积累的基线形成剪刀差,适合按调用量计费的 SaaS 模式,边际成本递减。
  • 体验提升:去除了预评估探索预算,首次运行即具竞争力,避免了上线前的冷启动成本。

与现有产品 / 工作流接口

PANDO 可以作为智能执行层嵌入现有 agent 栈:

  • 与通用 LLM API 对接:使用标准聊天接口,技能库以结构化 JSON 持久化,可存放于对象存储或向量数据库,适合接入 LangChain、AutoGPT 等框架。
  • 渐进式集成
    1. 在已有基于多步 rollout 或验证器的 agent 中,将 PANDO 的分层路由缓存感知提示作为替代推理策略,无需重构整体架构。
    2. 创建技能库共享层,多个 agent 实例共享提炼的技能,进一步摊薄学习成本。
  • 监控与度量:论文定义的动作重复率 (ARR)、步骤开销比 (SOR)、缓存利用率 三个可观测指标,可直接集成到现有 agent 的观测面板,衡量效率改善。

具体落地方案

  • 电商客服 Agent:在大型购物平台,客服自动处理退款/换货等流程需跨页面操作。PANDO 可将每次成功交互提炼为技能,后续同类请求仅触发少量 token,且缓存重用减少延迟,在促销季高并发下直接降低推理集群成本。
  • 金融研究助手:抓取财报、新闻、市场数据并生成摘要。传统 agent 因页面结构变化常重复探索,PANDO 通过 progress reflection基于信心的技能降级 防止循环,节省的 token 可转化为更快的报告生成,对投行研究部门有即时价值。

局限

  • **任务泛化与技能漂移风险**:PANDO 的技能库完全依赖 VisualWebArena 的在线交互蒸馏,技能表示与任务分布高度耦合。当评估环境发生显著域迁移(如 Website 布局、交互 API 变更)时,已积累的 rules 和 routines 可能失效,需要重新探索;论文未验证跨平台或持续部署下的知识退化与遗忘问题,实际生产环境中技能库的生命周期管理仍是一个开放挑战。
  • **组件依赖与超参敏感性**:框架集成了进度反射、置信度降级、分层路由、视觉压缩和缓存感知提示等多个机制,实验虽通过 ablation 验证各组件贡献,但未分析组件间的交互效应及超参在更大任务规模下的稳定性;例如 `confidence threshold` 和 `demotion blacklist` 的设计依赖启发式,可能在长周期任务中因技能库膨胀或低频技能堆积而损害效率。
  • **单智能体闭环的局限性**:PANDO 采用贪婪单次 rollout,避免了多方案搜索和验证器开销,但也意味着无法从并行探索中受益;当遭遇歧义或错误恢复点时,缺乏回溯能力可能导致整条轨迹失败。与具有自校正循环或多路径评估的智能体(如 SGV 的 verifier)相比,在复杂动态网站上的鲁棒性可能存在天花板。
论文Yubo Li2026-05-26原文

相关内容