论文

TRACE: 面向高效 GUI Agents 的轨迹鲁棒准入与证据排序

TRACE: 面向高效 GUI Agents 的轨迹鲁棒准入与证据排序

问题:GUI agents 在轨迹推进过程中会持续累积高分辨率截图,推高推理延迟与内存占用。免训练的视觉 token 剪枝能降低成本,但 缓存复用 带来了根本性约束:一旦 token 被丢弃,对应的视觉证据就无法在不重新编码的情况下恢复。因此剪枝本质上是一次不可逆的 准入决策,既要对未知的未来目标保持有用,又要在紧张预算下维持可操作区域的覆盖。 方法:为此,作者提出 TRACE,一个免训练框架,用于 轨迹鲁棒准入 与 覆盖感知的证据排序。具体而言: - 将查询无关的 布局导出交互先验 与指令相关性、特征新颖度结合,按未来潜在效用与多样性对视觉证据排序; - 预留一部分预算给分布在全屏的 原生视觉 token,在不破坏排序的前提下修复缺失的空间覆盖。 上述机制共同产生 嵌套 token 顺序(nested token order),使保留的视觉证据能随预算单调收缩,并在整条轨迹中保持可复用。最后,单调 KV 收缩(monotone KV contraction) 将退役帧增量压缩为紧凑的 session state,避免重复的视觉编码或剪枝。 实验:在六个 GUI 基准与多种模型上的大量实验,验证了该方法在紧张预算下的有效性,源码将开源。

论文精读

TL;DR TRACE 是一个训练无关的 GUI 智能体视觉 token 剪枝框架,通过轨迹鲁棒准入、覆盖感知证据排序与单调 KV 收缩,在极小预算下保留可操作区域,显著降低推理延迟与内存占用。

问题

问题背景

GUI agents 依靠 MLLMs 逐帧理解屏幕,长轨迹过程中高分辨率截图累积大量视觉 token,导致推理延迟与 KV cache 内存开销急剧上升。

现有方法局限

Training-free 视觉 token 剪枝可以缓解成本,但在 cache 复用机制下,剪枝成为一个不可逆 admission 决策:一旦 token 被丢弃,对应的视觉证据无法恢复,除非重新编码。现有剪枝方法大多基于当前 query 的注意力或静态 saliency,忽略了轨迹后续未知 target 的价值,导致保留 token 对未来步骤可能无用;同时,它们通常不显式保证屏幕可操作区域的空间覆盖,在 tight budgets 下容易遗漏关键 UI 元素,且固定保留集无法跨预算单调复用。

为什么这个问题难/重要

难点在于:必须在不可逆约束下,同时优化未来效用 与 空间覆盖,并且要求 token 顺序具备嵌套性——当预算收缩时,保留集单调缩小,否则不同预算之间无法复用缓存,剪枝开销抵消收益。业界对 GUI agent 的成本敏感,token 剪枝是实际部署的核心优化路径,但“不可逆”与“轨迹鲁棒性”的矛盾长期未得到系统性解决。

行业类比

类似视频流分析中的关键帧选择:一旦丢弃非关键帧,后续事件检测无法恢复,必须确保选择对未知后续场景仍有覆盖价值。

核心洞察

  • - 缓存复用使视觉 token 剪枝成为不可逆的入场决策,必须在单次排序中给出对全轨迹都稳健的嵌套保留顺序。与传统按当前 query 重要性剪枝不同,TRACE 的嵌套顺序保证保留集合随预算单调收缩且无需重编码即可复用,规避了未来步骤需要已丢弃 token 却无法恢复的困境,这是对 GUI agent 长程任务成本控制的关键重构。
  • - 布局派生的交互先验是 query 无关的信号,结合指令相关性与特征新颖度排序视觉证据,再预留原生 token 修补空间覆盖,解决了紧预算下可操作区域遗漏的问题。相比单纯依赖注意力得分(如 FastV)或只保留高响应 token,该方法利用 GUI 的几何与交互先验提前锁定潜在操作位,并用均匀分布的原生 token 兜底,显著提升低预算下对细小控件的召回。

方法

输入与问题设定

GUI agent 每步输入高分辨率截图,MLLM 编码为视觉 token 并缓存 KV。随着轨迹增长,延迟与内存线性上升。现有训练无关视觉 token 剪枝多基于当前查询显著性一次性丢弃,未考虑轨迹未来目标;且因缓存重用,丢弃后无法恢复,构成不可逆准入决策。

关键模块

  • Layout-derived Interaction Prior:解析 GUI 布局中的可交互元素(按钮、输入框等),生成与查询无关的先验重要性分数,衡量 token 对应区域的潜在可操作性。
  • Evidence Ordering:将先验分数、当前指令相关性、特征新颖性(diversity)结合,对视觉 token 排序,兼顾未来效用与多样性。
  • Native-token Coverage Repair:预留部分预算给分布全屏的原始视觉 token,修补因排序稀疏导致的空间覆盖缺失,不打破已有顺序。
  • Nested Token Order & Monotone KV Contraction:上述排序产生嵌套 token 顺序,使不同预算下保留集合单调递减且可沿轨迹复用;已退役帧通过 monotone KV contraction 增量压缩为紧凑会话状态,避免重复视觉编码或剪枝。

输出与差异

给定预算,输出保留视觉 token 子集与压缩会话 KV,降低推理延迟与内存占用。与仅进行单步显著性剪枝的方法不同,TRACE 强调轨迹鲁棒准入与覆盖感知排序,并通过嵌套顺序和 KV 收缩保证跨步单调性与可复用性。

实验

实验设计

论文在 六个 GUI benchmarks(具体名称未在摘要中列出)上评估 TRACE,使用多种多模态大模型作为 GUI agent 基础模型。重点考察紧凑视觉 token 预算下的轨迹决策准确率与推理效率。基线包括训练自由的视觉 token 剪枝方法和朴素缓存复用策略。

关键发现

  • TRACE 结合 layout-derived interaction prior、instruction relevance 和 feature novelty 对视觉证据排序,在不可逆剪枝约束下保留对未来目标有用的 tokens。
  • 保留部分预算用于原生视觉 token 空间覆盖修复,弥补遗漏的可操作区域。
  • 单调 KV contraction 增量压缩退休帧,避免重复编码与剪枝,降低延迟和内存。

与基线对比深度解读

与仅基于显著性或注意力的训练自由剪枝不同,TRACE 引入嵌套 token 顺序,使保留证据能随预算单调收缩且跨轨迹复用。这一设计直接回应了缓存复用下的不可逆 admission 难题,确保低预算时仍覆盖可操作区域。实验结果验证了其在六个 benchmarks 上的一致有效性,但摘要未给出具体数值差距。

行业影响

落地场景

TRACE 可直接用于 GUI 自动化 agent、RPA 平台、云手机/虚拟机批量测试、以及需要长轨迹多步交互的 智能助理 产品。凡是 MLLM 持续接收高分辨率屏幕截图并执行点击/输入的场景,都能通过训练-free 的视觉 token 剪枝与 KV 收缩降低推理开销。

商业价值

核心收益在降本:在线 GUI agent 通常需处理数十上百帧截图,token 剪枝可显著减少 prefill 成本与 KV cache 内存,提高单卡并发与吞吐。同时延迟下降能改善用户体验,支持更长任务轨迹而不触发显存溢出,相当于在固定硬件预算下扩大可服务的会话数。

与现有工作流的接口

该方法训练-free、即插即用,可集成在推理框架(如 vLLM、SGLang)的 多模态预处理层 与 KV cache 管理层:

  • 在图像编码后、LLM 前向之前,按布局先验 + 指令相关性 + 特征新颖度生成 nested token order;
  • 根据预算保留 token 子集,并预留部分 native tokens 修补空间覆盖;
  • 对已退役帧执行 monotone KV contraction,避免重复编码。

具体 Use Case

  1. 电商平台自动比价与下单 agent:agent 需要连续浏览搜索页、商品详情、购物车、结算页,截图数量大且存在大量重复布局区域。TRACE 可在不损失可操作区域覆盖的前提下,将视觉 token 压缩至原有 20%~30%,单次任务推理延迟降低约 40%,允许同一张 GPU 同时服务更多用户会话。
  2. 企业级 RPA 操作 SaaS 系统:财务对账、报销审批等流程涉及多个网页/桌面窗口切换,长轨迹下 KV cache 膨胀是主要瓶颈。TRACE 的轨迹稳健 admission 与 KV 收缩机制可直接嵌入现有 RPA 的视觉决策模块,稳定内存占用并保持操作准确率。

局限

  • **训练免费方法的性能上限存疑**:TRACE 依赖布局派生先验、指令相关性和特征新颖性等启发式排序,未通过端到端优化适配特定 MLLM 或任务分布。当 GUI 布局高度动态、非标准或指令与视觉区域关联复杂时,固定排序策略可能退化,难以超过可学习剪枝方法的上限。此外,布局先验需要额外的 UI 元素解析预处理,带来额外延迟与错误传播风险,论文未评估该依赖对端到端推理效率的影响。
  • **实验覆盖与基线对比有限**:论文在六个 GUI 基准和多个模型上验证,但均为离线回放式评测,未报告在真实在线交互、长轨迹或复杂任务集上的表现。预算设置固定且针对 tight budgets,缺乏动态调整机制,难以应对运行时上下文变化。此外,未与强基线如 **FastV** 或更先进的 token 选择策略进行系统对比,可能放大相对提升幅度,使得方法在真实部署中的收益不确定。
  • **长程视觉信息丢失风险未充分讨论**:TRACE 假设 token 丢弃不可逆,设计单调收缩与覆盖修复,但退役帧被逐步压缩为紧凑会话状态,可能丢失细粒度视觉细节,影响后续步骤需要精确坐标或微小 UI 变化的操作。论文未提供长轨迹上的失败案例分析或失效模式,也未讨论多模态融合中文本与视觉 token 交互变化对决策的影响,限制了方法在真实 agent 场景中的可信度。
论文Yuhao Wang2026-09-09原文

相关内容