ReVision: 通过时间视觉冗余缩减扩展 Computer-Use Agents
Computer-Use Agents (CUAs) 依赖图形用户界面的视觉观测,每张截图被编码为大量视觉 token。随着交互轨迹增长,token 成本快速上升,导致在固定上下文和计算预算下可纳入的历史信息有限。这造成在利用历史信息时性能提升甚微,与其他领域形成对比。 为解决此低效问题,我们提出 ReVision,一种用于训练多模态语言模型的方法。其核心是一个可学习的 patch selector,通过比较连续截图的 patch 表示并保留模型所需的空间结构,移除冗余视觉 patch。在三个基准测试 OSWorld、WebTailBench 和 AgentNetBench 上,使用 Qwen2.5-VL-7B 处理包含 5 张历史截图的轨迹时,ReVision 平均减少 46% 的 token 使用量,同时相比不丢弃的基线成功率提升 3%。 这项改进建立了清晰的效率增益,使智能体能以更少的 token 处理更长的轨迹。在此基础上,我们重新审视 CUAs 中历史的作用,发现当冗余被移除后,随着纳入更多过去观测,性能持续提升。
论文精读
TL;DR ReVision 通过学习筛选器去除连续界面截图中的冗余视觉补丁,在保持空间结构的同时将 token 用量降低 46%,并提升成功率 3%,让计算机使用智能体能用更少算力高效利用更长操作历史。
问题
问题背景
计算机使用代理(CUA) 是当前 AI 自动化的焦点,这类代理通过观察 GUI 截图流来执行任务,而能否有效利用交互历史(过去的截图与动作)是提升多步任务成功率的关键。
现有方法局限
直接将历史截图编码为视觉 token 输入多模态模型,会随轨迹长度增长导致 token 成本急剧膨胀。受限于固定上下文窗口和计算预算,系统只能强行丢弃或截断历史帧。但相邻截图间存在大量时间维度的视觉冗余(如静态背景、重复控件),冗余 token 挤占上下文却未提供新信息,反而使模型处理效率下降。更棘手的是,简单的视觉压缩手段(如均匀采样关键帧、图像下采样)会不可逆地破坏 GUI 元素的空间位置、文本排版和交互状态(如按钮高亮),导致模型丢失关键的定位与状态推理能力。因此,传统方法下增加历史长度往往造成性能停滞甚至退化,这与语言代理领域历史有益的经验形成鲜明对比。
为什么这个问题难/重要
挑战在于需动态识别并移除冗余补丁,同时确保任务敏感区域(如按钮坐标、输入框内容)的空间结构完整性不被破坏。这要求模型学习一种上下文感知的选择策略,而非静态规则过滤器。从工程角度看,token 效率直接影响推理延迟和 API 成本,成为代理长时间自主运行的瓶颈。若能高效利用历史,代理将能像人类一样回溯关键状态,处理复杂、多分支的长时间任务,这是当前业界向自主代理演进必须跨越的障碍。
行业类比
类似视频理解中的自适应关键帧选择,但 GUI 代理的容错率更低:一点像素差异(如光标移动)可能意味着不同的交互状态,冗余去除须在细粒度补丁级别上进行,比视频关键帧更精密。
核心洞察
- 时间维度视觉冗余是计算机使用代理效率的关键瓶颈,ReVision 通过学习 patch 筛选器比较连续截图,有效去除冗余 patch 同时保留空间结构。与传统的丢弃历史帧或统一压缩 token 不同,该方法能鉴别局部相似区域,在减少 46% token 开销的同时将成功率提升 3%,首次在效率和性能上同时取得正向提升,为长历史利用扫清障碍。
- ReVision 证明在筛除冗余后,增加视觉历史可以持续提升代理性能,颠覆了以往视觉历史无法带来增益的结论。以往研究认为历史帧会挤占上下文窗口且信息重复,导致性能饱和甚至下降;但 ReVision 表明,经智能过滤后,更多有用信息得以保留,成功率随历史帧数增加而提高,这为 CUA 架构设计开启了利用长时依赖的新范式,并提示现有基准中历史帧利用不足的根本原因在于 token 冗余而非信息价值低。
方法
ReVision 方法流程
输入
- 一组交互轨迹,每条轨迹包含若干连续截屏
(s_1, s_2, ..., s_T)与自然语言指令。 - 每个截屏经视觉编码器(如 ViT)切分为 $N$ 个 patch,得到视觉特征序列 $V_t \in \mathbb{R}^{N \times d}$。
关键模块:可学习的 Patch 选择器
逐对冗余判别
对相邻截屏对(s_t, s_{t-1}),提取 patch 级特征,输入一个轻量选择器网络(例如 2-3 层 MLP + sigmoid),输出每个 patch 的保留概率 $p_i$。网络输入包含当前 patch 特征、历史 patch 特征及二者的交互(如特征差、点积等),使其能学习时间冗余模式而非简单相似度比对。可微二值化与空间结构保持
训练时使用 Gumbel-Softmax / straight-through 技巧进行可微离散采样,生成二值 mask $M_t$;推理时直接按概率阈值截断。保留的 patch 仍携带原位 2D 位置编码,确保后续 LLM 可理解界面布局。端到端训练
将稀疏后的视觉序列 $\tilde{V}_t = V_t[M_t]$ 与文本指令拼接,送入多模态语言模型(如 Qwen2.5-VL-7B)进行下一 token 预测。损失仅来自语言部分,选择器与 LLM 联合优化,让选择行为直接受下游任务成功率驱动。
输出与效率增益
- 模型输出动作(点击、输入、滚动等),预测质量不受冗余 token 干扰。
- 在 OSWorld / WebTailBench / AgentNetBench 上,处理 5 张历史截屏时平均减少 46% 视觉 token,成功率反而提升约 3%。
- 历史截屏数量增加时性能持续上升,打破了以往“历史越多收益越平”的饱和效应。
与同类方法的差异
传统方案(固定网格丢弃、基于余弦相似度的阈值过滤)依赖手工先验,难以区分“冗余但语义重要”的界面元素。ReVision 采用面向任务的可学习选择器,并与 LLM 协同训练,使丢弃策略自适应于当前指令与 GUI 变化,在不损失空间结构的条件下最大化信息密度。
实验
实验设计
评估在三个 GUI agent 基准 OSWorld, WebTailBench, AgentNetBench 上进行,使用 Qwen2.5-VL-7B 作为视觉语言模型。任务中利用 5 张历史截图,对比 ReVision(习得的 patch 选择器,通过比较连续截图的 patch 表示移除冗余视觉 token,同时保留空间结构)与不剔除任何 token 的基线(no drop baseline)。衡量指标为 token 使用量 和 任务成功率。
关键发现
- ReVision 平均减少 46% 的 token 使用,同时成功率提升 3% 个百分点。
- 进一步分析发现,当冗余被移除后,引入更多历史观察能持续提升性能,解决了以往 CUAs 中使用历史几乎无增益的瓶颈。
- 这种效率提升使得代理能够在相同 token 预算下处理更长的交互轨迹。
与基线对比深度解读
基线直接使用全部视觉 token 导致 token 成本随历史线性增长,而性能却停滞甚至下降。ReVision 通过时间冗余压缩打破了这一困境:它不仅降低了计算开销,还让模型更聚焦于界面变化的实质性内容。3% 的成功率提升虽然看似微小,但在 agent 任务中意义重大,表明剔除冗余并未损失信息,反而通过去噪增强了模型对关键状态的感知。这一结果颠覆了“视觉历史越多越好”的简单假设,证实了在 CUAs 中,选择性保留变化区域 比保留完整截图更有效。对于工程落地,这意味着可以设计更高效的 agent 记忆模块,以更低成本支持更长时序推理。
行业影响
落地场景
ReVision 可直接嵌入任何依赖 GUI 截屏流的自动化代理系统,如 RPA 工具(UiPath、Playwright)、多模态 AI 助手(操作桌面或移动应用)、软件自动化测试框架 以及 网页端智能客服。它适用于需要连续观察界面状态变化的长程任务,例如跨页面电商订单处理、企业后台配置、金融终端操作等,显著降低视觉 Token 开销的同时保留关键空间信息。
商业价值
该技术从降本角度直接减少调用多模态 LLM 的视觉 Token 量(实验平均降低 46%),意味着在相同上下文窗口下可处理更长历史,或降低每次交互的 API 成本。增效方面,通过剔除时间冗余,代理能整合更多历史观察而不超出算力预算,从而提升任务成功率(+3%),直接改善用户体验与自动化产出。对产品而言,这等价于用更低延迟、更高吞吐实现更稳健的 GUI 操作代理。
与现有产品/工作流的接口
集成方式有两种:
- 预过滤中间件:在截屏传入 LLM 前,部署一个轻量 patch selector(可单独训练或与模型联合微调),对连续帧做差异性比较后裁剪视觉 Token,对下游模型透明。
- 模型训练管线:将 ReVision 的选择机制作为多模态 LLM 微调的一部分,使模型本身学会忽略冗余区域(如冻结视觉编码器、仅微调投影层与选择头),可与 Qwen2.5-VL、GPT-4V 等模型适配。
两种方式均可与现有 Agent 框架(LangChain、AutoGen、OpenAI Assistants)共存,只需在观察预处理阶段插入冗余约简模块。
具体落地案例
- 电商智能客服代操作:代理处理退货退款流程时,需在订单列表、详情、审批页间跳转。截屏间大量重复区域(侧边栏、商品图)被 ReVision 剔除后,代理可回顾完整操作链路(如近 10 步历史)而不超 Token 限制,准确率提升,降低人工介入率。
- 企业级软件自动化测试:在录制式 UI 测试中,连续页面截图常包含不变的静态布局。利用 ReVision 过滤后可大幅压缩单条测试轨迹的 Token 成本,使并行执行更多测试用例成为可能,缩短 CI/CD 流水线反馈时间。
局限
- **泛化到新界面范式的能力有限**。补丁选择器在训练过程中仅接触了特定基准任务中的 GUI 截图序列,所学习的冗余模式可能对 OSWorld、WebTailBench 等测试环境过拟合。在面对截然不同的应用风格(例如移动端 UI、游戏界面或带有大量动态元素的仪表盘)时,连续帧之间的外观变化规律可能差异显著,导致补丁丢弃策略失效或反而移除关键信息。论文未在分布外界面集上进行泛化测试,因此 ReVision 在真实世界多样化的桌面自动化任务中的稳健性仍存疑。
- **对剧烈视觉变化的鲁棒性未经检验**。ReVision 的核心假设是连续截图间存在大量可移除的冗余补丁,但在任务步骤涉及整页跳转、模态弹窗或渲染重排时,两帧之间可能只有少量区域重复。此时余弦相似度或学习的相似度度量可能无法可靠筛选补丁,要么过度丢弃(丢失新出现的重要控件),要么保留过多冗余,削弱压缩效果。论文未分析此类边界场景下的性能退化,可能限制其在交互密度高、界面频繁刷新的应用中的实用性。
- **训练范式依赖静态轨迹数据**。ReVision 通过在后处理阶段对现有 agent 轨迹中的连续截图进行成对比较来构造训练样本(模拟某帧补丁是否可丢弃),这本质上是一种离线蒸馏:学到的丢弃策略受限于原始模型在完整信息下的行为。若轨迹数据本身存在探索不足或偏好捷径,补丁选择器可能学习到有偏的冗余模式,难以主动发现更优的压缩策略。此外,训练流程涉及对 Qwen2.5-VL-7B 的微调,对计算资源有一定要求,不利于快速部署或持续在线适应新环境。