论文

下一张截图知道答案:面向移动端 GUI 智能体的门控事后蒸馏

下一张截图知道答案:面向移动端 GUI 智能体的门控事后蒸馏

GUI 智能体 通常基于成功的交互轨迹进行离线训练。标准训练将每条轨迹分解为前缀-动作对:智能体根据当前屏幕和交互历史预测一个动作,而后续观察则被丢弃。这抹去了动作之所以正确的依据——该依据往往只出现在下一屏幕中。例如,要启用 Soft Wrap 功能,智能体应点击 Edit 或 View,但在菜单打开之前,屏幕上没有任何迹象能揭示这一点。缺少此类证据,标准模仿学习几乎无法让模型采样到正确的推理路径,更遑论学会它。 为解决这一问题,我们提出 门控事后蒸馏(GHD)。该方法在训练期间将下一截图作为特权信息:学生模型仅基于可观察的轨迹前缀进行预测,而一个参数共享的教师模型额外观察下一截图,并重新为学生模型的 on-policy 响应 打分。仅当学生失败且事后条件教师能够恢复演示动作时,才应用蒸馏。 在 AndroidWorld 和 AndroidLab 基准上,使用两个视觉语言模型,相较 GRPO,GHD 显著提升了任务成功率。代码与检查点将公开。

论文精读

TL;DR GHD 用下一张截图作为训练特权信息,仅在学生失败且教师凭未来屏幕能恢复正确动作时才蒸馏,提升移动 GUI 智能体任务成功率。

问题

GUI agent 领域当前关注如何从离线成功轨迹中训练可泛化的视觉-语言模型,使其能执行跨应用操作。

标准行为克隆 将轨迹分解为 (prefix, action) 对,仅从当前屏幕与交互历史预测动作,并直接丢弃 next screenshot。这切断了动作与结果的因果链:正确动作的证据往往只在下一屏出现,例如要启用 Soft Wrap 需点击 Edit 或 View,但点击前界面无任何提示。模型无法从静态 prefix 推断正确动作,导致采样不到正确动作,也就永远无法从数据中学到该推理路径。

该问题的难点在于 GUI 任务的动作空间组合爆炸、奖励稀疏,且正确与错误动作在输入观察上可能完全一致,只有未来状态能区分。若训练信号仅来自成功轨迹的 prefix,模型容易过拟合表面模式,在布局或任务变化时失效。这直接限制离线 agent 训练的可扩展性:大多数真实场景无法在线试错,而离线数据中的未来信息被浪费。业界对此高度关注,因为移动 GUI 自动化是大模型落地的重要方向。

这类似于机器人学习中 hindsight experience replay 用事后目标重标记失败样本,GHD 利用未来屏幕提供事后证据,使失败前缀也能产生有效学习信号。

核心洞察

  • 利用下一帧截图作为特权信息,将离线交互轨迹中通常被丢弃的未来观察显式化为动作正确性的因果证据。标准行为克隆仅从当前屏幕与历史预测动作,模型无法看到点击后菜单弹出等结果,因此很难学到完整推理链。GHD 通过参数共享教师额外观察下一帧并重新评分学生策略,在不改变推理输入的前提下,将事后理性注入训练信号,弥补了模仿学习与真实决策之间的归因缺口。
  • 门控蒸馏与参数共享设计使特权信息高效融入强化学习流程。蒸馏仅在学生预测错误且教师借助下一帧恢复演示动作时触发,避免了盲目匹配教师全部输出的分布偏移;教师与学生共享权重,确保特权知识直接内化到部署网络,不增加额外推理模块。该方法与 GRPO 结合后,在 AndroidWorld 和 AndroidLab 两个基准上显著提升任务成功率,验证了低成本事后监督对于 GUI 智能体训练的有效性。

方法

GHD 方法流程

输入:每个训练样本由一段轨迹前缀与对应下一屏幕组成。轨迹前缀包含当前屏幕与交互历史;下一屏幕仅作为特权信息,只提供给教师侧,学生无法观察。

关键模块:

  1. 学生前向:学生模型只基于可观察前缀生成动作分布,并采样多个 on-policy 候选响应。
  2. 教师重评分:参数共享的教师模型额外获取下一屏幕,对学生的每个候选响应重新打分,判断其能否在 hindsight 条件下恢复示范动作。
  3. 门控蒸馏:仅当学生未命中示范动作、而教师借助下一屏幕证据能够识别正确动作时,才施加蒸馏损失,将教师的证据感知偏好迁移给学生。若学生已做对,或教师同样失败,则不蒸馏,避免引入噪声。

输出:学生策略的更新梯度由两部分联合构成——来自 GRPO 的在线优势估计,以及由门控 hindsight 蒸馏提供的监督信号。学生无需在线交互,即可在离线轨迹中利用下一屏幕的证据改进推理。

差异点:与事后经验回放或常规离线 RL 不同,GHD 不修改奖励函数,而是把下一屏幕作为特权信息注入参数共享教师,并通过严格门控只蒸馏“学生失败但教师成功”的困难样本。

实验

实验设计

GHD 在 AndroidWorld 和 AndroidLab 两个移动 GUI 基准上评估,与 GRPO 基线对比。训练使用两个视觉语言模型(VLM),将成功交互轨迹分解为状态-动作对,标准模仿学习丢弃后续屏幕;GHD 则在训练中引入 next screenshot 作为特权信息。策略上采用 parameter-sharing teacher 对学生 on-policy responses 重新打分,仅在学生失败且教师能恢复演示动作时触发蒸馏(gating)。评估指标为 task success rate。

关键发现

  • GHD 在两个基准、两个 VLM 上均优于 GRPO,说明未来屏幕信息对动作决策具有因果性价值。
  • gating 机制 有效:仅在学生错误时蒸馏,避免对已正确行为的干扰,同时集中学习困难样本。
  • 对需要多步导航或隐含菜单选项的任务(如 "Soft Wrap" 场景)改善尤为显著,因为正确动作的依据只出现在后续屏幕。

与基线的深度解读

GRPO 作为强化学习基线,通过奖励信号优化策略,但奖励稀疏且缺乏对动作-结果关联的显式建模;标准模仿学习则完全丢弃后续观察,导致模型难以学习"为什么正确"。GHD 通过 hindsight information 弥补了这一 gap:教师观测到 next screenshot 后能识别正确动作,并以蒸馏方式传递该知识。参数共享设计保证不增加推理成本,只在训练时使用特权信息;gating 进一步减少计算开销。相比 GUI-Shift 类逆动力学方法,GHD 不显式建模状态转移,而是直接利用特权观测进行策略校正,更贴合 VLM 的生成式训练范式。

行业影响

落地场景

GHD 训练出的移动 GUI agent 可直接用于 移动端 RPA、App 自动化测试、智能助手 等产品。例如:

  • 自动化测试平台模拟用户操作,验证电商、金融类 App 的核心流程;
  • 企业移动工作流自动化,如财务审批、客户 onboarding 中的多步表单填写;
  • 无障碍辅助工具,帮助视障用户通过语音指令操作手机。

商业价值

GHD 显著提升离线训练的数据利用效率,使 agent 在 AndroidWorld / AndroidLab 等基准上的任务成功率更高。对业务而言:

  1. 降低标注与重训成本:标准 imitation 常常学不到正确推理,导致模型上线后频繁失败,需要人工修复;GHD 利用已有轨迹中的下一帧截图作为特权信息,无需额外标注即可恢复正确动作。
  2. 减少在线探索风险:离线训练更稳健,避免线上试错带来的用户体验损失和不可逆操作。
  3. 跨模型通用:已在两类 VLM 上验证,可快速迁移到不同基座模型。

跟现有产品/工作流的接口

GHD 可作为现有 GRPO / SFT 流程 的附加训练目标,其核心是蒸馏损失项:

  • 数据层面:只需在训练时访问成功轨迹中的连续截图(s_t 和 s_{t+1}),现有回放缓冲区即可支持;
  • 模型层面:参数共享 teacher 仅在训练时使用,推理零额外开销,可直接替换现有 agent 的微调步骤;
  • 工程层面:损失函数与策略梯度兼容,可在不改变推理架构的前提下集成进现有 RL 训练框架。

具体 use case

  1. 电商 App 智能导购:用户语音输入“把商品加入购物车”,agent 需先点击“更多选项”才能看到“加入购物车”按钮。标准训练可能只学会随机点击,而 GHD 让模型从点击后的菜单屏幕反推出“更多选项”是正确的第一步。
  2. 金融 App 自动化 KYC:开户流程要求上传证件、人脸识别等多步操作,某些步骤的入口在后续页面才显现。GHD 训练的 agent 能利用后续截图证据,提高一次性完成率,减少人工客服介入。

局限

  • 方法论层面,GHD 依赖训练时未来截图作为特权信息,而推理时无法获取,这种训练-推理不一致可能导致学生模型在部署时表现不如训练时。尽管蒸馏目标旨在让学生从失败中恢复正确推理,但学生可能只是学会了在教师指导下生成动作,而非真正理解后续视觉证据与动作的因果关联。需要进一步分析蒸馏后模型的内部表征或通过消融验证其是否内化了推理能力,否则可能存在对教师信号的记忆风险。
  • 计算效率方面,GHD 需要每个训练步进行在线策略采样,并对学生响应用共享教师重新评分,相比仅使用离线演示的 GRPO 等基线增加了额外的前向传播和采样开销。这可能导致在大规模数据集或多步任务上训练成本显著上升,限制了其在资源受限环境下的应用。虽然论文可能讨论效率,但从方法设计看,采样和教师重评是必需的,需要更高效的近似或缓存策略。
  • 实验评估范围有限,仅在 AndroidWorld 和 AndroidLab 两个 GUI 基准上,且只测试了两个视觉语言模型,可能不足以证明方法在更广泛 GUI 任务(如网页、桌面应用)上的泛化性。此外,没有与更多近期基线(如基于未来信息的其他方法)进行对比,只与 GRPO 比较,可能掩盖了相对优势的边界。需要更全面的基准测试和竞争对手分析。
论文Weiwei Li2026-08-06原文

相关内容