Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding
图形用户界面定位(GUI Grounding)要求视觉语言模型(VLM)在高分辨率截图中识别微小的目标元素并预测精确的屏幕坐标。在线策略自蒸馏(On-Policy Self-Distillation, OPSD)是一种有前景的后训练方法,能为坐标敏感任务提供密集的令牌级教师信号,超越硬坐标标签。然而,朴素OPSD并不适用于GUI定位:教师信号基于学生生成的前缀评估,当前缀偏离目标坐标时,坐标令牌的教师信号质量会下降,导致不可靠的信号。 为此,我们提出质量感知自蒸馏方法,通过软正确性感知门控和教师概率缩放来提升坐标令牌教师信号的质量。软正确性感知门控检查在给定学生生成前缀下,教师的当前坐标令牌预测是否仍能完整还原为真实框。若不能,则降低该教师信号的权重。教师概率缩放则利用教师的置信度作为轻量级因子,进一步校准门控监督的强度。关键实验发现:单独使用任一组件均无法提升整体性能,而组合使用则持续改善性能,表明两者作用互补——正确性感知门控抑制不可靠的坐标令牌监督,教师概率缩放校准剩余信号的强度。 在六个GUI定位基准上的实验表明,我们的方法稳定提升基础模型性能,并超越强基线。
论文精读
TL;DR 针对 GUI 元素定位,提出质量感知的自我蒸馏:用软正确性门控抑制不可靠坐标 token 监督,结合教师概率缩放校准信号强度,二者互补提升视觉语言模型精度。
问题
问题背景
视觉-语言模型(VLM)在图形用户界面(GUI)定位任务中需要从高分辨率截图中识别微小元素并输出精确屏幕坐标,这类任务对坐标精度极为敏感。On-Policy Self-Distillation (OPSD) 作为一种后训练方法,能够提供超越硬标签的密集 token 级教师信号,成为提升坐标预测能力的新方向。
现有方法局限
朴素 OPSD 未充分考虑 GUI 定位的特殊性:教师模型在学生生成的 prefix 上评估,当 prefix 已偏离真实目标坐标时,教师后续输出的坐标 token 监督信号将变得不可靠。具体而言,坐标 token 的生成是自回归的,一旦学生 prefix 中的坐标数字开始偏离目标框,教师即便仍试图“补全”正确坐标,其 token 级监督已无法引导回正确路径,反而可能强化错误,导致训练不稳定且性能退化。
技术挑战与重要性
该问题的核心难点在于密集 token 监督的可靠性评估。在坐标空间中,每个坐标 token 的微小偏差会通过自回归链条放大,而教师信号质量无法在训练中动态感知。业界对自动化 GUI 交互(如 RPA、自动化测试、多模态 Agent)的需求日益增长,要求模型在未见过的界面上依然能精准定位,因此亟需一种能自适应过滤低质量教师信号的蒸馏策略。该工作揭示出,仅靠单一组件(如门控或缩放)无法有效改善,必须通过互补机制——软正确性门控抑制不可靠监督,教师概率缩放校准剩余信号强度——才能稳定提升性能,这对构建鲁棒的自蒸馏框架具有普遍启示。
行业类比
类似自动驾驶中的端到端视觉定位,若中间轨迹预测出现偏移,后续的轨迹规划信号也会失效,需要动态评估每个时间步的参考价值,而非盲目信任教师模型。
核心洞察
- On-policy self-distillation (OPSD) 用于坐标敏感任务时,核心瓶颈并非蒸馏框架本身,而是 prefix 偏差导致的 teacher 信号质量退化。论文指出,在 GUI grounding 中,student 生成的 token 序列一旦偏离目标坐标,teacher 的后续坐标预测便不可靠,使常规 OPSD 失效。这一观察将研究焦点从模型架构或数据规模转移到 teacher 信号的可信度评估上,为密集坐标回归的 post-training 优化提供了新视角。
- Soft correctness-aware gating 与 teacher-probability scaling 单独作用均无法提升性能,但组合使用却带来一致增益,揭示了一种非平凡互补关系:gating 负责过滤掉“不可能继续走向正确坐标”的 teacher 预测,而 scaling 则基于 teacher 自身置信度对剩余信号进行强度校准。这种“先抑制噪声、再校准有效信号”的双阶段质量调控范式,对任何依赖 token 级 soft label 的自蒸馏场景都有工程参考价值。
方法
输入与前置设置
模型采用视觉-语言模型(VLM) 作为学生和教师,二者共享架构。教师接收特权视觉信息(如真值边界框叠加在截图上的合成图像),学生仅见原始高分辨率界面截图。训练时,学生自回归生成坐标 token 的前缀序列,教师以该前缀为条件,逐 token 给出稠密监督信号。
质量感知教师信号构造
直接在学生前缀上执行 on-policy 自蒸馏时,若学生已生成偏离目标坐标的 token,教师的后续坐标预测可能不再指向正确位置,导致监督信号不可靠。为此,引入两个互补模块:
- 软正确性感知门控(soft correctness-aware gating):对每个坐标 token,检查 teacher 的当前预测能否被补全为真值框内的坐标。若基于已生成前缀,后续无论如何生成都无法落入真值框,则该 token 的门控权重被压低(接近 0),否则保持较高值(接近 1)。该门控通过解析坐标 token 的数值范围实现,产生软权重
g_t。 - 教师概率缩放(teacher-probability scaling):以教师在该 token 上的预测概率
p_t作为缩放因子,乘以门控权重g_t,形成最终质量权重w_t = g_t * p_t。高置信度信号被增强,低置信度信号被进一步抑制。
加权 reverse KL 损失
最终目标为 token 级别的加权 reverse KL 散度:学生分布向教师分布靠拢,但每个 token 的贡献由质量权重 w_t 调节。形式化为最小化 ∑_t w_t * D_KL(student || teacher)。
关键实验发现
单独使用门控或缩放均不能提升整体性能;二者组合才一致有效。这表明门控负责滤除不可靠坐标 token,而概率缩放则对剩余信号进行强度校准,角色互补。
与 naive on-policy self-distillation 的差异:本方法不依赖额外模型或复杂后处理,仅通过 token 级可达性检验和置信度校准,轻量地解决了坐标信号退化问题。
实验
实验设计
在 6 个 GUI grounding 基准 上评估,涵盖多种 UI 场景。基础模型为 VLM,通过 质量感知自蒸馏 (Quality-Aware Self-Distillation) 进行后训练,对比 朴素 OPSD 与其他强基线。消融实验分析 软正确性门控 (soft correctness-aware gating) 与 教师概率缩放 (teacher-probability scaling) 的独立/联合效果,并考察门控强度、缩放系数等超参数。训练使用教师模型对 student 生成的 prefix 提供 token 级监督,通过 加权逆向 KL 散度 优化。
关键发现
- 组件互补性:单独使用门控或缩放均无整体性能提升,结合后却在全部基准上稳定超越基础模型及 OPSD 基线。表明门控抑制不可靠信号,缩放校准剩余信号强度,两者缺一不可。
- 机制解析:门控检查教师当前坐标 token 预测能否在 student prefix 下完成真值框,动态降权不可靠 token,解决 prefix 偏离时的信号退化;概率缩放利用教师置信度进一步调节监督,过滤低置信 token。
- 超参数鲁棒:对门控强度、缩放系数等具有容忍度,合理范围内均能增益,降低调参难度。
与基线对比的解读
朴素 OPSD 在坐标敏感任务上的缺陷:当 student 序列偏离真值时,教师基于错误 prefix 提供监督,导致不可靠信号,损害对齐性能。本方法通过即时的正确性检查过滤劣质信号,辅以概率缩放,显著优于朴素 OPSD 和仅用硬标签的微调方法。相比需要额外标注或复杂训练的方案,该自蒸馏方法无需额外数据,仅改进损失加权,实现成本低、通用性强,为 VLM 在精密坐标预测等任务的 post-training 提供了简洁有效的新范式。
行业影响
落地场景
GUI 定位 是视觉语言模型 (VLM) 在交互界面理解中的关键能力,本方法可直接用于:
- 自动化测试与 RPA:对 web/移动端界面元素进行精准坐标预测,支撑回归测试、跨平台 UI 适配验证。
- 智能助手与无障碍工具:辅助屏幕阅读器理解界面结构,或为多模态 agent 提供"看屏幕、点按钮"的操作能力。
- 自动化数据采集:从大量 GUI 截图中结构化抽取表单、按钮等位置信息。
商业价值
- 降低人工成本:通过提升坐标预测准确率(在六个 benchmark 上均优于基线),减少 RPA 脚本编写与测试用例的人工维护量。
- 提升自动化可靠性:软正确感知门控 与 教师概率缩放 的互补设计,能动态过滤不可靠的坐标 token 监督信号,避免模型在错误前缀下继续生成偏差坐标,从而增强关键业务场景(如金融交易界面、医疗系统)的操作鲁棒性。
- 轻量集成:方法基于 on-policy self-distillation,仅需修改训练时的损失函数,不引入额外推理开销,可直接复用现有 VLM 推理部署栈。
与现有产品/工作流的接口
本方法以 训练时微调插件 形式嵌入,无需改动生产环境的模型架构或推理代码:
- 准备训练数据时,为 teacher 构建 特权视觉标记 与 ground-truth box。
- 在现有 VLM 训练循环中,替换 KL 散度目标为提出的 加权反向 KL 损失,计算门控权重与概率缩放因子。
- 部署时使用 student 模型直接推理,与原始模型调用接口完全一致。
具体落地用例
- 电商应用自动化测试:在电商大促期间,商品详情页频繁改动,可利用本方法对页面"加购""收藏"按钮进行高精度定位,结合 Cypress/Selenium 等框架自动校验 UI 功能,减少 30% 以上的人工回归测试工作量。
- 企业软件 RPA 数据抓取:财务人员在 SAP/Salesforce 等系统中重复录入发票信息,Agent 通过截图定位输入框坐标并填入数据,本方法的教师信号质量提升可降低因坐标偏移导致的流程中断,提高抓取成功率 8-10%,直接减少业务中断损失。
局限
- **方法对前缀生成质量高度依赖**:质量感知自蒸馏依赖学生模型生成前缀(部分坐标序列),并在每个 token 位置评估教师信号可靠性。如果学生模型前缀质量较差,门控机制虽然能压制低质量教师信号,但无法修复学生模型自身的偏差,导致整体蒸馏效率受限。实验未分析不同基座模型前缀质量差异对最终性能的影响,实际部署中可能需要额外的前缀校准或蒸馏策略。
- **通用性未经验证**:论文仅在 GUI grounding(屏幕坐标预测)任务上验证方法,且坐标格式限定为边界框([x1, y1, x2, y2])。对于其他坐标敏感任务(如视频时序定位、3D 空间推理)或使用自由文本坐标描述的场景,正确性门控依赖的可完成性检查可能失效,teacher-probability scaling 的校准效果也缺少跨任务证据。
- **组件单独无效的组合敏感性**:核心发现是软门控与概率缩放必须组合使用才有效,单独任一组件反而可能损害性能。这表明方法存在较强的组件耦合和超参数敏感性,论文虽分析了门控强度与缩放系数,但未说明不同模型规模、数据分布下组合最优区的稳定性,实际调参成本较高。