One Forward Beats Two: InnerZoom 实现精确高效的 GUI Grounding
基于 MLLM 的 GUI grounding 方法通常将目标定位建模为自回归坐标生成,使模型能够利用 MLLM 强大的指令跟随和语义理解能力。然而,这种公式要求模型在解码坐标令牌时保留区域级目标证据,以满足 GUI 点击所需的空间精度。我们的诊断分析揭示,目标区域意识在中间解码层出现,但并未保留或转化为最终坐标预测。 为了解决这一问题,现有 ZoomIn 风格方法通过外部的裁剪并重新运行(crop-and-rerun)来提升定位精度,但增加了端到端延迟和计算成本。我们提出 InnerZoom,一种单次前向的跨层证据桥接框架,将原始前向过程中的目标相关线索转换为紧凑的跨层证据状态,然后在后续解码层中保存、精炼并重新注入该状态,以引导坐标预测。 大量实验结果表明,InnerZoom-4B 在所有六个 GUI grounding 基准上达到最先进性能: - OSWorld-G: 64.7(超越最佳 4.1 点) - UI-Vision: 40.2(超越 3.2 点) - OSWorld-GR: 73.1(超越 2.9 点) - MMBench-GUI: 87.6(超越 2.3 点) 在受控的 4B 设置下,InnerZoom 在相同 SFT+RL 基线上平均提升 5.3 点,平均超过双遍 ZoomIn 1.3 点,同时减少端到端延迟高达 31.8%,TFLOPs 约 29%。代码和模型将公开可用。
论文精读
TL;DR InnerZoom 用单次前向传递跨层保留并注入目标区域证据,在 GUI 定位精度上超越传统两遍 ZoomIn,同时降低约 30% 延迟与计算量。
问题
问题背景
基于多模态大语言模型(MLLM)的 GUI 元素定位(grounding)是构建 GUI 智能体的关键任务,主流方法将定位预设为自回归生成坐标序列,从而充分利用 MLLM 的指令跟随与语义理解能力。
现有方法局限
诊断分析揭示了一个 区域到点的断层:目标区域感知在中间解码器层已经涌现,但最终坐标预测时并未保留或转化这一证据。ZoomIn 类方法通过外部裁剪并重新运行(two-pass)来补偿,虽然能提升定位精度,却成倍增加了端到端延迟和计算量(TFLOPs),难以在延迟敏感的场景中部署。
为什么这个问题难且重要
- 技术挑战:解码时需同时维持粗粒度的区域证据与生成空间精确的坐标点,而标准自回归解码在长序列中容易稀释中间层的定位线索。
- 工程价值:GUI 智能体正快速进入生产环境(如自动化测试、多步操作助手),低延迟、高精度的 grounding 直接影响任务成功率和用户体验。
- 效率约束:现实部署中,每一次额外的前向传递都会急剧增加推理时延和算力开销,推动业界寻求单次前向即可达到两阶段精度的方案。
行业类比:这类似于实时目标检测中 单阶段检测器与两阶段检测器的效率博弈——InnerZoom 相当于在单阶段框架内嵌入了区域提议精炼机制,实现“一次前向,两段精度”。
核心洞察
- 中间解码层的目标区域感知已经涌现,但未能传递到最终的坐标预测,这揭示了自回归坐标生成范式下跨层证据断裂的根本问题。与 ZoomIn 类方法依赖外部裁剪重跑来重新捕获目标区域不同,InnerZoom 通过单次前向传递中的跨层证据桥接,将早期注意力特征提炼为紧凑的 evidence state 并重新注入后续解码层,从而在不增加额外计算的情况下弥合 region-to-point 的鸿沟。
- InnerZoom 将两阶段放大策略的内在逻辑(先粗定位再精调)转化为解码器内部的证据传递机制,避免了外部重跑带来的延迟和 FLOPs 开销。这种设计使得 4B 规模的模型在 SFT+RL 基线上平均提升 5.3 点,并反超两阶段 ZoomIn 1.3 点,同时端到端延迟降低最多 31.8%,证明了通过精细的内部特征干预可以实现精度-效率的更优平衡。
- 该工作表明,MLLM 在 GUI 接地中的能力瓶颈不在于视觉语义理解的缺失,而在于空间精度与语言生成目标之间的冲突。InnerZoom 通过规整和解耦目标区域证据(如 slot separation regularization),将定位相关的视觉线索与坐标解码过程分离,使得模型既能保持强指令遵循能力,又能输出精准的空间坐标,为后续基于 MLLM 的 agent 构建提供了更高效的 grounding 范式。
方法
InnerZoom 在单次前向推理中完成 GUI 定位,不再需要裁剪重跑的 ZoomIn 二次通路。其处理线索如下:
- 输入:一张 GUI 截图与一条自然语言定位指令(如“点击保存按钮”)。图像与文本经视觉编码器和语言编码器处理后,送入多模态大模型(MLLM)的解码器链。
- 目标区域证据提取(Target-Region Evidence Extraction):在前向进行到约中间解码层时(此时模型已形成初步的目标区域感知),InnerZoom 从该层注意力分布或隐藏状态中提取与目标相关的信息,构造出紧凑的跨层证据状态。具体做法包括利用早期层涌现的注意力图提炼候选区域,并通过隐式查询(query)从关键缓存中抽取特征,避免再次访问原始图像。
- 跨层证据细化(Cross-Layer Evidence Refinement):证据状态被传入一个独立的可学习细化模块(可能为轻量级 Transformer 或适配器层),对证据进行去噪和增强。该模块通过槽位分离正则化(Slot Separation Regularization)鼓励不同证据槽关注不同的视觉子区域,防止表征坍缩。
- 证据引导的坐标解码(Evidence-Guided Coordinate Decoding):细化后的证据状态被重新注入到后续每一个解码层的自注意力或交叉注意力中,以残差连接或追加 token 的方式持续引导坐标 token(如
[x_min, y_min, x_max, y_max])的生成。这使得模型在输出最终坐标时,能始终参考早期的区域级证据,弥合了“区域感知与精确点击”之间的差距。整个流程不引入额外的前向计算,将证据的提取、迁移和利用集成在同一次推理中。
与同类方法的差异点:传统 ZoomIn 类方案需完成一次前向→定位→裁剪→第二次前向,而 InnerZoom 通过跨层证据桥接在单一前向中隐式实现“聚焦”,既保留精度,又显著降低端到端延迟(减少 31.8%)和计算量(约 29% TFLOPs)。
实验
实验设计
作者在六个 GUI grounding 基准上全面评估 InnerZoom,重点报告了四个代表性数据集:OSWorld-G、UI-Vision、OSWorld-GR 和 MMBench-GUI。基线包括基于 MLLM 的自回归坐标生成方法、典型的 ZoomIn 两阶段方法(裁剪并重新运行),以及 SFT+RL 微调后的基线模型。实验均采用 4B 参数规模,以公平衡量效率与精度的权衡。诊断分析通过注意力干预揭示了解码器中间层已经涌现目标区域感知,但无法转化为最终精确点击的现象,从而引出 InnerZoom 跨层证据桥接的必要性。
关键发现
InnerZoom-4B 在所有六个基准上均刷新纪录,其中 OSWorld-G 达到 64.7(+4.1),UI-Vision 达到 40.2(+3.2),OSWorld-GR 达到 73.1(+2.9),MMBench-GUI 达到 87.6(+2.3)。在 4B 受控设置下,InnerZoom 相比同一 SFT+RL 基线平均提升 5.3 点,且以单次前向传播超越两阶段 ZoomIn 平均 1.3 点,同时端到端延迟最多降低 31.8%,TFLOPS 减少约 29%。这表明 InnerZoom 无需外部重新运行即可保留 ZoomIn 的精度优势。
基线对比深度解读
与 ZoomIn 相比,InnerZoom 的根本区别在于将两阶段外循环内化为单次前向中的跨层证据状态传递。它从原始前向传播中提取目标相关线索,形成紧凑的 cross-layer evidence state,随后在深层解码器中对其进行精炼与再注入,直接引导坐标解码。这既避免了裁剪-重运行带来的额外计算与延迟,又解决了诊断中暴露的“区域到点”断层——即中间层已定位目标区域,但深层无法保留该信息。相对于仅使用 SFT+RL 的基线,InnerZoom 以微小的额外开销(单次前向内的状态传递)换取了大幅精度提升,证明了在解码过程中强制保留并传递证据状态的有效性,为 GUI agent 的落地部署提供了精度与效率兼优的方案。
行业影响
落地场景
InnerZoom 适用于基于多模态大模型 (MLLM) 的 GUI 智能体场景,包括:
- RPA 与软件自动化测试:对桌面或移动应用界面元素进行精确坐标定位,实现自动点击、输入等操作。
- 辅助访问技术:为视障用户提供屏幕元素定位与语音指令执行,提升界面可操作性。
- 跨应用任务代理:如智能助手在未开放 API 的情况下,通过模拟点击完成订餐、购票等复杂流程。
- UI 设计验证:自动检验界面布局是否符合设计规范,定位错位或遮挡元素。
商业价值
- 降低推理成本:InnerZoom 以单次前向传播替代传统 ZoomIn 的两次推理,端到端延迟最高减少 31.8%,TFLOPs 降低约 29%。对于大规模部署的 GUI 智能体服务,可显著节省云计算开销。
- 提升定位准确率:在 OSWorld-G、UI-Vision 等基准上超过之前最优方法 2-4 个绝对点,直接转化为更稳定的自动化成功率,减少人工纠错投入。
- 用户体验改善:更快的响应速度 (延迟降低) 使交互更流畅,有助于在实时辅助场景中获得更高用户留存。
与现有产品 / 工作流的接口
InnerZoom 继承标准 MLLM 架构,仅增加轻量的 跨层证据桥接 组件,不需要改变 tokenizer、图像编码器或主干网络。集成方式:
- 微调现有 MLLM:可对已有 SFT+RL 管线训练的模型施加 InnerZoom 模块,并用少量 GUI grounding 数据继续训练。
- 推理即插即用:模块在推理时对中间层特征进行抽取、精炼并回注,对外接口不变 (仍为 <image, 指令> 输入,输出坐标序列)。
- 兼容主流部署框架:基于 PyTorch/ONNX,可无缝接入 vLLM、TensorRT 等高效推理引擎。
具体落地用例
- 智能 RPA 平台:某 RPA SaaS 供应商将 InnerZoom-4B 集成至流程录制器,用户只需用自然语言描述“点击‘提交订单’按钮”,模型即可在毫秒级内返回准确坐标,相比之前的双次截图方案,吞吐量提升约 30%,且定位失败率下降。
- 电商购物助手:在一款移动购物 App 中,利用 InnerZoom 实现智能比价代理——当用户说出“帮我找到这个商品的最低价格”,Agent 通过单次前向推理定位到价格标签区域,然后执行截屏、OCR 和价格比对,整个操作延迟小于 1 秒,显著优于需要二次放大再定位的旧方案,从而支撑大规模并发用户。
局限
- **模型规模与任务泛化性受限**: 当前 InnerZoom 仅在约 4B 参数的 MLLM 上进行实验验证,尚未在更大规模模型(如 7B、13B)上评估跨层证据桥接的可扩展性;所有基准测试均聚焦于 GUI 截屏界面,缺少对自然图像、视频或开放域多模态对话的泛化证据,将其推广至更广泛的视觉 grounding 场景时可能需要重新设计证据提取策略与注入方式。
- **证据状态传递的假设与开销**: InnerZoom 假设目标区域的线索可以通过紧凑的证据状态在解码层间有效传递,但实际实现中引入的 **区域特征检索器** 与 **跨层精炼模块** 可能增加额外参数和内存占用,尤其在高分辨率输入下,多头注意力检索与状态维护会成为新的计算瓶颈;论文未探讨更复杂的证据更新机制(如迭代优化或时序融合),可能限制了在需要多步推理或动态定位任务上的性能上限。
- **与物理重采样方法的精度边界**: 相比两阶段 ZoomIn 显式裁剪再定位,InnerZoom 用跨层隐式证据注入近似替代物理重采样,在处理极小目标、高遮挡或界面元素密集的场景时,证据状态可能无法完整保留空间细节,导致定位精度劣于真正的两阶段方法;失败案例也反映出当上下文语义与坐标解码要求冲突时,注入的证据易被后续自注意力层稀释,降低最终点击的准确性。