GUI-Primitives: 诊断视觉语言 GUI 定位中的空间推理失败
计算机使用智能体需将自然语言指令与截图中的界面元素对应,然而现有基准未能区分模型是否将关系语言正确绑定到目标元素。我们提出 GUI-Primitives,一个包含 994 条对比指令对的基准,覆盖图形用户界面中的七种空间关系(左/右、上/下、包含、对齐、邻近、列表序数、遮挡)。每条对比对固定截图与锚点,仅改变关系表述,使正确目标在两个指定候选项之间移动。五位标注者验证了一个 196 条子集(良构性 κ=0.94,目标选择 κ=0.79)。 十九个视觉语言模型在严格点框一致率上最高仅达 32%。由于模型输出无约束坐标,我们根据预测落入的候选区域对其分类,60–92% 的预测落在两个候选区域之外。在落入候选区域的前提下,水平位置、垂直位置、邻近和列表序数的目标选择准确率达 0.82–0.90,但包含与遮挡关系与 0.50 无显著差异:多数失败源于候选定位而非关系理解。 在十个模型上,基准准确率与 ScreenSpot-Pro 准确率相关(Spearman ρ=+0.74),此关联在该样本量下属于探索性结果。标记两个指定候选区域可将选择准确率提升 35–57 个百分点,这一oracle诊断方法提供了候选集合,而非可部署方案。我们发布了基准、预测结果与代码。
论文精读
TL;DR GUI-Primitives 用 994 组固定截图与锚点、仅替换空间关系词的对照指令,发现视觉语言模型 GUI 定位失败主要因候选框定位而非关系理解,标注候选框后选择准确率提升 35–57 个百分点。
问题
问题背景
当前研究关注 GUI grounding 任务:计算机使用代理需根据自然语言指令,在截图中定位目标界面元素。空间关系(left/right、above/below、containment、alignment、proximity、list ordinal、occlusion)是这类指令的核心,直接决定操作正确性。
现有方法局限
现有基准如 ScreenSpot 与 ScreenSpot-Pro 只评估整体定位精度,未隔离关系语言绑定与候选元素定位两个子过程。模型输出无约束坐标,预测常落在目标候选区域之外,导致无法判断失败原因:是关系理解错误,还是元素检测失败。此外,缺少最小对比对(minimal pair)设计,无法控制截图与锚点恒定、仅改变关系表达式,从而无法干净归因。
为什么这个问题难/重要
空间关系推理要求跨模态绑定语言中的关系词与视觉布局中的几何/拓扑特征,而 GUI 元素往往尺寸小、密集分布、存在遮挡与同类别干扰,定位本身已困难。论文中 19 个视觉语言模型最高仅 32% 的 strict point-in-box accuracy,且 60-92% 的预测落在两个候选之外。当模型连候选区域都进不了,说明底层定位能力是主要瓶颈,而非高层关系理解。业界正将多模态 agent 用于自动化操作、RPA、无障碍辅助等场景,此类细粒度失败会直接导致误触、漏点,影响可靠性与信任度。
行业类比
类似自动驾驶中理解“前方路口左转”指令:如果车辆无法先识别出路口与车道候选区域,而仅靠语言上的“左”关系无法保证安全变道。GUI agent 同样需要先可靠定位候选元素,再绑定空间关系,否则会做出错误点击。
核心洞察
- GUI-Primitives 基准揭示模型在 GUI grounding 中的主要瓶颈是元素定位而非空间关系推理。与传统基准混淆定位与关系评估不同,该工作通过对比指令对固定截图与锚点,仅改变关系表达式,并利用候选区域分类将“能否定位候选”与“能否选择正确关系”分离。结果整体准确率极低(≤32%),但当预测落入候选区域时,多数关系选择准确率达 0.82–0.90,表明模型具备关系理解但无法可靠生成候选框。
- 提供两个指定候选区域的 oracle 干预使选择准确率提高 35–57 个百分点,暗示模型能力被低估。这一诊断性干预并非可部署方法,但表明模型在给定候选集时能较好利用关系线索;因此,改进方向应聚焦于候选提议机制或注意力引导,而非仅训练关系推理。这与当前一些工作直接微调关系理解形成对比,为计算机使用代理的优化提供了新视角。
- 在十个模型上,GUI-Primitives 的严格点入框准确率与 ScreenSpot-Pro 准确率呈 Spearman ρ=+0.74 的相关性。虽然样本量有限,但这一探索性关联说明针对空间原语的诊断性能可能反映更广泛的 GUI 定位能力。该基准不仅用于细粒度分析,还可作为模型筛选的快速代理,避免在大型基准上耗费资源。
方法
方法概述
GUI-Primitives 构建了一个最小对比基准,用于隔离 VLM 在 GUI 截图中的空间关系绑定能力。
- 输入:真实或合成截图,以及一对对比指令(共享同一 anchor 和目标候选区,仅改变关系表达,如
left of→right of,正确目标在两个候选间切换)。 - 关键模块:
- 七种空间原语:包括左右、上下、包含、对齐、邻近、列表序数和遮挡。
- 最小对构造:固定截图和锚点,替换关系词,确保模型预测差异只能归因于关系理解。
- 人工验证:5 名标注者对 196 项子集进行 well-formedness 与 target selection 标注,一致性 κ 分别为 0.94 / 0.79。
- 模型评测协议:19 个 VLM 接收截图 + 指令,输出非约束坐标;使用 point-in-box strict accuracy 作为主指标,并将预测分类到候选区域做误差分析。
- 诊断干预:oracle 候选标记(提供两个候选框)使选择准确率提升 35--57 个百分点,用于区分定位失败与关系理解失败。
- 输出:每个原语上的失败结构(如模型预测落在两候选之外的比例达 60%--92%),以及基准能力与 ScreenSpot-Pro 的相关性(Spearman ρ=+0.74)。
与同类差异:不同于传统 GUI grounding 基准只测端到端点击,该方法通过对比指令对将「候选定位」与「关系绑定」分离,能显式诊断失败来源。
实验
实验设计
GUI-Primitives 是一个包含 994 项对比指令对 的基准,覆盖七种空间关系(左右、上下、包含、对齐、邻近、列表序数、遮挡)。每对指令保持截图与锚点元素不变,仅改变关系表达,使正确目标在两个指定候选之间切换。标注子集(196 项)经五名标注者验证,well-formedness κ=0.94、target selection κ=0.79。评估 19 个视觉语言模型,输出无约束坐标,以 strict point-in-box accuracy 为主指标,并将预测分类到候选区域内/外。
关键发现
- 所有模型最高 strict 精度仅 32%,且 60-92% 的预测直接落在两个候选区域之外。
- 若只考虑落在候选区域内的预测,水平/垂直/邻近/列表序数的条件选择准确率为 0.82-0.90,但包含与遮挡仅 ≈0.50(与随机无异)。
- 这表明多数失败源于候选元素定位而非关系理解本身。
- 在 10 个模型上,本基准得分与 ScreenSpot-Pro 的 Spearman 相关系数为 +0.74,存在探索性关联。
- 用 oracle 标记两个候选后,选择准确率提升 35-57 个百分点,但该干预不可部署,仅作诊断。
与基线对比解读
与 ScreenSpot-Pro 等现有 GUI grounding 基准相比,GUI-Primitives 通过最小对比对设计隔离了空间关系绑定错误,避免混淆整体界面定位与关系推理。相关性结果表明,当前模型的根本瓶颈在元素定位阶段,而非对空间语言的理解——这对实际工程有直接启示:优化候选生成或检测模块可能比改进多模态融合更有效。CoT 与激活操控等训练无关干预未带来增益,进一步说明现有推理链尚不足以弥补低层视觉定位缺陷。
行业影响
落地场景
GUI-Primitives 可作为计算机使用代理(computer-use agent)在电商、企业服务、内容平台等领域的诊断与质检工具。例如:电商 RPA 自动填写商品表单时,模型需理解“点击价格输入框右侧的按钮”这类指令;内容平台审核工具需根据“删除位于列表第三项的封面”执行操作。该基准能暴露模型在 containment、occlusion 等空间关系上的定位盲区,指导针对性优化。
商业价值
主要价值在降低自动化失败率与人工干预成本。论文显示基线模型点框命中率仅 32%,但标注候选区域后选择准确率提升 35–57 个百分点。这意味着在真实业务流程中,可先让模型生成粗候选集,再配合轻量级关系判断模块,大幅提升 GUI 任务成功率。对于依赖 RPA 或低代码平台的企业,直接减少错误点击带来的重试耗时与客诉风险,并提升流程吞吐量。
跟现有产品/工作流的接口
可作为 CI/CD 回归套件 集成到 VLM 模型版本更新流程,自动监控空间推理能力的退化。具体做法:
- 将 GUI-Primitives 的对比指令对转换为批量测试用例,输出每个 relation 的失败率;
- 与 ScreenSpot-Pro 等整体 grounding 基准联动,形成分层评估(整体定位 + 细粒度关系诊断);
- 借鉴其
oracle two-candidate marking思路,在推理阶段加入候选框提示(如视觉标注、布局先验),作为后处理模块接入现有 agent 框架(如 OpenAI Operator、Claude Computer Use)。
具体落地 use case:
- 企业服务 SaaS 自动化:在 Salesforce 或 Zendesk 界面中,用 GUI 代理执行“将工单状态改为‘已解决’并点击保存”。先用 GUI-Primitives 诊断模型对
above/below与alignment的敏感度,再决定是否启用候选框标记恢复。 - 电商后台库存管理:指令“把第三行 SKU 的库存加 10”需要理解
list ordinal关系。通过 benchmark 筛选出在该关系上性能稳定的模型,或对失败样本自动补充候选区域,减少人工核对成本。
局限
- 论文在设计上存在局限:Oracle 候选区域标记属于事后诊断手段,不能直接部署到真实 agent 流程中;同时,模型仅被要求输出目标点坐标,没有评估点击后的动作执行或与环境的后续交互,因此 benchmark 得分无法直接映射为 computer-use agent 的端到端任务成功率。
- 基准的空间关系覆盖有限:仅包含七种基础关系(left/right, above/below, containment, alignment, proximity, list ordinal, occlusion),缺少更复杂的组合关系(如 “between”“nearest to” 等);此外,994 个样本中合成截图比例可能较大,真实 GUI 的多样性、噪声和视觉风格差异可能未能充分体现,影响结论的外推性。
- 最小对构造引入分布偏差:每条指令都经过对比式设计,以隔离关系词的影响,但这种构造方式使指令文本偏向模板化,与真实用户向 agent 发出的自然语言指令分布存在差异;同时每项仅设置两个候选区域,忽略了实际界面中多元素干扰和遮挡更复杂的场景,可能高估模型在真实环境中的关系判别能力。