GUICrafter: 弱监督 GUI 智能体利用大量无标注截图
数据作为现代智能的基础,极大推动了当前基础模型的发展。研究者自然希望将此范式扩展至 GUI 智能体领域,期望通过类似范式构建强大的 GUI 智能体。然而,GUI 智能体数据无法直接从互联网获取,导致大规模收集成本高且困难。当前 GUI 智能体面临跨设备泛化能力差、对细粒度 GUI 元素的视觉定位能力有限等问题。 为解决数据挑战,本文提出 GUICrafter,一种弱监督 GUI 智能体,利用大量无标注截图显著降低对昂贵人工标注的依赖。GUICrafter 探索了课程学习框架,通过两个渐进阶段训练智能体: 1. 阶段1:模型从大规模无标注截图和网页中学习视觉定位,利用 GUI 交互中丰富的上下文信号,无需人工标注。 2. 阶段2:利用少量高质量数据,通过强化学习对模型进行校准。 实验表明,GUICrafter 在仅使用 0.1% 数据的情况下,达到了与 UI-TARS 等先进系统相当甚至更优的性能。在相同标注数据量下,GUICrafter 超越了 GUI-R1 等所有先前方法。代码、数据及模型已开源。
论文精读
TL;DR GUICrafter 利用海量未标注截图进行弱监督视觉定位预训练,再用少量高质量数据强化学习校准,以极低标注成本实现与 UI-TARS 等系统竞争的性能。
问题
问题背景
当前 GUI 代理领域试图借鉴基础模型的大数据驱动范式,通过海量交互数据训练跨应用、跨设备的通用代理。然而,与自然语言或视觉数据可自由从互联网获取不同,GUI 交互指令与动作对难以直接爬取,数据稀缺成为制约代理能力泛化的核心瓶颈。
现有方法局限
现有主流方法(如 UI-TARS)高度依赖人工精细标注的指令-动作对,标注成本极高,导致数据规模受限。由此引发两个典型问题:
- 跨设备泛化差:模型仅在少数标注应用的界面上训练,面对新设备、新布局时准确率骤降;
- 细粒度视觉 grounding 弱:对小元素(按钮、图标、输入框)的定位与交互意图理解不足,常出现坐标偏移或误触。
这些方法缺乏从大规模未标注截图中自学 GUI 通用模式的能力,使得每扩展一个新领域都需要新一轮昂贵标注,难以工程化复现。
为什么这个问题难/重要
GUI 界面的视觉-交互语义蕴含在结构、文本、图标、布局等多模态信号中,且不同平台风格迥异,很难设计统一的无监督目标。同时,动作空间的连续性(坐标点击、滑动轨迹)使常规自监督对比损失不易直接适配。业界对“规模化 GUI 代理”的呼声日益强烈:尤其在自动化测试、RPA、无障碍辅助等场景,代理必须能泛化到未见界面。若能像 CV/NLP 那样利用海量无标注数据预训练出通用表示,再通过少量人工标注进行迁移,将极大降低落地成本,这正是 GUI 代理走向实用的关键一步。
行业类比
这与 NLP 中利用海量无标注文本预训练语言模型、或 CV 中利用大量未标注图像进行对比学习如出一辙——GUICrafter 试图为 GUI 代理构建类似的“从原始截图中自我学习”范式,打破对昂贵人工标注的依赖。
核心洞察
- **弱监督预训练将 GUI Agent 从数据标注瓶颈中解放**。GUICrafter 通过构造元任务(如动作预测、元素定位),从无标注截图和网页的交互信号中提取监督,绕过了 UI-TARS、GUI-R1 等依赖大量人工标注的路径。这不仅将数据成本降低数个量级,还天然覆盖了多样化的设备与场景,从根本上改善了跨设备泛化能力。
- **两阶段课程学习实现数据效率的极限突破**。先在大规模无标注数据上建立通用视觉基础,再通过极小量高质量标注进行 RL 对齐,GUICrafter 仅用 UI-TARS 0.1% 的数据即达同等或更优性能,并在相同标注量下超越 GUI-R1。这种“广预训练+精对齐”的策略为资源受限的 GUI Agent 工程化提供了高效范式。
方法
方法概述
GUICrafter 采用 课程学习 框架,分两个阶段训练一个通用型 GUI 代理,旨在从大量无标注截图中提取视觉基础能力,再用少量高质量标注数据进行调优,从而大幅降低对人工标注的依赖。
第一阶段:弱监督 GUI 预训练
- 输入:海量 无标注的真实网页和移动端截图,无需任何人工操作轨迹或文本描述。
- 关键设计:
- 交互信号提取:利用浏览器渲染引擎或 DOM 树自动抓取可交互元素 (如按钮、输入框、链接) 的位置、类型和文本信息,构建 伪标签。
- 元任务构建:设计多种自监督预训练任务,例如
元素定位(给定描述找到对应坐标)、文本匹配(对齐可见文字与描述)、图标分类等,引导模型学习 GUI 元素的视觉和语义表示。 - 训练算法:采用对比学习或直接回归坐标的方法,通过
Gaussian reward(高斯奖励) 鼓励模型输出与真实边界框重合度高的预测,无需离散动作空间。
- 输出:一个具备 通用视觉基础能力 的预训练模型,能够理解不同 UI 元素的外观和功能,但没有任务执行逻辑。
第二阶段:高质量强化微调
- 输入:少量 高质量标注的 GUI 操作轨迹 (截图-动作对,如 Mind2Web 或 AndroidControl 数据),以及第一阶段预训练的模型权重。
- 关键设计:
- 强化学习优化:将 GUI 操作建模为序列决策问题,使用 GRPO (Generalized Reward Policy Optimization) 算法直接优化动作输出策略。
- 奖励机制:结合任务完成信号 (稀疏奖励) 和动作与标注的相似度 (稠密奖励) 进行策略更新,使得模型能适应具体任务要求。
- 输出:经 RL 调优后的最终 GUI 代理,可以根据任务指令和当前屏幕截图生成精确的 操作动作 (如点击坐标、输入文本、滑动方向等)。
与同类方法的差异
相比 UI-TARS 等依赖大量人工标注的端到端训练方案,GUICrafter 通过第一阶段的无监督预训练将 标注数据需求降低至 0.1%,同时利用课程学习分离了视觉基础与任务执行两个能力的获取,使得模型在跨设备泛化和细粒度元素定位上更具优势。
实验
实验设计
GUICrafter 在六个具有代表性的 GUI agent 基准上全面评估,覆盖 Web(Mind2Web)、桌面(OmniACT、ScreenSpot-Pro)、移动端(AndroidControl、AITW)和动态交互模拟(AndroidWorld)。这些基准要求模型完成元素定位、指令跟随或多步交互,检验跨平台泛化与细粒度视觉定位能力。训练采用两阶段课程:
- Stage 1:在数百万无标注截图上进行弱监督预训练,利用页面交互信号(如可点击元素、布局层次)生成伪标签,以对比学习与定位损失强化视觉基础。
- Stage 2:仅用极少量高质量人工标注数据(约 UI-TARS 的 0.1%),通过强化学习(RLVR/GRPO) 校准模型的动作决策,引入高斯奖励设计提升步长探索鲁棒性。
关键发现
- 极致数据效率:相比需要海量标注的 UI-TARS,GUICrafter 仅用 0.1% 数据 即达到相当甚至更优的性能,证明弱监督预训练可从无标注截图中学习通用 GUI 表征。
- 统一框架优势:在同等标注量下,GUICrafter 全面超越 GUI-R1 等先前方法,说明课程学习组合预训练与 RL 微调的有效性。
- 消融启示:预训练阶段去除会导致跨设备泛化骤降;高斯奖励对稀疏和密集任务均有增益;任务构造中交互信号多样性是关键。
与基线对比
UI-TARS 依赖大规模人工标注的定位和指令数据,而 GUICrafter 用弱监督突破了数据围墙,在 ScreenSpot-Pro 上的细粒度定位准确率不输 UI-TARS,甚至在某些条件下更优。与 GUI-R1 的对比在同一数据量级下凸显了预训练的价值:仅 RL 微调难以弥补低质量初始表征,GUICrafter 的视觉基础来自海量界面,使后续 RL 探索更高效。该范式为低成本、可扩展的 GUI agent 训练提供了新路线。
行业影响
落地场景
GUICrafter 可嵌入任何需要跨平台、跨应用的 GUI 自动化的产品中,典型场景包括:
- 企业级 RPA (Robotic Process Automation):处理多设备的报销审批、报表生成、数据迁移等操作,无需为不同界面重新标注。
- 智能虚拟助手:在电商售后、客服工单系统中,自动识别并点击按钮、填写表单,适应网页端与移动端 UI 差异。
- 自动化测试:回归测试中自动定位 UI 元素,减少因界面微调导致的测试脚本失效。
具体用例:
- 电商订单履约:跨 Web 后台与移动仓库系统,自动抓取订单、更新物流状态,GUICrafter 在仅少量业务标注数据下即可精准点击细粒度控件(如下拉框、日期选择器)。
- 金融合规审计:在多个内部系统中自动截图、比对报表数据,依靠弱监督预训练的视觉定位能力,减少对人工定义坐标的依赖。
商业价值
- 降本:预训练阶段利用海量无标注截图(可从互联网免费获取),仅需 0.1% 的高质量标注数据进行 RL 校准,直接削减 90%+ 的数据采集与标注成本。
- 增收:通过跨设备的可靠执行,降低自动化流程的中断率,提升任务完成率,间接提高业务吞吐量。
- 体验提升:视觉定位能力的增强使 GUI agent 能更好地理解弱 UI 信号(如非标准图标、动态布局),减少人工介入。
与现有工作流的接口
- 与 RPA 框架集成:GUICrafter 可作为视觉定位模块,替换 UiPath、Playwright 等工具中基于坐标或简单图像匹配的定位方式,输出结构化动作指令(点击、输入等),直接调用系统 API。
- 与多模态模型协作:将 GUICrafter 的视觉 grounding 能力作为插件,接入现有 VLM(如 GPT-4o、Gemini),提供“看图操作”的统一接口:接收截图 → 定位目标 → 生成操作序列。
- 数据管线对接:利用现有的爬虫或截图收集工具,持续输入未标注 GUI 图像,实现模型的自演进,减少对人工的持续依赖。
局限
- - **弱监督信号噪声与构造局限**:第一阶段依赖从海量网页和截图中提取的交互信号(如点击区域、元素定界框),但这类弱标注不可避免地存在噪声(错标、漏标),尽管论文分析了噪声鲁棒性,在极端噪声场景下模型仍可能学到虚假关联,尤其对稀有 UI 控件或视觉模糊元素。交互信号的构造依赖启发式规则(如从 HTML DOM 推测可交互区域),这些规则对不同平台和渲染引擎的泛化性未经充分验证,可能限制预训练知识的迁移范围。
- - **两阶段训练复杂度与数据依赖**:课程学习框架虽提升数据效率,但分离为弱监督预训练和 RL 微调两个阶段,引入了额外的超参数(预训练数据规模、课程难度、奖励权重、RL 步数等),调参成本较高。第二阶段仍需少量高质量标注数据,其“高质量”的定义与采集标准(如任务多样、标注精确)缺乏严格规范,可能影响不同团队复现的稳定性和最终性能,削弱方法的易用性。
- - **跨平台跨场景泛化未充分验证**:评测基准主要覆盖网页(Mind2Web)和安卓(AndroidControl、AITW、AndroidWorld),对桌面操作系统(Windows/macOS)、嵌入式设备或游戏界面等 GUI 的迁移性能尚未展示。模型极度依赖视觉基础能力,当面对低分辨率、艺术化风格或动态变化剧烈的界面(如视频播放器控件)时,性能退化的风险较高,且缺乏对非英语界面或无障碍访问模式的支持证据。