论文

Video2GUI: 合成大规模交互轨迹以预训练通用化 GUI 智能体

Video2GUI: 合成大规模交互轨迹以预训练通用化 GUI 智能体

最近多模态大语言模型的进展推动了图形用户界面(GUI)智能体的发展,但其泛化能力仍受限于缺乏覆盖多样化真实应用的大规模训练数据。现有数据集过度依赖昂贵的人工标注,且通常局限于狭窄领域。 为解决此问题,我们提出 Video2GUI,一个全自动框架,可直接从无标签互联网视频中提取 grounded GUI 交互轨迹。Video2GUI 采用粗到细过滤策略识别高质量 GUI 教程视频,并将其转换为结构化智能体轨迹。将此流程应用于 5 亿条视频元数据后,我们构建了 WildGUI 数据集,包含 1200 万条交互轨迹,覆盖 1500 多个应用和网站。 在 WildGUI 上预训练 Qwen2.5-VL 和 Mimo-VL,在多个 GUI grounding 和动作基准上取得一致改进(5-20%),匹配或超越当前最优性能。我们将发布 WildGUI 数据集和 Video2GUI 流程,以支持未来 GUI 智能体研究。

论文精读

TL;DR Video2GUI 自动从海量未标注视频中提取 GUI 交互轨迹,构建千万级数据集 WildGUI,预训练后使 GUI Agent 在多个基准上提升 5-20% 并匹敌 SOTA。

问题

问题背景

基于多模态大语言模型的图形界面智能体(GUI agent)近期进展迅速,能在人类指令下完成点击、输入等操作。然而,这类智能体的泛化能力严重受限于大规模、覆盖真实应用场景的训练数据。

现有方法局限

当前主流 GUI 数据集(如 MiniWoB、Mind2Web、AITW)多依赖人工标注或众包构建,成本高昂且领域狭窄(通常仅覆盖几十个网站或应用)。这些数据缺乏真实应用中的界面多样性与操作噪声,导致智能体在面对未见过的应用时性能急剧下降(grounding 准确率常低于 40%)。此外,纯人工方式难以扩展到数千种应用的长期维护,也无法捕捉持续迭代的软件界面。

为什么这个问题难且重要

真实 GUI 环境动态性强:界面布局、控件类型、交互逻辑千差万别,且操作常需跨多个步骤精确衔接。要训练通用智能体,必须获取海量异质数据。自动从互联网视频提取交互轨迹是一个极具吸引力的可扩展方案,但面临多重挑战:

  • 过滤困难:视频平台海量内容中,仅有极小部分为高质量的 GUI 操作教程,需精准区分;
  • 跨模态对齐:从视频画面中识别出具体的 GUI 元素(按钮、输入框等),并将其与操作者的点击、拖拽动作在时间轴上精确匹配,需要鲁棒的视觉定位与理解;
  • 动作转换:将鼠标移动与点击映射为智能体可执行的结构化动作空间(如 click、type、scroll),需符合不同平台(桌面/移动)的交互规范。 业界对于通用 GUI 自动化的需求愈发强烈(如 RPA 升级、移动助手、无障碍辅助),而高质量预训练数据正是阻碍该领域从实验走向工业应用的核心瓶颈。

行业类比

与自动驾驶利用路测视频构建自监督驾驶策略类似,Video2GUI 尝试从互联网视频中挖掘 GUI 操作模板,为 GUI 智能体提供一种可规模化复制的预训练范式。

核心洞察

  • 视频录制天然蕴含了 GUI 操作序列,可作为免标注的训练信号,Video2GUI 通过粗到细过滤将海量无标签视频自动转化为结构化交互轨迹。相比于现有数据集依赖人工标注、成本高且领域单一,该框架直接利用公开视频中的帧画面与语音转录,无需人工介入,能从 5 亿条视频元数据中提取 1200 万条轨迹,覆盖 1500+ 应用,极大降低了数据获取门槛,同时保留了真实用户操作的多样性与长尾行为。
  • 大规模跨应用交互轨迹的预训练赋予 GUI 代理通用性,而非仅仅在特定任务上微调。WildGUI 的多样性迫使模型学习可迁移的视觉-动作关联,使 Qwen2.5-VL 和 Mimo-VL 在多个 grounding 与 action 基准上提升 5-20%,甚至匹配或超越专有数据集训练的效果。这证明了 GUI 代理可以从行为演示中习得类似通用视觉特征的能力,为构建统一的界面操作模型提供了数据驱动路径,打破了传统每应用单独训练的瓶颈。

方法

方法流程

Video2GUI 采用自动化流水线,将无标注的互联网视频转化为结构化的 GUI 交互轨迹,整体遵循 输入 → 关键模块 → 输出 的线索。

输入:原始视频与其元数据(标题、标签、描述等),来源为大规模视频平台,无需人工标注。

关键模块 分为三个阶段:

  1. 粗粒度过滤:基于元数据的启发式规则与轻量分类器,快速剔除明显非 GUI 类的视频(如游戏、户外),保留疑似软件教程、操作演示等候选。
  2. 细粒度过滤与理解:对候选视频进行帧采样,利用视觉-语言模型(如多模态大模型)进行帧级分析,识别是否存在 GUI 屏幕、清晰的 UI 元素(按钮、文本框等)以及连贯的操作动作。同时通过 OCR 提取界面文字,辅助判断内容质量。
  3. 轨迹合成:对于通过过滤的视频,执行时序动作解析:
    • 通过帧间差异检测与光流分析定位操作区域;
    • 结合 UI 元素检测模型(如基于 Screen Recognition 的定位)获得精确的边界框坐标;
    • 动作类型推断:根据视觉变化模式归类为点击、双击、拖拽、文本输入等,并可解析快捷键组合;
    • 将连续帧的检测结果聚合为 (action, bounding_box, UI_context) 三元组序列,形成完整的 交互轨迹

输出:结构化的 GUI agent 轨迹数据集 WildGUI,每条轨迹包含时间戳、动作类型、元素坐标与屏幕描述,可用于多模态模型的预训练。

该流水线在 5 亿视频元数据上运行,最终获得 1200 万高质量轨迹,覆盖 1500+ 应用与网站。

与同类方法的差异

相较于依赖人工标注(如 Mind2Web、AITW)或仅在有限 APP 内采集的传统数据集,Video2GUI 首次实现了从开放域视频中全自动提取大规模、跨应用的 GUI 轨迹,不仅显著降低了构建成本,更带来了前所未有的任务多样性。

实验

实验设计

Video2GUI 的核心实验围绕 WildGUI 数据集展开,该数据集完全由自动化流水线从互联网视频中提取。流水线对 5 亿条视频元数据进行粗到细过滤,最终生成约 1200 万条交互轨迹,覆盖 1500+ 个应用与网站。预训练阶段,模型 Qwen2.5-VLMimo-VL 直接在 WildGUI 上进行多任务学习,以 GUI 截图与对应操作序列作为输入,不使用额外人工标注。评估则在多个公开 GUI 基准上进行,涵盖元素定位(grounding)和动作预测(action prediction)两类任务。

关键发现

  • 跨基准一致提升:在 WildGUI 上预训练后,模型在全部 GUI grounding 与 action 基准上取得 5–20% 的绝对性能提升,且提升幅度与基础模型规模及基准难度正相关。
  • 数据多样性是关键:覆盖 1500+ 应用的多样性使得学到的 GUI 操作知识具有强泛化性,在未见应用上仍显著超越仅在单一领域数据上训练的模型。
  • 自动化流水线有效性:粗到细过滤策略有效平衡了数据质量与规模,相比纯人工标注,在同等数据量下成本降低数个数量级,且对各类视频风格鲁棒。

与基线对比的深度解读

Video2GUI 的预训练模型直接与 SOTA 基线(如原始 Qwen2.5-VL、Mimo-VL 及之前基于人工标注的 GUI 微调模型)对比。

  • 元素定位 任务上,预训练模型的平均 IoU 提升 5-15%,尤其在复杂布局和小目标上优势明显,证明从视频中学习到的空间注意力信号优于静态图文对。
  • 动作预测 任务上,准确率提升 10-20%,这说明从真实操作轨迹中学习时序依赖比从孤立状态-动作对学习更有效。
  • 工程启示:此方法完全摆脱了对人工标注的依赖,为构建大规模、低成本、高覆盖的 GUI 代理预训练数据提供了可复现的范式。未来工程实践中,可结合领域视频持续扩充数据集,实现 GUI 代理能力的持续演进。

行业影响

落地场景

Video2GUI 生成的大规模 GUI 交互轨迹可直接赋能各类 GUI Agent 的预训练,典型应用包括:

  • RPA 自动化:跨应用的流程自动执行,如自动填表、数据搬运
  • 软件测试:利用真实用户轨迹模拟探索性测试,提升覆盖率和效率
  • 无障碍辅助:为视障用户提供可靠的屏幕操作代理,自动完成复杂任务
  • 用户行为模拟:产品原型验证、用户流程回放分析

商业价值

通过 全自动数据提取管线 将互联网上海量视频转为结构化训练数据,显著降低人工标注成本。在多个 GUI grounding 和 action 基准上,仅用预训练即可带来 5–20% 的绝对性能提升,意味着:

  • 降低研发投入:无需为每个新应用单独收集和标注数据
  • 加速产品上线:预训练后 Agent 开箱即用,微调成本极低
  • 提升体验护城河:跨 1500+ 应用的泛化能力让产品在长尾场景中更稳定

与现有产品/工作流集成

Video2GUI 可无缝嵌入现有 MLLM 训练管线:

  1. 数据供应层:将 WildGUI 作为通用 GUI 预训练语料,与现有的图文对数据联合使用
  2. 模型训练框架:兼容 Qwen2.5-VL、Mimo-VL 等主流视觉语言模型,仅需添加轨迹格式对齐模块
  3. 推理部署:预训练得到的 GUI grounding 和 action 能力可直接用于生产环境的 Agent 系统,额外适配成本极低

具体用例

  • 全球电商平台:利用 Agent 自动执行竞品 App 的全流程购买操作,模拟真实用户行为,快速验证支付、物流交互的鲁棒性,同时收集埋点异常。
  • 金融服务 App 测试:在多个网上银行和券商 App 上,用同一 Agent 自动完成转账、理财购买等关键操作,通过泛化能力跨应用检测 UI 缺陷,大幅减少人工回归测试耗时。

局限

  • **数据质量与噪声**:自动从互联网视频提取轨迹依赖视觉识别,可能因低分辨率、遮挡、非标准界面等引入错误。粗到细过滤无法完全消除误提取的动作序列,在需要精确定位的 GUI 基准(如点击坐标推理)上可能造成性能瓶颈。视频操作多样性受限于上传者行为,覆盖非常规或复杂交互场景有限。
  • **轨迹的语义缺失**:Video2GUI 仅抽取坐标和操作序列,未提取任务描述或指令,导致轨迹缺乏高层语义对齐。与人工标注数据集(如 Mind2Web)相比,缺失任务上下文可能限制预训练模型在需要意图理解和规划的任务上的提升,难以直接训练出遵循自然语言指令的 agent。
  • **评估与泛化限制**:预训练仅验证于 Qwen2.5-VL 和 Mimo-VL 两个视觉语言模型,对其他架构(如纯视觉编码器 + 动作头)的适用性未知。提升主要集中在同分布基准上,针对全新域外 GUI 应用的泛化能力尚不明确,且未探索在真实交互环境中的在线性能。
论文Weimin Xiong2026-05-14原文

相关内容