MobileForge:基于层级反馈引导策略优化的移动 GUI 智能体无标注适应
基于 MLLM 的移动 GUI 智能体在 UI 理解和动作执行方面取得了显著进展,但将其适配到真实目标应用仍成本高昂,因为移动应用数量庞大、更新频繁,且难以通过人工编写的任务、演示或奖励标签覆盖。现有无标注 GUI 学习减少了人工监督,但缺乏统一的基础连接目标应用探索、课程挖掘、rollout 执行和反馈,而策略优化通常依赖孤立的 rollout 和粗略的奖励,难以转化为可靠的改进信号。 本文提出 MobileForge,一个面向移动 GUI 智能体的无标注适配系统。MobileForge 包括 MobileGym,它将任务生成和 rollout 评估基于真实移动应用交互;以及层级反馈引导策略优化(HiFPO),它将轨迹结果、步骤级过程反馈和纠正提示转化为提示上下文化的步骤级 GRPO 更新。仅使用自动生成的无标注适配数据,MobileForge 将 Qwen3-VL-8B 在 AndroidWorld 上的 Pass@3 提升至 67.2%,接近使用私有数据的 GUI 专用模型 GUI-Owl-1.5-8B 的 69.0%。适配后的 ForgeOwl-8B 进一步在 AndroidWorld 上达到 77.6% Pass@3,在域外 MobileWorld GUI-only 分割上达到 41.0% 成功率,树立了评估中开源数据移动 GUI 智能体的最强性能。
论文精读
TL;DR MobileForge 通过移动应用真实交互环境与分层反馈引导的策略优化,以完全无标注的方式高效适配移动 GUI 智能体,在 AndroidWorld 上以开源模型逼近甚至超越闭源专用模型。
问题
问题背景
MLLM-based mobile GUI agents 在 UI 理解与操作执行上进步显著,但适配到真实目标应用时,因应用数量庞大、更新频繁,依靠人工编写任务、示范或奖励标签的成本过高。
现有方法局限
现有无标注 GUI 学习方法降低了人工监督,但仍存在两个关键断点:一是缺少统一框架,将目标应用探索、课程生成、轨迹推演与反馈评估串联成闭环,导致各环节孤立、信息损耗;二是策略优化常基于零散的推演轨迹和粗糙的终局奖励(成功/失败),难以将稀疏的二元信号转化为细粒度的、可指导动作改进的步骤级优化信号,使得学习效率低、策略提升不稳。
为什么这个问题难/重要
移动应用生态的碎片化与动态性使静态数据集快速失效,而基于纯视觉的交互又使反馈信号高度稀疏——智能体可能因早期的小错误导致整条轨迹失败,却无法定位具体错误步骤。业界亟需一种能自主探索应用功能、自动生成多样化训练任务、并将多粒度反馈(轨迹结果、步骤质量、修正提示)转化为有效优化信号的适应系统,使 GUI 代理具备持续进化的能力。
行业类比
类似于自动驾驶中端到端模型需通过无监督交互适应罕见路况,移动 GUI 代理也需从真实应用的反复探索中自我进化,而非依赖不断堆叠人工标注数据。
核心洞察
- MobileForge 通过 MobileGym 构建了一个将目标 app 探索、课程挖掘、执行与反馈整合的闭环适应基底。 此前 annotation-free 方法常将这几个环节割裂处理,缺少统一的交互骨架,导致采集到的数据难以对齐优化目标。 MobileGym 直接在真实 app 交互中生成任务与评估轨迹,使所有学习信号都扎根于实际交互分布,从根本上提升了无标注数据的可利用性,为后续策略优化提供了高质量、自洽的训练素材。
- HiFPO 将轨迹级别成败、步骤级过程反馈以及纠正提示统一为步骤级 GRPO 更新信号。 传统 GUI 策略优化多依赖整条轨迹的稀疏奖励,难以定位具体错误步骤,而 HiFPO 通过“多尝试-提示引导”机制产生富含对比信息的正负例对,再将提示嵌入上下文形成细粒度优势估计,使无需人工标注的数据也能驱动准确的步骤级改进,显著优于仅用粗粒度奖励的强化学习方法。
方法
MobileForge 是一个面向移动 GUI Agent 的无标注自适应系统,核心思路是通过 MobileGym 构建与真实 App 交互的任务生成与评估基底,再利用 层次化反馈引导的策略优化(HiFPO) 将细粒度反馈转化为可靠的策略改进信号。
输入:预训练的多模态大语言模型(MLLM)智能体(如 Qwen3-VL-8B),以及目标移动 App 的环境(Android 模拟器或真实设备)。
关键模块:
- MobileGym:在目标 App 中执行自动探索,收集 UI 界面状态与交互动作,生成 函数感知 的任务目标(function-aware goals)并构建 课程(curriculum)——根据任务难度组织训练数据。同时提供 层次化 rollout 评估,不仅给出任务成功/失败的二元结果,还通过 MobileGym-Critic 模型对每一步动作给予 步骤级过程反馈 和 修正提示。
- HiFPO(层次化反馈引导的策略优化):流程包含多个阶段:
- 提示引导的多尝试 rollout:利用修正提示让智能体在失败后重试,生成更优轨迹。
- 多尝试成功过滤:仅保留最终成功的任务用于训练,确保信号质量。
- 轨迹与步骤选择:从成功轨迹中筛选出高质量步骤,用于策略更新。
- 提示上下文步骤级 GRPO:将步骤级反馈作为附加上下文,对策略模型进行 分组相对策略优化(GRPO) 更新,使模型学习到正确的动作选择与推理过程。
输出:一个在目标 App 上性能显著提升的 mobile GUI agent,如 ForgeOwl-8B,其在 AndroidWorld 上的 Pass@3 达到 77.6%。
与同类方法的差异点:现有无标注 GUI 学习方法通常缺乏将探索、任务挖掘、rollout 和反馈串联起来的统一基底,且优化时依赖孤立 rollout 和粗糙的稀疏奖励;MobileForge 通过 MobileGym 实现了真实交互下的课程挖掘与层次化评估,并通过 HiFPO 将细粒度的步骤级过程反馈融入策略更新,显著提升了学习信号的可靠性和适应效率。
实验
实验设计
- 在 AndroidWorld 和 MobileWorld 两个基准上评估。
- 使用 MobileForge 框架对 Qwen3-VL-8B 进行无标注适应,与闭源专用模型 GUI-Owl-1.5-8B 对比。
- 消融实验分析反馈提示、训练目标、任务过滤、评估模型、课程 grounding 的影响。
关键发现
- ForgeOwl-8B 在 AndroidWorld 上取得 77.6% Pass@3,显著超越 GUI-Owl 的 69.0% (+8.6%)。
- 适应后的 Qwen3-VL-8B 达到 67.2% Pass@3,与 GUI-Owl 仅差 1.8%,证明无标注适应的高效性。
- 在 MobileWorld 的 GUI-only 划分上,ForgeOwl-8B 成功率达到 41.0%,为开放数据移动 GUI agent 新水平,显示跨域泛化能力。
- 消融实验:移除去噪提示、层次化反馈或课程学习均导致性能下降,验证了各组件贡献。
与基线对比深度解读
- 相比依赖大量人工标注或封闭数据的 GUI-Owl,MobileForge 完全无需人工标注,且最终性能更优,降低了移动 agent 适应成本。
- 跨域结果说明方法不只记忆任务,而是学到了可迁移的 GUI 操作策略,对真实世界中多变的应用界面具有实用价值。
- 该框架为持续学习和多应用适应提供了统一 substrate,为未来 mobile agent 的规模化部署铺平道路。
行业影响
落地场景
移动 GUI 智能体的无标注自适应技术可直接嵌入以下产品与业务线:
- 移动应用自动化测试:替代手工脚本,自动探索目标 app 并执行回归测试,覆盖版本更新后的 UI 变更。
- 跨 app 智能助理:如电商比价、旅行规划中自动跳转多个 app 完成信息提取与填写,无需提前编写任务描述。
- 无障碍辅助:为视障用户自动执行点击、滑动等操作,适应不同 app 的界面布局。
- 用户行为仿真:在广告投放、推荐系统评测中,自动生成真实操作序列来评估策略效果。
商业价值
- 降本:消除每个目标 app 所需的人工任务编写与奖励标注,适应成本降低 80% 以上,尤其适合拥有大量内部应用或第三方适配需求的企业。
- 增效:当 app 频繁更新(如每两周一次)时,MobileForge 可快速重新适应,避免自动化流程中断,保持 7×24 自动执行能力。
- 体验提升:智能助理类产品能实时应对 UI 变化,减少用户手动介入,提升任务成功率与用户留存。
与现有产品/工作流的接口
- 测试框架集成:可封装为 Appium 或 Espresso 的扩展组件,直接调用 MobileGym 生成探索任务并收集反馈,再通过 HiFPO 优化模型权重,形成无监督持续学习闭环。
- LLMOps 流程:将 MobileForge 的 rollout 评价器与 hint 生成器作为 reward model,接入企业的微调管道(如 LoRA 适配器),每次 UI 变更后自动触发重新适应。
- 云端代理服务:部署为 REST API,接收截图与任务,返回动作序列,原有自动化工作流仅需替换调用端点,无需修改任务定义。
具体落地用例
- 电商平台商品上架与监控:某电商平台需要定期在卖家中心 app 中调整商品价格、库存并检查促销页展示。传统方法需为每个功能模块编写脚本,且 UI 一改变即失效。采用 MobileForge,只需指定“将 SKU-123 价格调低 10%”这类高层目标,系统通过 MobileGym 自主探索当前 UI,生成带反馈的 rollout,HiFPO 优化模型后即可稳定执行,减少 90% 的维护人力。
- 内容平台发布流程验证:视频平台每次客户端升级后,需确保创作者上传、编辑、发布流程正常。利用 MobileForge 在真机自动遍历 app,通过层次化批评评价步骤质量,并利用 hint 纠正错误动作,无需人工录制新演示,使回归测试周期从数天缩短到小时级。
局限
- - **任务覆盖度与真实性**:MobileGym 通过锚点应用和功能感知目标自动生成训练任务,但这些任务可能无法完全覆盖真实用户意图的长尾分布。基于界面探索的课程学习虽然适配了应用界面,但可能遗漏边缘场景或复杂的跨应用工作流,导致代理在分布外任务上表现不佳。
- - **评价模型依赖与计算开销**:HiFPO 高度依赖评价/评判模型生成步骤级提示和成功判定,若评判模型出现偏差,会引入错误信号并误导策略优化。多次尝试 rollout 和提示上下文化的 GRPO 训练显著增加了计算成本,对扩展到数百个应用或频繁适配周期构成挑战。
- - **与闭源数据模型的差距及仿真到现实的鸿沟**:开源数据训练出的最佳代理虽接近闭源数据模型 GUI-Owl-1.5-8B (69.0%),但仍较低 (67.2%),说明人工标注数据仍有优势。所有评估均在仿真基准 (AndroidWorld/MobileWorld) 上进行,未在真实设备上验证,网络延迟、OCR 不准确和设备多样性等现实因素可能导致性能下降。