MobileGym: 一个可验证且高度并行的移动 GUI Agent 研究模拟平台
我们提出 MobileGym,一个基于浏览器的轻量级、完全可控的日常移动使用环境,旨在无需复制专有后端即可实现交互保真度。它实现了之前日常应用无法实现的两种能力:通过基于结构化 JSON 状态的确定性状态判断提供可验证的结果信号,以及通过低成本并行展开实现可扩展的在线强化学习。 完整的环境状态被捕获、配置、分支并作为结构化 JSON 进行比较,一台服务器可以托管数百个并行实例,每个实例约 400 MB 内存,冷启动约 3 秒。分层状态模型和声明式任务定义框架使得状态可编程性和任务创建在大规模下保持实用,单一的编程判断机制同时提供确定性评估结果和密集的 RL 奖励。 随附的 MobileGym-Bench 提供了 416 个参数化任务模板,包括 256 个测试模板和 160 个训练模板,涵盖 28 个应用,具有确定性判断器和结构化的 AnswerSheet 协议,避免了自由文本匹配失败。在 Sim-to-Real 案例研究中,在 Qwen3-VL-4B-Instruct 上使用 GRPO 在 256 任务测试集上获得了 +12.8 个百分点的提升,在 59 任务真实设备信号子集上,真实设备执行保留了模拟侧训练增益的 95.1%。
论文精读
TL;DR MobileGym 是一个基于浏览器的可验证移动 GUI 模拟平台,通过结构化 JSON 状态实现确定性评判与并行在线 RL,仿真训练可带来 +12.8 个百分点的真实设备任务提升。
问题
问题背景
当前移动端 GUI 代理的研究正从单步意图理解转向端到端任务执行,亟需能够提供可靠奖励信号和大规模在线训练的环境支撑。
现有方法局限
- 真实设备或模拟器方案依赖截图与文本匹配进行结果验证,自由文本匹配易出错,且无法提供稠密的逐步反馈,难以支撑强化学习所需的确定性评判。
- 轨迹回放环境缺乏可控的任务生成与状态干预能力,无法实现可编程的交互逻辑,限制了复杂流程的验证。
- 现有模拟器难以低成本并行,单个实例资源消耗大(常要数 GB 内存),难以支撑需要大量并发 rollouts 的在线 RL 算法(如 GRPO)。
为什么这个问题难且重要
构建一个兼顾 交互保真度、状态可编程性 和 并行效率 的环境存在多重技术矛盾:
- 若要保证像真实设备一样的视觉与动态反馈,通常需绑定特定系统后端,导致轻量化难、状态不可复用。
- 若要实现确定性评判,环境必须内建结构化状态模型并支持精确比对,这对模拟精度要求极高。
- 业界对 Sim-to-Real 迁移 的关注升温,但多数环境无法提供与真实设备一致的语义状态,导致训练增益在真机上快速衰减。 因此,MobileGym 这类能同时提供 JSON 状态层、声明式任务框架 和 400 MB/实例轻量并发 的平台,直接切中了低成本代理训练与评估 的工程痛点。
行业类比
就像自动驾驶研发离不开高保真仿真器来安全且高效地进行百万级场景训练,移动端 GUI 代理也急需一个可验证、可并行的沙盒环境,才能实现从随机探索到可靠落地的跨越。
核心洞察
- **确定性、可验证的状态判别**:MobileGym 将移动应用状态建模为结构化 JSON,通过比较前后状态快照来判定任务完成,避免了对自由文本输出的模糊匹配。这为 GUI agent 的评估和 RL 奖励提供了可靠的、可编程的信号,从根本上解决了传统 benchmark 依赖 VLM judge 带来的非确定性和高成本问题。
- **极高并发的低成本在线 RL**:单台服务器可承载数百个并行仿真实例,内存仅约 400 MB/实例,3 秒冷启动,使得直接在仿真环境中进行在线 RL(如 GRPO)成为可能。这打破了以往因设备成本或模拟器资源限制而无法规模化训练 GUI agent 的障碍,为探索连续交互策略提供了工程基础。
- **Sim-to-Real 的结构化泛化**:通过参数化任务模板和 AnswerSheet 协议,MobileGym 将仿真训练的策略真实设备上实现了高保真迁移(保持 95.1% 的训练增益)。其关键不是图像逼真度,而是状态和动作空间的语义对齐,由此减少了 Sim-to-Real gap 对随机探索的依赖,使仿真训练更具实际落地价值。
方法
MobileGym 构建了一个浏览器托管的轻量级移动环境,以结构化 JSON 状态为核心,实现确定性评估与规模化在线 RL。
输入 → 关键模块 → 输出
1. 输入层
- 智能体接收当前状态,包括结构化 JSON(视图树、Activity 栈、应用数据等)及可选渲染截图。
- 动作空间覆盖
tap、swipe、text输入等标准 GUI 操作,由智能体输出动作指令。
2. 关键模块
- 分层状态模型:将设备状态抽象为多层 JSON(系统层、应用层、视图层),完全可序列化、可克隆、可比较,支持确定性状态比对。
- 声明式任务定义:通过参数化模板描述任务,结合 AnswerSheet 协议——以结构化字段(如
text、bool、selection)表达预期结果,避免自由文本匹配带来的评估误差。 - 程序化裁决机制:执行动作后,环境自动比对当前状态与目标任务的状态规约,直接给出确定性奖励(稠密信号)和完成标志,无需额外 VLM 裁判。
- 并行化架构:基于浏览器实例复制,单服务器可托管数百个并行环境,每个实例内存约 400 MB,冷启动约 3 秒,大幅降低在线 RL 的成本。
3. 输出
- 环境返回新的结构化状态、奖励值、终止标记,形成标准 RL 交互闭环,并支持直接导出轨迹用于分析或 Sim-to-Real 迁移。
与同类方法的差异点
相比于依赖重放录屏、VLM 判定或真实设备集群的方案,MobileGym 通过 JSON 状态的可编程性将任务判定重构为确定性字符串比较,从而消除评估噪声,并在不复制专有后端的前提下实现高保真交互与大规模并行训练。
实验
实验设计
实验依托 MobileGym 平台和 MobileGym-Bench 基准(416个参数化任务模板,覆盖28款常见应用,其中256测试、160训练)。评估分为两个阶段:
- 在仿真环境中,利用确定性状态判断器(deterministic state-based judging)对多种VLM代理进行零样本与微调后测试,量化成功率(SR)和轨迹长度。
- Sim-to-Real 迁移:以 Qwen3-VL-4B-Instruct 为基座,在 MobileGym 仿真环境中应用 GRPO(Group Relative Policy Optimization)进行在线强化学习,随后将策略迁移到真实移动设备,选取59个具备真实信号的任务子集进行验证。
关键发现
- 性能显著提升:GRPO训练后,模型在256个测试任务上的成功率提升 +12.8个百分点,证明低成本仿真RL对GUI代理的有效性。
- 高仿真保真度:在真实设备评估中,训练增益保留率达 95.1%,即仿真中获得的改进绝大部分可迁移至物理环境,避免了“sim-to-real鸿沟”。
- 并行效率:单台服务器可托管数百个并行 MobileGym 实例,每个实例约400 MB内存、3秒冷启动,使得大规模在线RL成为可能。
与基线对比的深度解读
MobileGym 的核心优势在于 确定性状态判断 替代了传统的VLM评判或文本匹配。基线(未使用GRPO的 Qwen3-VL-4B-Instruct)在复杂任务上常因界面状态识别错误或自由文本匹配失败而得分较低。GRPO训练后,代理学会了更准确地操纵结构化状态(如JSON字段),从而大幅降低误判。此外,AnswerSheet 协议 通过结构化输出避免了文本匹配歧义,进一步保障评估一致性。相比其他依赖模拟器截屏和VLM判断的基线(如常见benchmark),MobileGym的评估完全可复现且不受VLM幻觉影响,为GUI代理研究提供了更可靠的信号。
行业影响
落地场景
MobileGym 为移动端智能体(agent)研发提供了浏览器托管的轻量仿真环境,可广泛应用于以下产品/业务:
- 自动化测试:移动 App 的功能回归、兼容性测试,直接利用确定性评判(deterministic judging)替代人工校验。
- 智能助手:训练 GUI 代理在电商、金融、企业应用中自主执行多步操作(如填写表单、查询信息)。
- 内容审核与运营:在移动端自动执行内容发布、审核流程,减少重复人力。
- RL 训练基础设施:并行低成本采样,加速端到端视觉-动作策略迭代。
商业价值
- 降本:单实例约 400 MB 内存,一台服务器可并行运行数百个环境,大幅替代昂贵真机集群;任务模板化与可编程状态减少脚本维护成本。
- 增效:仿真侧 GRPO 训练 Qwen3-VL-4B-Instruct 在 256 个测试任务上提升 12.8 个百分点,且真实设备执行能保留 95.1% 的增益,极大缩短从训练到部署的周期。
- 体验提升:可验证的结果信号确保代理操作符合预期,避免线上事故;同时支持高风险操作的安全隔离评测,提升用户信任。
与现有产品/工作流的集成接口
- CI/CD 流水线:通过 API 启动批量并行测试环境,整合至 Jenkins、GitLab CI 等,在代码提交后自动运行 GUI 回归。
- 模型训练框架:与 RL 库(如 RLlib、Stable-Baselines3)对接,提供标准化
step/observe/reset接口,支持在线采样。 - 评测与监控:输出结构化
AnswerSheet协议,可直接对接 Grafana 等仪表盘进行可视化监控,或存入数据仓库用于分析。
具体落地用例
- 电商 App 订单自动化:训练代理完成“搜商品→加购→修改收货地址→提交订单”全流程。仿真环境内通过 JSON 状态比对确保地址修改成功,再部署到真实设备,有效降低客服人工处理绕单、改地址的成本。
- 内容平台自动审核:构建仿真 App 内动态内容流,代理根据规则自动滑动、标记违规内容或屏蔽评论。结构化评判可量化审核准确率,并行仿真加速策略模型迭代,提升审核时效与一致性。
局限
- **视觉外观建模局限**:MobileGym 以结构化 JSON 捕获 UI 状态,但**不渲染完整的像素级视觉元素**,仅提供屏幕截图作为参考。对于依赖像素理解(如自然图像中的图标识别、模糊动效)的视觉模型,这种抽象可能导致感知偏差,使得在仿真中收敛的策略在真实设备上因视觉分布漂移而降效。虽然有 Sim-to-Real 实验,但 95.1% 的增益保留率是在精心对齐的 59 个任务子集上取得,更广泛的视觉泛化能力尚未验证。
- **后端与动态内容建模不足**:模拟应用**缺少真实网络请求、用户数据持久化和依赖系统服务**(如推送通知、权限弹窗)的后端逻辑,任务环境中所有状态变更均由预定义 EFSM 驱动。这使得模拟无法复现真实场景中的异步事件、网络延迟和上下文突变,训练出的代理对现实应用中的非确定性交互可能鲁棒性不足。
- **应用功能覆盖有限**:平台目前仅覆盖 28 个日常应用,任务模板虽然参数化但类别仍集中于**简单点击/滑动/输入**操作。对于跨应用协同、长程工作流、需要理解多媒体内容的任务,当前功能抽象尚不足以支撑全面评估,可能限制通用 GUI 代理研究的广度。