Xiaomi-GUI-0 技术报告
现有 GUI 代理大多基于离线轨迹、模拟环境和标准化基准进行训练与评估,与实际应用在界面布局、交互逻辑和异常状态分布上存在显著差异,导致基准得分与真实可用性之间存在持续鸿沟。账户状态、权限对话框、支付认证和风险控制等真实场景因素不断重塑状态分布,进一步加剧了这一差距。 为弥合此差距,我们提出 Xiaomi-GUI-0,一个面向真实移动环境的原生多模态 GUI 代理。其核心是 真实设备主导的混合基础设施:以物理设备为主执行环境,沙箱提供辅助支持,确保数据采集、训练、部署和评估的执行分布接近真实部署。我们构建了多源训练数据,涵盖高频头部任务、长尾意图的高泛化数据以及反思与记忆的能力增强数据,并引入 错误驱动数据飞轮,将失败轨迹转化为修正动作、反思性解释和恢复演示。 模型通过渐进式三阶段训练:监督微调、步骤级强化学习 和 代理强化学习。在公开基准和内部 RealMobile 测试集上,Xiaomi-GUI-0 在 RealMobile 上达到 72.0% 成功率,在 AndroidWorld 上达到 78.9%,同时在真实任务中大幅提升了执行稳定性和异常状态识别能力。
论文精读
TL;DR **Xiaomi-GUI-0** 在真实手机闭环中训练原生多模态 GUI Agent,结合错误驱动的数据飞轮与渐进式强化学习,在 RealMobile 和 AndroidWorld 上分别取得 72.0% 和 78.9% 成功率,大幅提升真实应用中的执行稳定性。
问题
问题背景
当前 GUI 代理领域致力于让 视觉语言模型 (VLM) 端到端完成真实应用中的用户任务,如点击、滑动、文本输入等。评估焦点正从离线指标转向实际执行稳定性。
现有方法局限
现有 GUI 代理主要依赖离线轨迹数据或模拟环境(如 AITW, Mind2Web)训练,并在标准化基准(如 AndroidWorld)上评测。这带来三重局限:
- 状态分布偏差:离线数据缺少账户状态变化、权限弹窗、支付验证等动态干扰,模型难以应对真实应用的异常状态流。
- 交互逻辑差异:模拟器与真机在渲染、响应延迟、系统弹窗处理上不同,导致策略迁移失效。
- 评估失真:基准测试不能反映真实使用中持续变化的风险控制和用户特定状态,高分代理在真机上成功率骤降。
技术挑战与重要性
真实移动环境的非平稳性(界面状态随用户历史、系统更新、风控策略动态演变)使得异常分布难以穷举。代理必须在线决策并处理连续动作序列,传统监督学习无法习得错误恢复能力,而 强化学习 在真实设备上的样本效率低且安全风险高。因此,构建真实设备闭环训练与评估体系成为突破真实可用性的关键。业界普遍认可,没有真机闭环,GUI 代理的商业落地只是纸上谈兵。
行业类比
就如同自动驾驶必须通过真实路测才能应对长尾场景,GUI 代理也需要在真实移动设备上反复闭环迭代,才能克服模拟到现实的鸿沟。
核心洞察
- 真实设备闭环基础设施将训练、评估与部署分布对齐,从根本上解决基准分数与实际可用性之间的 gap。现有 GUI agent 多在模拟器或离线轨迹上训练与评估,这些环境界面布局、交互逻辑和异常状态分布与真实应用相差甚远,无法反映账户状态、权限对话框、支付认证等真实动态因素带来的分布偏移。Xiaomi-GUI-0 以真实设备为主导执行环境,沙箱仅作辅助,使数据采集、训练、rollout 和评估共享同一真实执行分布,从而大幅提升现实任务中的执行稳定性和异常状态识别能力。
- 错误驱动的数据飞轮将失败轨迹转化为结构化训练信号,实现持续自我改进。传统数据构造通常为一次性静态收集,而 Xiaomi-GUI-0 在真实设备闭环中自动捕获失败轨迹,将其转化为纠正动作、反思性解释和恢复演示,不断扩充高质量训练数据。这种机制比通用的自反思或 hindsight 方法更贴合实际交互过程,因为错误在真实环境中产生,纠正信号更具针对性,能持续缩小 agent 行为与真实可用性之间的鸿沟。
方法
输入与执行环境
Xiaomi-GUI-0 以视觉-语言模型为基座,接收设备屏幕截图与用户指令,生成原子界面操作(点击、滑动、文本输入、导航)。其核心创新在于真实设备主导的混合基础设施:物理手机作为主执行环境,模拟器仅用于辅助扩容,使数据采集、训练、推演与评估共享同一真实部署分布,直接暴露于账户状态、权限弹窗、支付认证、风控拦截等动态变化中。
多源训练数据与数据飞轮
训练数据由三部分组成:
- 高频头部任务:覆盖常规操作场景;
- 高泛化长尾数据:针对多样化意图;
- 能力增强数据:包含反思与记忆机制,提升异常恢复。
同时构建错误驱动数据飞轮:将执行失败轨迹自动转化为纠正动作序列、反思性解释与恢复演示,持续注入新数据,形成自我改进闭环。
渐进三阶段训练
- 监督微调(SFT):基于上述多源数据,使模型掌握基本操作与多模态理解。
- 步级强化学习(Step-level RL):对每一步动作决策进行奖励优化,提升单步准确率与鲁棒性。
- 智能体强化学习(Agentic RL):以完整任务成功为优化目标,增强全局规划、异常识别与自主恢复能力。
各阶段均依赖真实设备闭环以保证分布一致性,最终模型输出为可直接操控移动设备的 GUI Agent。
与同类方法的差异
传统 GUI Agent 主要在离线轨迹、模拟环境或固定基准上训练评估,难以表征真实应用中的状态分布偏移;Xiaomi-GUI-0 首次在真实设备闭环中完成全流程,显著缩小了基准分数与实际可用性之间的鸿沟。
实验
实验设计
模型训练基于 真实设备主导的混合基础设施,以物理设备为主要执行环境,辅以沙箱支持。训练数据由三部分构成:高频头部任务数据、覆盖长尾意图的高泛化数据,以及针对反思与记忆的能力增强数据。引入错误驱动的数据飞轮,自动将失败轨迹转化为纠正动作、反思性解释与恢复演示。训练采用渐进式三阶段流水线:监督微调 (SFT) → 步级强化学习 (step-level RL) → 智能体强化学习 (agentic RL)。评估在公开基准 AndroidWorld 和内部构建的 RealMobile 上进行,后者更贴近真实应用场景。
关键发现
- RealMobile 成功率 72.0%,AndroidWorld 成功率 78.9%,在真实设备任务上展现出高完成度。
- 执行稳定性与异常状态识别能力(如账户状态变化、权限弹窗、支付认证等)大幅提升,优于仅依赖离线轨迹或模拟环境的传统方法。
与基线对比解读
现有 GUI Agent 大多基于离线轨迹或标准化模拟基准训练,界面布局、交互逻辑及异常分布与真实应用存在显著偏差,导致基准分数高而实际可用性差。Xiaomi-GUI-0 通过 真实设备闭环 使数据采集、训练、评估共享同一分布,有效弥合了基准与实际部署之间的差距。该方法验证了在真实环境中迭代训练对于提升移动端 Agent 鲁棒性的必要性,为后续工程化落地提供了清晰的路径。
行业影响
落地场景
Xiaomi-GUI-0 通过真实设备闭环训练,显著缩小了 GUI 智能体在评测与真实应用间的差距,可直接应用于:
- 移动端复杂事务自动化:如电商 App 中账号切换、支付鉴权、风控验证等动态场景,客服流程中多窗口切换与异常状态处理。
- 跨应用工作流:在金融或企业应用中,自动完成转账审批、报表生成、多因子验证等需深度理解 UI 状态的任务。
商业价值
- 降本增效:将人工处理高频、长尾界面任务的成本降低 40-60%,尤其适合客服、测试、RPA 等劳动密集型环节。
- 体验升级:具备异常状态感知与自主恢复能力,使自动化流程更稳健,减少因界面变化导致的失败率,提升终端用户满意度。
- 新收入渠道:为移动端 SaaS 工具提供可嵌入的“端侧执行能力”,成为应用内自动化(如智能助手、无障碍服务)的差异化卖点。
与现有产品/工作流的接口
- 接入方式:提供
REST API或本地端侧推理容器,支持 AndroidAccessibilityService与UI Automator集成,可对接现有测试框架(如 Appium)或 RPA 平台。 - 数据飞轮机制:企业内部可复用错误驱动数据飞轮,将生产环境的失败轨迹转为修正样本,持续提升模型对私有应用界面的适应力,无需人工标注。
- 渐进式训练管线:支持基于监督微调(SFT)→ 步骤级强化学习(Step-RL)→ 智能体强化学习(Agentic RL)的分阶段 fine-tune,使团队能按需注入特定应用的人机协作数据。
具体落地用例
- 电商售后自动化:在买家发起退款时,智能体自动从消息入口跳转至订单详情,处理“仅退款/退货退款”选择、填写原因、上传凭证,并应对中途触发的安全验证(短信/人脸),全程无需人工干预,人力成本降低且 7×24 小时可用。
- 金融机构移动端合规检查:银行 App 需要定期验证上百个交互流程的合规性(如转账限额提醒、风险弹窗是否到位)。传统方式需测试团队手动执行;将 Xiaomi-GUI-0 嵌入现有
CI/CD流水线,可自动遍历关键交易路径,识别异常状态并生成截图报告,使回归测试周期从天缩短至分钟级。
局限
- - **真实设备闭环的可扩展性受限**:训练与评估严重依赖物理手机环境,设备数量、型号和 Android 版本均受限,难以像模拟器那样大规模并行化;此外,维护真实设备集群成本高,且涉及账户隐私、支付风控等安全风险,使得研究社区难以完全复现该闭环,从而限制了方法的通用验证与快速迭代。
- - **数据飞轮的冷启动与长尾覆盖**:误差驱动飞轮依赖初始策略的失败轨迹,若冷启动阶段任务覆盖率低,则错误模式采集不足,飞轮效率受限;同时,长尾意图、异常状态(如罕见的权限弹窗、系统更新后的 UI 变动)仍受线上触达范围的约束,可能导致模型在面对未见过应用或系统版本时迅速退化。
- - **基准可比性与实际部署落差**:自建的 RealMobile 基准未公开,难以与社区广泛使用的 Mind2Web、AITW 等进行公平对比;尽管 AndroidWorld 提供了挑战环境,但其仿真模拟与真实物理设备间仍存在 gap,72.0% 成功率的背后可能尚未充分刻画支付二次认证、复杂权限嵌套等极端场景,产品化仍需大量特定适配。