Training Open Models for Agentic Phone Use
手机正成为通用代理的重要执行载体,但训练可靠的开放模型用于手机操作仍面临困难:部署环境(运行真实应用的真实设备)缓慢、有状态、易产生副作用,且难以重置或验证;而可扩展的模拟环境仅近似真实行为。 本文提出 PhoneBuddy 训练方案及开放模型系列,结合真实应用环境与模拟应用环境 PhoneWorld。PhoneWorld 从真实 GUI 使用结构中重建可运行的模拟应用。PhoneBuddy 首先利用两个环境收集的轨迹进行共享的监督微调,随后对比纯真实应用强化学习(RL)与混合环境 RL 的效果。 在包含 150 个任务的真实手机人工评估中(涵盖应用、小程序及跨应用工作流),任务成功率从监督微调后的 36.67% 提升至真实应用 RL 的 40.67%,再提升至混合 RL 的 45.33%。在 AndroidWorld 上,相应进展从 60.3% 升至 77.2% 再到 83.2%。 结果表明:模拟应用训练并非真实应用 RL 的替代,而是可扩展、可重置、可自动检查的互补来源。增益在应用和小程序任务上最显著,而长周期的跨应用工作流仍是重要开放挑战。
论文精读
TL;DR PhoneBuddy 通过混合真实与可重置模拟环境 PhoneWorld 的强化学习,显著提升开源手机操控模型的任务成功率,实现真实环境可扩展性与模拟环境保真度的互补。
问题
问题背景
以大型语言模型(LLM)驱动的 GUI 智能体 正快速进入实用阶段,其中手机端智能体因高频场景和高用户触达率,成为关键落地方向。业界正积极探索如何在真实设备上可靠完成跨应用任务。
现有方法局限
当前训练流程多依赖离线监督微调(SFT),从静态演示中模仿动作,缺乏对真实执行反馈的利用。少数工作引入在线强化学习(RL),但普遍受限:
- 真实设备环境 交互慢、状态不可重置、难以自动验证,RL 采样效率极低。
- 模拟环境 可扩展、可重置,但无法复制真实应用的全部行为与副作用(如网络请求、系统弹窗),导致训练-部署间 分布偏移 严重。
两种环境单独使用均无法兼顾 扩展性 与 真实性。
为什么这个问题难/重要
- 技术挑战:真实手机环境是 部分可观测、有状态、不可逆 的,传统 RL 需要大量试错,而重置设备状态成本高昂;模拟环境虽快,但界面渲染、API 响应与真机差异会误导策略学习。
- 业界关注度:手机是用户最常交互的计算平面,通用智能体若能可靠操作真实应用,将重塑人机交互范式,从语音助手到自动驾驶级的自动化均有巨大需求。因此,如何融合两种环境的训练信号是当前瓶颈。
行业类比
类似自动驾驶中,仿真环境(如 CARLA)无法替代真实路测,但两者结合可大幅提升策略的鲁棒性与安全性。
核心洞察
- 混合真实与模拟环境的强化学习揭示了一条实际可行的训练路径,它并非简单叠加训练数据,而是通过两种环境在 reset 成本、状态保真度和自动验证上的互补,解决了纯真机 RL 样本效率低且副作用难控的工程瓶颈。过去工作或依赖纯模拟环境导致 sim-to-real 差距,或仅用真机 RL 但受限于缓慢的重置与状态管理,PhoneBuddy 的混合 RL 首次展示了在保持真机部署环境真实性的同时,利用模拟环境的大规模可重置交互提升最终策略质量,这对需要频繁在线交互的移动端智能体训练具有直接的工程借鉴意义。
- PhoneWorld 的设计思路表明,模拟环境的价值不在于完全复现真实应用,而在于提取并重建 GUI 的交互结构(如 widget 树和动作空间),从而在保留核心操作逻辑的同时剥离视觉噪声和副作用。这一思路从根本上区别于传统的图像级仿真,意味着训练 mobile GUI agents 时,结构化的交互表示比像素级 fidelity 更重要,为构建更轻量、更可扩展的 mock 环境提供了清晰的设计原则。
方法
输入与任务设定
PhoneBuddy 面向智能手机端 GUI 操控任务,输入由自然语言指令、实时屏幕截图与设备状态(如当前前台应用) 组成,输出为一系列可执行的触控动作序列(点击、滑动、文本输入等)。任务环境为真实的 Android 设备或模拟器,直接运行日常应用、小程序及跨应用流程。
关键模块:Real-App 环境与 PhoneWorld 模拟环境
PhoneBuddy 的核心创新在于构建了两种互补的交互环境:
- Real-App Environment:在真实设备上运行真实应用,提供高保真但状态持久、不可轻易重置且难以自动验证的交互数据。
- PhoneWorld(Mock-App Environment):从真实 GUI 界面结构逆向重建出可运行的模拟应用。它保留了真实界面的布局与控件逻辑,但后端无真实副作用,因此支持快速重置、可编程状态设定与自动化的任务完成检查,极大提升了数据收集与 RL 迭代的规模。
训练流程:共享 SFT → 混合 RL
训练分为两个阶段:
- 监督微调(SFT):首先在 Real-App 和 PhoneWorld 两个环境中采集成功执行轨迹,共享地训练一个基础策略模型
PhoneBuddy-4B-SFT,初步掌握各类操控原语。 - 强化学习(RL):基于 SFT 模型,对比两种 RL 策略:
- Real-Only RL:仅在真实应用环境中进行在线探索与奖励优化,得到
PhoneBuddy-4B-Real。 - Mixed RL(Real+Mock):同时在真实和模拟两种环境中执行 RL,利用 PhoneWorld 的可扩展性、可重置性与自动验证提供稠密训练信号,最终产出
PhoneBuddy-4B-Real+Mock。
- Real-Only RL:仅在真实应用环境中进行在线探索与奖励优化,得到
输出与效果
最终模型直接部署到真实手机,执行给定任务。在 150 项人工评测任务(覆盖 app、小程序、跨应用流程)中,SFT 模型任务成功率为 36.67%,Real RL 提升至 40.67%,而 Mixed RL 进一步达到 45.33%。在 AndroidWorld 基准上,同序列从 60.3% → 77.2% → 83.2%。增益主要来自模拟环境提供的规模化交互与无副作用探索。
与同类方法的差异
相比仅依赖真实环境 RL 的方法,PhoneBuddy 通过 PhoneWorld 将可重置、可自动评估的模拟交互作为互补训练源,而非完全替代真实交互,显著提升了长尾任务的数据效率。
实验
实验设计
PhoneBuddy 采用三阶段训练范式:
- 共享监督微调 (SFT):从真实设备与 PhoneWorld 模拟环境收集的轨迹中联合训练基础策略。
- 纯真实环境强化学习 (Real RL):在真实 Android 设备上在线交互,使用任务完成信号作为奖励。
- 混合环境强化学习 (Mixed RL):同时利用真实设备与 PhoneWorld 模拟器,共享 RL 更新。
评估在两组基准上进行:
- 人工评测:150 个覆盖普通 app、微信小程序、跨 app 工作流的现实任务,由人工判定成功。
- AndroidWorld:自动化可重置的 Android 代理基准,提供标准化评分。
关键发现
混合 RL 在两类基准上均获得最优结果:
- 人工评测从 SFT 的 36.67% 提升至 45.33% (+8.66 百分点),纯真实 RL 仅为 40.67%。
- AndroidWorld 上提升幅度更大,从 SFT 的 60.3% 到 83.2% (+22.9 百分点),纯真实 RL 为 77.2%。
增益主要来自 app 与小程序类任务,而长程跨 app 工作流仍是瓶颈,说明模拟环境对单一界面内精细操作的帮助更大,但对多步状态管理的泛化有限。
与基线对比的深度解读
原文明确指出:“mock‑app training is not a replacement for real‑app RL, but a complementary source.”
纯真实 RL 的收益较小,因为真实设备速度慢、有状态残留、难以重置,导致在线探索的效率受限。PhoneWorld 提供了可并行、可自动重置的训练环境,显著增加了交互密度,使 RL 能更高效地尝试多样化策略。但模拟器对真实行为的近似总会引入偏差,因此后期仍需真实交互校准。混合策略恰好在可扩展探索与真实奖励信号间取得平衡。
工程启示:当目标部署环境昂贵且难以规模化时,构建一个高保真 mock 环境注入 RL 训练,是一种投入产出比极佳的范式。尤其对移动端代理这类与 GUI 动态强耦合的任务,模拟环境无需完美复现每个像素,只需捕获操作结构即可辅助策略学习。
行业影响
落地场景
PhoneBuddy 训练方案和开放的 Agentic Phone Use 模型可直接用于手机端的自动化任务执行。典型产品形态包括:
- 智能助手:通过自然语言指令操作任意 App,完成订餐、购票、信息查询等复杂工作流。
- 自动化测试:在真实设备和模拟环境中并行执行测试用例,验证 GUI 交互和业务流程。
- RPA(Robotic Process Automation)移动端扩展:为银行、保险、政务等领域的移动办公流程提供无侵入的自动化代理。
该方案尤其适合需要适应频繁 UI 变更或跨 App 交互的场景,如电商平台下单、内容平台内容发布与互动、医疗 App 预约挂号等。
商业价值
核心价值在于降低训练成本和提升模型可靠性。
- 降本:通过 PhoneWorld 模拟环境生成大规模可重置、自动标注的交互数据,大幅减少对昂贵真实设备集群和人工核查的依赖,数据采集和验证成本可降低一个数量级。
- 增收/体验提升:混合强化学习(Real + Mock RL)将真实设备上的任务成功率从 36.67%(SFT 后)提升至 45.33%(约 24% 的相对提升),在 AndroidWorld 基准上更是达到 83.2%。更高的成功率意味着更可靠的用户体验,可直接转化为用户留存和付费意愿。
- 生态壁垒:开放的模型权重允许企业私有化部署,避免数据泄露,并可在专有 App 上微调,形成定制化壁垒。
跟现有产品/工作流的接口
PhoneBuddy 作为开放模型,易于集成进标准移动自动化栈:
- 设备管理:兼容 Android 真机集群和主流模拟器(如 Android Emulator),通过 ADB 或无障碍服务注入操作。
- 自动化框架:可对接 Appium、UI Automator 等测试工具,或作为 RPA 平台的执行引擎。
- CI/CD 流程:模拟环境的快速重置和自动检验特性,使其天然适合持续集成流水线中的回归测试,可与 Jenkins、GitLab CI 等结合,在代码提交后自动触发 App 功能验证。
- 数据管线:PhoneWorld 从真实 App 的 GUI 结构重建可运行模拟 App 的方法,可融入现有的 UI 设计到测试自动化流水线,加速从设计稿到自动测试的闭环。
具体落地 Use Case
- 电商场景:全球电商平台的移动端自动化。例如,自动执行“将某品牌新品添加到购物车、应用优惠券、选择配送地址” 的操作链。通过 PhoneBuddy 的混合训练,模型能处理真实 App 中的动态加载、弹窗等边缘情况,模拟环境则用于快速验证新版本优惠券逻辑,确保大促期间自动化体验的稳定性。
- 内容平台与社交媒体:在 视频发布平台 上,代理可自动完成从素材选择、剪辑模板套用、标题撰写到定时发布的全流程,同时模拟环境可批量测试不同机型下的发布成功率,大幅降低运营团队的人力投入。
局限
- - **跨应用长程任务仍是瓶颈**:论文在摘要与讨论中明确指出,**长水平跨应用工作流**(long-horizontal cross-app workflows)的提升有限,是当前方法的主要开放挑战。尽管混合强化学习在单应用与小程序任务上提升显著,但跨应用任务涉及多应用状态迁移与长步骤依赖,真实环境重置成本高、验证困难,而**PhoneWorld** 的重建较难覆盖此类复杂场景的动态行为,导致模型对多步推理与状态管理的鲁棒性不足,这限制了其在实际连贯任务中的部署价值。
- - **模拟环境与真实环境的语义鸿沟**:**PhoneWorld** 虽然从真实GUI使用结构中重建可运行mock应用,但其本质是静态结构驱动的近似器,无法模拟真实应用中的网络请求、数据持久化、系统弹窗等动态副作用。在真实设备上,这类动态行为往往导致任务失败,而模拟环境提供的交互反馈过于理想,使强化学习策略可能过拟合于模拟场景,泛化到真实手机时仍有能力衰减。此外,论文仅验证了4B参数的小模型,更大模型的扩展性及在真实部署中的资源消耗尚未探讨。