PhoneWorld: 扩展手机使用代理环境
构建可控、可复现且覆盖真实手机行为的手机使用代理环境,是当前该领域的核心瓶颈。现有移动代理基准在评估方面取得进展,但缺乏规模化构建新环境的途径。 PhoneWorld 提出一种可复用的管道,将真实 GUI 轨迹 与截图转换为可控手机环境、可执行任务、自动验证器及训练 rollout。与逐个手工构建移动基准不同,PhoneWorld 从真实轨迹中自动识别:哪些屏幕是关键的、屏幕间如何连接、哪些交互会改变环境状态、以及哪些用户目标可被自动验证。基于这些信号,它构建出可运行的模拟 Android 应用(包含只读应用内容与可变状态),并从中派生出可执行任务、基于规则的验证器与训练 rollout。 当前实例化中,PhoneWorld 覆盖 16 个领域 的 34 个应用,涵盖搜索、浏览、购物、预订、媒体、社交等常见消费级手机行为。在固定训练预算下,用广泛的 PhoneWorld 监督替换 AndroidWorld 基线中来自辅助 AndroidWorld 语料库的 10K 步训练,同时提升了四个评估基准:HYMobileBench +17.7 分,AndroidControl +6.0 分,AndroidWorld +14.7 分,PhoneWorld +52.5 分。 进一步实验表明:增加 PhoneWorld 监督数据量能显著提升 PhoneWorld 自身性能;而在固定 PhoneWorld 预算下,扩展应用覆盖范围带来的增益更大。总体而言,PhoneWorld 将重点从逐个构建移动基准转向规模化供给手机使用环境本身。
论文精读
TL;DR PhoneWorld 将真实 GUI 轨迹与截图转换为可复现的手机智能体环境、任务和自动验证器,突破手工构建移动基准的瓶颈,实现环境的规模化生产。
问题
问题背景
手机使用智能体(phone-use agents)的研究焦点正从单一 app 的 GUI 操作转向跨 app、多步骤的真实用户行为模拟。当前领域亟需大规模、高多样性的可控环境来训练和评估这类智能体,但环境构建的可扩展性成为明显瓶颈。
现有方法的局限
已有移动端基准(如 AndroidWorld、Mobile-Env、WebArena 的移动扩展)多为手工构建,每个任务和 app 需要工程师编写脚本、设计状态机和验证逻辑,导致环境数量有限且难以覆盖长尾用户场景。真实应用的 GUI 轨迹和截图虽然富含交互模式,但无法直接用作可执行环境:它们只记录了一次具体路径,既不可复现、也不支持自动验证,更无法提供带奖励信号的训练 rollout。手工构造方法无法将这类轨迹数据批量转化为可控环境,因此环境的供给规模严重落后于数据量。
技术挑战与重要性
将真实轨迹转化为可运行环境的难点在于:
- 屏幕连通性恢复:从单次记录推断出完整的屏幕跳转逻辑,区分状态变化与仅 UI 刷新。
- 可写状态抽象:真实 app 的状态受网络、账户、推荐系统影响,必须分离只读内容(如文章列表)与可写状态(如购物车),才能实现状态重置与复现。
- 自动任务生成与验证:需要从轨迹中提取可被规则化验证的用户目标,而非依赖人类标注或 LLM 在线判断。
这类环境直接关系到大模型智能体的大规模强化学习训练和可靠评测。若无法降低环境构建成本,训练将一直受限于稀疏奖励和狭窄场景,而评测也会因环境不可复现导致结果不稳定。业界对通用 GUI 智能体的投入持续增长,对可扩展环境的需求十分迫切。
行业类比
PhoneWorld 的思路类似从日志中自动生成强化学习环境,如同机器人领域利用回放数据构建仿真器,为 GUI 智能体提供具有无限生产能力的“沙盒工厂”。
核心洞察
- 从手工制作到规模化生成:PhoneWorld 将基准构建范式从「逐个手工设计移动环境」转变为「从真实 GUI 轨迹中自动挖掘应用逻辑并生成可控环境」。这一转变直接解决了现有手机操控基准(如 AndroidWorld、AndroidControl)必须逐应用、逐任务人工编写、难以扩展的根本瓶颈。流水线通过解析真实截图和交互序列,恢复屏幕之间的连接关系、状态变更规则和可自动验证的用户目标,从而以近乎零手工成本批量产出可运行、可复现的 mock Android 应用及配套任务。这使环境供给能力不再受人工标注速度限制,为通用手机操控 agent 的规模化训练与评估提供了基础设施。
- 评估与训练一体化:PhoneWorld 不仅输出可评估的任务,还从同一环境生成训练 rollout 和规则化验证器,首次将评估环境和训练数据统一在同一生成流程中。现有手机操控基准通常仅提供评估任务,训练数据要么依赖人工采集的静态数据,要么通过昂贵的手工环境交互产生,导致训练与评估分布脱节。PhoneWorld 通过利用真实轨迹恢复的状态机和交互语义,自动生成大量多样化的带监督信号 rollout,实验证明即便只替换少量训练步数也能显著提升多个基准上的泛化性能,这揭示了「环境即数据」的潜力——环境本身可以被设计为可扩展的训练资源,而非仅仅是测试场地。
方法
PhoneWorld 是一个可重用的 pipeline,让真实 GUI 轨迹与截图自动转化为可控的手机使用环境。方法核心遵循“输入 → 关键模块 → 输出”的线索。
输入与设计范围
输入是用户在真实 Android 应用上的操作轨迹(点击、滑动、输入序列)及对应屏幕截图,覆盖搜索、购物、社交等 16 个常见领域。
关键模块
App Structure Recovery
从轨迹中自动恢复关键信息:哪些屏幕是任务必需的、屏幕之间的跳转关系、哪些交互会改变环境状态、以及哪些用户目标可以自动化验证。这一步决定了后续可构建哪些任务和状态空间。Build Specification Generation
基于恢复出的结构信号,自动生成构建规范(build specification),定义 mock app 需要模拟的屏幕、组件和状态变量。Autonomous App Construction
依据构建规范,自动生成可运行的mock Android 应用。这些应用后端由只读的真实内容(如商品列表、文章)和可读写状态组成,确保环境可控且可重置。Human-in-the-Loop Quality Assurance
引入人工质检环节,快速修正自动构建中可能出现的错误或遗漏,保证环境准确反映真实应用行为。Task Synthesis & Verification
从同一环境中衍生可执行任务和基于规则的验证器(rule-based verifiers),并自动生成用于智能体训练的轨迹 rollout。验证器利用状态变量直接判定任务完成度,无需额外 human evaluation。
输出
最终产出 PhoneWorld Suite,覆盖 34 个应用、16 个领域,提供标准化环境、任务和验证器。
与同类工作的差异:不同于 AndroidWorld 等手动构建单一基准的方式,PhoneWorld 通过真实轨迹恢复环境结构,将“造环境”从手工设计转变为可规模化的自动流程,直接提升移动智能体环境的供给能力。
实验
实验设计
PhoneWorld 的实验围绕一个中心问题:能否用从真实用户轨迹自动构建的环境和监督数据,提升手机操作智能体的通用性能? 作者设计了一套从 GUI 轨迹到可执行任务、自动验证器和训练回放的流水线,覆盖 34 个应用、16 个领域。为评估效果,他们采用了部分替换范式:在一个基于 AndroidWorld 的基线训练流程中,用 PhoneWorld 生成的 10K 步监督数据替换同等数量的 AndroidWorld 辅助回放,保持总体训练预算不变。训练后,在四个互补的评测基准上进行评估:HYMobileBench(多步信息查询)、AndroidControl(单步操作)、AndroidWorld(任务完成度)以及 PhoneWorld 本身的 held-out 任务。
接着,实验探讨了两个扩展性问题:增加 PhoneWorld 监督数据的数量,以及在固定 PhoneWorld 预算下扩大应用覆盖范围。
关键发现
- 部分替换带来全面收益:仅替换 10K 步即让四个基准同时提升,其中 PhoneWorld 自身体提升高达 52.5 点,说明该流水线生成的监督信号与真实环境高度一致,且泛化性强。
- 监督量单调提升性能:进一步增加 PhoneWorld 回放步数,PhoneWorld 指标持续上升,证明构造的监督数据丰富且可扩展。
- 应用覆盖面比单纯堆数据更有效:在固定 PhoneWorld 总步数下,覆盖更多应用带来的提升超过只增加某一应用的数据量,强调环境多样性对泛化的关键作用。
对比基线解读
基线使用的是 AndroidWorld 官方提供的辅助回放数据,但这类数据是手工构建的,难以覆盖真实用户行为的多样性与意外事件。PhoneWorld 通过从真实轨迹恢复应用结构、状态变化与任务目标,生成了更接近真实分布的交互数据。这种监督不再依赖人工规则,而是由用户行为驱动,因此模型学到的策略能在多个未见过的基准上稳健迁移。值得注意的是,即便 PhoneWorld 监督数据量仅占训练总步数的一小部分,也带来了显著增益,表明数据质量与真实分布匹配度远比单纯扩大传统回放更关键。最终,PhoneWorld 将焦点从“逐一定制评测集”转移到“规模化供应手机操作环境”,为训练通用手机智能体提供了新范式。
行业影响
落地场景
PhoneWorld 直接服务于手机使用智能体的开发、评估与训练。它可以为以下产品/业务构建高覆盖率、可复现的交互环境:
- 移动端自动化测试:生成多样化任务和可验证目标,替代手写用例
- 智能助手训练:为 AI 购物、行程预订、社媒交互等场景提供丰富 rollouts
- 用户行为仿真:在电商/内容/金融App中模拟真实用户轨迹,用于A/B测试或反欺诈建模
- 智能体研究平台:快速构建新App的可交互环境,加速横向对比实验
商业价值
- 降本:将“人工构建一个手机 benchmark”转变为“从真实轨迹自动生成环境”,大幅减少手工标注UI和编写验证逻辑的成本。基于34款App的覆盖,单次流水线即可产出可执行任务和规则验证器
- 增收:更真实、可扩展的训练信号有助于提升智能体的成功率和泛化能力。论文显示,仅替换10K步训练数据,HYMobileBench +17.7点、AndroidControl +6.0点、AndroidWorld +14.7点,有望直接提升商业智能助手或自动化服务的转化率与用户留存
- 体验提升:通过可复现的错误回归测试和强化学习,可稳定地减少智能体在生产环境中的失调行为,降低用户挫败感
与现有产品/工作流的集成
PhoneWorld 产出的是标准 Android 仿真应用和任务定义,可嵌入现有移动开发与测试栈:
- CI/CD 管道:将自动生成的任务与验证器作为回归测试用例,集成到 Jenkins、GitHub Actions 等流程
- 智能体训练框架:生成的环境和 rollout 可直接对接 AndroidWorld 等训练协议的 step-level 监督,无需修改智能体架构
- 数据飞轮:从线上真实轨迹中提取 new 场景,经 pipeline 反构为可控环境,反向补充线下训练集,形成闭环迭代
具体落地案例
- 电商购物助手:利用用户历史浏览-搜索-加购轨迹,通过 PhoneWorld 复现同款 App 的交互图,生成“比价后下单”“凑满减”等任务,训练助手的多步推理与状态追踪能力。验证器自动检查购物车与订单状态,可实现海量任务的自动化训练与评估
- 媒体内容平台:对短视频或音乐App,复用“滑动-点赞-评论”轨迹构建环境,训练智能体理解内容偏好并执行复杂交互,如“在关注列表中找到最近更新并收藏到歌单”。规则验证器检查UI元素出现情况和数据变更,无需人工看回放
局限
- **平台与覆盖范围受限**:PhoneWorld 当前仅支持 Android 生态,通过 mock Android app 复现环境,无法涵盖 iOS 或其他移动平台的原生交互。其构建依赖大量真实 GUI 轨迹与截图作为输入,数据采集成本依然存在,且当前只涵盖 34 个 app、16 个领域,远未覆盖长尾应用与边缘场景。这意味着 PhoneWorld 生成的环境多样性与真实手机使用分布仍有差距,对于小众 app 或高度定制化的交互模式(如游戏、金融安全验证)缺乏支持。
- **验证器与状态建模的简化**:任务验证采用 rule-based verifiers,依赖预定义的状态变更条件,这要求人工参与质量保证阶段来校准规则,可能在跨 app 泛化时失效。此外,mock app 通过只读内容与可变状态模拟真实 app,但无法完整复现真机中的系统级行为(如通知栏、多窗口切换、后台进程干扰),这些缺失可能削弱 agent 在真实场景中的鲁棒性。实验主要在 PhoneWorld 自身的评测集上显示大幅提升,但跨 benchmark 迁移仍存在性能波动(如 AndroidControl 只提升 6.0 点),表明环境构建的 fidelity 仍有优化空间。
- **可复现性边界**:PhoneWorld 的环境是可控的确定性模拟,但真实手机使用存在网络延迟、动态内容加载、崩溃恢复等非确定性因素,这些在 mock app 中被省略。paper 指出这样做是为了可复现评测,但也意味着基于此训练的 agent 可能缺乏对真实世界不确定性的处理能力。此外,环境构建 pipeline 涉及多个步骤(app 结构恢复、构建规范生成、自主构建、人工质检),端到端的工程复杂度较高,部署成本与维护开销未量化,可能影响其在小型团队中的采纳。