MobilePA-Bench:面向复杂现实任务的移动规划体基准测试
随着端侧大语言模型智能体向个人助手演进,移动操作系统已成为这一范式的关键试验场。然而现有基准存在两类盲区:GUI-centric基准仅测试浅层屏幕操作,忽视后台工具调用与长程规划;静态函数调用基准依赖离线API匹配,脱离真实运行时约束。为弥合这一差距,我们提出 MobilePA-Bench——一个交互式、有状态、工具中心的基准,评估移动规划体的工具调用与规划能力。 该基准运行于可执行沙箱中,维护实时应用数据库并返回结构化反馈,覆盖 13个功能域与 212个现实移动工具。除基础工具使用外,它沿三个高级维度评估中心规划体:(1) 子智能体协作:分解复杂任务并委派专业工作;(2) 记忆使用:回忆存储的记忆、用户画像与历史偏好以解析隐式请求;(3) 技能使用:调用预置复合技能而非从头逐步规划。 大量实验表明,当前前沿LLM在移动环境下仍不可靠:在严格工具排序、权限限制和意外运行时错误下,性能显著下降。通过将交互式函数调用沙箱与基于证据的验证相结合,MobilePA-Bench既可作为实用诊断基准,也可作为智能体强化学习的交互基础——加速可靠移动智能体的开发。
论文精读
TL;DR MobilePA-Bench 在可执行沙箱中评测移动规划智能体的工具调用、子代理协作、记忆与技能复用,揭示前沿 LLM 在真实运行时约束下的可靠性短板,并可作为强化学习交互基础。
问题
随着端侧 LLM 代理演变为个人 copilot,移动操作系统成为验证其能力的关键实验场,对严谨评估的需求日益迫切。
当前基准分化为两个阵营且各有盲点:GUI-centric 基准仅测试表面屏幕操作(如点击、滑动),忽略后台工具调用与长时规划,无法覆盖真实任务中对系统 API 或应用数据库的深度交互;function-calling 基准则依赖离线 API 匹配,脱离真实运行时约束,无法模拟状态变化、权限限制、意外错误等动态条件。两类基准均无法回答“代理能否在持续演化的移动环境中可靠完成复杂任务”这一核心问题。
移动场景天然状态连续且工具繁多,代理需处理严格工具顺序、权限拒绝、运行时异常等挑战;同时,高级能力如子代理协作、记忆调用、技能复用 是高效规划的必备条件。实验显示前沿 LLM 在上述约束下性能显著下降,凸显评估缺口。业界对个人助手类产品投入巨大,移动代理能力直接决定产品可用性,因此可信评估框架成为工程基础设施的关键环节。
如同自动驾驶测试需要高保真仿真环境而非静态规则匹配,移动代理也需要可执行、有状态的沙箱来验证规划与工具使用能力。
核心洞察
- MobilePA-Bench 的核心贡献是将移动智能体评估从离线 API 匹配转向有状态、可执行沙箱中的运行时验证。现有静态函数调用基准只检查工具选择与参数是否正确,完全脱离工具调用顺序、权限拒绝、意外错误等真实约束;GUI 基准则只关注屏幕点击,遗漏后台工具链与长期规划。MobilePA-Bench 维护活的应用数据库并返回结构化反馈,使评估能够暴露 LLM 在动态环境下的实际规划失败模式,而不仅仅是测试静态选择能力。
- MobilePA-Bench 显式区分了基础工具调用与三个高级规划维度:子代理协作、记忆使用、技能使用。多数现有 agent 基准将规划简化为单步工具选择或短轨迹,无法度量真实移动任务所需的分解委派、长期偏好检索、封装复合技能调用等能力。实验显示前沿 LLM 在基础工具使用上尚可,但在这些维度上性能大幅下降,说明必须单独度量才能定位能力短板,并为 agentic reinforcement learning 提供有针对性的训练信号。
方法
输入
MobilePA-Bench 的输入是一条 复杂现实任务指令(如“安排下周行程并预订餐厅”)以及一个 有状态移动沙盒环境,包含 13 个功能域、212 个真实移动工具,以及实时维护的应用数据库(如日历、联系人、支付记录)。
关键模块
- 交互式执行沙盒:模拟移动操作系统运行时,工具调用会改变沙盒内部状态并返回结构化反馈;支持工具调用、GUI 事件等统一动作空间,且引入权限限制和运行时错误。
- 中心规划代理:负责解析任务、拆解子目标、在工具序列中选择动作,并可能触发三个高级能力:
- 子代理协作:将专业子任务委派给子代理(如“仅处理邮件”的子代理),并整合结果;
- 记忆使用:从用户画像、历史偏好或存储记忆中检索隐式需求;
- 技能使用:调用预先打包的复合技能(如“一键规划旅行”),而非逐步调用基础工具。
- 证据对齐验证:对每个任务定义三类查询桶——
Tool Call(检查是否调用了预期工具及参数顺序)、State Change(检查沙盒最终状态是否符合目标)、Agent Behavior(检查代理中间行为,如是否合理委派或使用了记忆),综合判定任务成功。
输出
输出每个能力维度(基础工具使用、子代理协作、记忆使用、技能使用)上的得分,以及聚合成功率或加权指标。评测过程同时可作为 agentic reinforcement learning 的交互环境,提供可执行的奖励信号。
与同类方法的差异点:MobilePA-Bench 同时摆脱了 GUI 基准只测表层屏幕操作和静态函数调用基准脱离运行时约束的局限,将可执行沙盒与证据级验证结合,首次系统评估移动规划代理在子代理协作、记忆和技能复用上的长期规划能力。
实验
实验设计
MobilePA-Bench 在可执行沙箱上评估前沿 LLM,覆盖 13 个功能域、212 个移动工具,任务分为基础工具使用、子代理协作、记忆使用和技能使用四个维度。验证采用证据对齐机制,通过工具调用、状态变化和代理行为三类查询桶进行自动评分,避免离线匹配偏差。
关键发现
- 当前前沿 LLM 在移动场景下仍不可靠:在严格工具排序、权限限制和意外运行时错误条件下,性能出现大幅下降。
- 记忆使用维度上,模型召回存储记忆、用户画像与历史偏好以解决隐式请求的能力存在明显不足。
- 技能使用维度显示,模型倾向于逐步规划而非调用预打包复合技能,导致效率与容错性降低。
与基线对比解读
与 GUI-centric 基准(仅测屏幕操作)和静态函数调用基准(离线 API 匹配)相比,MobilePA-Bench 首次提供了有状态、交互式且工具中心的评估环境,使运行时约束直接参与评测。这一设计揭示了离线表现良好的模型在真实移动执行中可能出现的规划失败,为 agentic 强化学习提供了可交互的奖励信号基础。
行业影响
落地场景
MobilePA-Bench 面向移动端规划智能体,可嵌入移动助手、超级 App 内的个人 copilot、以及跨应用自动化产品。具体场景:
- 电商 App 的对话式购物助手:完成比价、下单、改地址、查物流等多步工具调用,需处理库存变化、支付失败等运行时状态。
- 企业移动办公套件:自动执行跨邮箱、日历、CRM 的日程安排与信息同步,依赖权限约束与错误恢复。
- 健康管理应用:根据用户画像和过往偏好,调用提醒、预约、用药记录等复合技能,而不是逐步手写计划。
商业价值
- 降本:用可重复执行的沙箱替代真机与人工回归,减少移动智能体上线前的测试成本。
- 提效与增收:通过 evidence-based verification 定位工具顺序、权限边界、运行时错误等薄弱点,缩短迭代周期;提升端侧助手成功率和用户留存,进而拉动付费订阅或交易转化。
- 体验提升:明确考核 sub-agent collaboration、memory usage、skill usage,推动智能体从“能调 API”向“可靠执行长程任务”演进,减少用户手动兜底。
与现有工作流的集成
可作为 离线评测门禁 嵌入 agent 研发流水线:
- CI/CD 阶段运行
MobilePA-Bench,对每次模型更新或工具 schema 变更做回归。 - 与 function-calling 静态评测(如 BFCL、API-Bank)互补,覆盖动态状态与运行时约束。
- 将评测信号转化为 reward,支撑论文提到的 agentic RL 训练,形成“评测—训练—再评测”闭环。
- 输出分维度报告,指导 prompt 设计、工具粒度调整和微调数据构造。
局限
- **模拟环境与真实移动操作系统存在差距**:MobilePA-Bench 的可执行沙箱只维护应用数据库并返回结构化反馈,缺少真实 GUI 渲染、系统弹窗、后台服务争抢、网络延迟与电量/内存限制等运行时约束。虽然论文在任务设计中加入了权限限制和运行时错误,但无法完全还原真实设备上多应用并发、跨进程通信、恶意弹窗等复杂情况,可能导致 agent 在模拟环境中的得分高于真实部署表现。
- **评估维度仍有一定盲区**:尽管覆盖了子智能体协作、记忆使用和技能调用三个高级维度,但未明确评估多模态视觉理解(图标识别、布局推理)、长期任务中的错误恢复策略、以及用户交互中的自然语言澄清能力。这些能力在实际移动规划中同样关键,但当前 benchmark 以工具调用为中心,可能低估或高估某些模型的实际可用性。
- **任务规模与领域覆盖限制了泛化结论**:13 个功能领域和 212 个工具虽然比多数静态基准丰富,但相对于真实移动应用生态仍偏小,且任务类型偏向结构化工具调用,缺少开放式、需要创造性规划的任务。此外,证据对齐验证依赖预定义查询桶,可能难以评估自由形式输出或没有明确状态变化的规划步骤,影响评估的完备性。