iOSWorld:个人智能手机代理的基准测试
现有的移动代理基准测试缺乏个性化能力,无法模拟持续用户身份。为此,我们提出 iOSWorld,首个交互式原生 iOS 模拟器基准,内置 26 个全新 iOS 应用,其中数据互联(如交易、消息、旅行记录、社交关系、金融活动)。 基准包含 133 个任务,分三类:单应用任务(27 个)、多应用任务(60 个,跨 2-8 个应用)以及记忆与个性化任务(46 个,需从个人数据推断模式)。评估前沿及开源计算机使用模型,采用纯视觉( vision-only )与增强视觉+XML( privileged vision+XML )两种设置。最佳配置总体准确率 52%,但多应用任务仅 37%。增强视觉+XML 使前沿模型提升最多 26 个百分点,而小模型未受益于额外可访问性树输入。 iOSWorld 以开源形式发布,包含所有应用、种子数据、任务、评分标准及评估代码。
论文精读
TL;DR iOSWorld 是首个基于原生 iOS 模拟器、内置持久用户身份的个性化手机智能体基准,用 26 款 App 的 133 个任务量化模型在跨应用推理与记忆个性化中的严重不足。
问题
问题背景
当前移动端 AI Agent 的研究重心正从「能否完成简单操作」转向「能否像真人助手那样理解用户、适应习惯」。业界期望手机 Agent 不仅能执行单步指令,更能利用设备上沉淀的个人数据,做出符合用户偏好的连贯决策。
现有方法的局限
已有的移动端 GUI Agent 基准(如 AndroidEnv、AppAgent、MobileAgent)大多运行在无状态的沙箱环境中,任务被割裂为独立的指令片段。主要局限有三:
- 缺乏持久用户身份:每次任务启动时设备状态重置,Agent 无法积累对用户历史行为的记忆,导致无法测试基于长期交互的推理能力。
- 跨应用信息割裂:即使个别基准支持多应用操作,应用间的数据并不联通(例如消息中的地址无法直接映射到地图),现实世界中常见的“从聊天记录提取地址并预订网约车”这类流程难以复现。
- 观测形式单一:多数基准仅提供截图输入,忽略系统级界面结构(如无障碍树),未能评估不同感知通道对模型性能的真实影响。
为什么这个问题难且重要
个性化评测的难点在于:需要在可重复的实验条件下,构建自然流动的、跨会话的用户数据生态。这要求环境必须同时兼顾系统交互的真实性(原生 iOS 模拟器)与用户画像的完整性——包括交易流水、社交关系、位置历史等。此外,评测本身也需区分“执行正确”与“符合用户习惯”,例如完成支付时,Agent 应偏好用户常用的银行卡而非任选一张。随着 Apple Intelligence 等系统级智能体的落地,工业界迫切需要能衡量“个人智能”的可靠基准,而非仅考察程序化的点击正确率。
行业类比
就像对话式推荐系统需要基于用户历史对话与消费记录进行动态偏好建模,手机 Agent 也必须从跨应用散落的数据中推理出用户意图,才能在真实世界中成为可信赖的智能伙伴。
核心洞察
- iOSWorld 首次将持久用户身份和跨应用个性化数据引入手机代理基准,评估范式从孤立任务执行转向真实情境推理。与 AndroidEnv、WebArena 等仅关注单应用或沙盒指令的基准不同,iOSWorld 模拟了一个用户在 26 个自建 iOS 应用中留下的交易、消息、旅行记录等,要求代理基于个人历史做出决策。多应用任务跨 2–8 个应用,难度远超单应用任务(最好模型仅 37%),暴露了现有模型在面对分散异构数据时的推理瓶颈,为构建真正个人化的手机助手指明了关键缺口。
- 实验发现可访问性树(XML)作为特权输入仅能提升大型前沿模型(如 GPT-4o)的表现,提升幅度高达 26 个百分点,但对小型开源模型(如 Qwen3.5 35B-A3B)无益甚至有害。这揭示了当前计算机使用模型的能力断层:只有具备强大推理能力的模型才能有效融合额外的结构化上下文,否则信息过载反而干扰决策。该发现对工程化移动代理的信息选择策略和模型选型具有直接指导意义,提示我们不能盲目依赖统一的环境表示。
方法
iOSWorld 的构建方法围绕 持久用户身份 与 交互式原生 iOS 模拟器 展开,形成一套闭环的「任务指令 → 环境观测 → 代理动作 → 评估反馈」流程。
输入与观测空间
代理接收自然语言任务指令(如“查看最近的交易记录并发送给朋友”),并通过两种模式感知环境:
- Vision‑only:仅当前屏幕的像素截图,模拟人类视觉。
- Privileged Vision+XML:除截图外,额外暴露 iOS accessibility tree(结构化 UI 元素层级,含坐标、类型、文本等),提供更精准的控件定位信息。
关键模块:模拟器环境、App 生态与任务库
- 原生 iOS 模拟器:基于 Apple 官方工具链,支持完整的触摸交互(点击、滑动、输入、返回手势)。代理输出的动作经 CUA‑to‑iOS 翻译层转换为模拟器可执行的原生事件,并实时返回新状态。
- 26 个互联 App 与用户身份:所有 App 共享一个固定 persona 的数据,例如
Messages中的聊天内容会与Calendar中的行程、Wallet中的交易记录保持一致。数据覆盖社交、金融、旅行、健康等维度,确保任务需要跨 App 推理。 - 三类递进任务:
- 单体 App(27):在单一应用内完成目标,如给某联系人发消息。
- 多 App(60):需跨 2‑8 个 App 联合查询或操作,如根据航班信息预订酒店并更新日历。
- 记忆与个性化(46):依赖历史交互推断用户偏好,如“移除常用列表中最近最少使用的项目”。
动作翻译与执行
CUAs(计算机使用模型)的通用动作空间被映射到 iOS 特定原语:tap(x,y)、swipe(direction)、type(text)、back(侧滑返回)等。为提升鲁棒性,系统记录 action 执行的屏幕变化并返回结果状态,支持分步错误恢复。
输出与评估
每个任务配备多维度 rubric,包含中间步骤得分与最终目标达成判据。评估采用 LLM‑as‑judge 与确定性校验结合:LLM 比对系统日志、UI 截图变化是否满足 rubric 条目,同时使用规则检查关键状态(如某条消息是否确实被发送)。评估支持 trajectory‑level 和 per‑step 两种粒度,能捕捉代理的局部进步。
与本领域已有工作的差异:iOSWorld 是首个将持久用户身份与原生 iOS 模拟器深度耦合的基准,移动代理不再面对孤立的沙盒 App,而是必须像真实用户一样利用跨 App 数据关联与长期记忆——这是“个性化智能”与常规 GUI 代理的本质分界。
实验
实验设计
在 iOSWorld 模拟器上构建了 26 个原生 iOS 应用,植入一个持久用户身份(含交易、消息、社交等关联数据)。任务分为三类:单应用(27 个)、多应用(60 个)和 记忆与个性化(46 个),共 133 个。评估前沿和开源计算机使用模型(computer‑use models),设置两种观测模式:vision‑only(仅截图)和 privileged vision+XML(截图加辅助功能树)。智能体通过点击、滑动、键盘等交互执行任务,按逐步检查点评估。
关键发现
最佳配置(前沿模型 + vision+XML)整体成功率为 52%,但多应用任务骤降至 37%,暴露出跨应用推理与状态管理的瓶颈。添加 XML 辅助信息对前沿模型提升可达 26 个百分点,而小型模型反受其害,并未获益——可能因为过长的上下文分散了注意力。失败分析显示,仅视觉模式常出现坐标定位错误,且智能体普遍未充分利用边缘滑动手势。
与基线对比解读
vision+XML 相对于 vision‑only 提供了结构化场景图,让模型更容易定位 UI 元素和规划动作序列,尤其适用于需要切换多个应用的复杂任务。然而,这种提升并非无代价:模型必须处理数千 token 的 XML 树,对上下文窗口和推理效率提出要求。前沿模型(如 GPT‑4o、Claude)能有效利用额外信号,而轻量开源模型(如 Qwen3.5‑35B)在长上下文中规划能力退化,导致整体成功率反而下降。这提示在设计移动智能体时,辅助功能 API 的提供方式需与模型容量匹配,简单的 XML 倾泻并非普适良方。
行业影响
落地场景
iOSWorld 构建了首个具有持久用户身份的原生 iOS 模拟器评测基准,覆盖 26 款内置互联数据的应用,可支撑个人智能体(personally intelligent agents) 的研发与验证。具体可落地的产品方向包括:跨应用的个人助理(如自动处理消息、行程、支付等)、个性化电商购物助手(依据历史订单、偏好和消息比价下单)、智能财务管家(跨银行、记账、日历应用生成财务报告),以及依赖用户记忆与偏好推理的健康或教育类 agent。
商业价值
该基准直接对标用户留存与自动化降本。通过评测模型在多应用、长链路任务上的完成率,团队可筛选出真正能理解用户身份和上下文的模型,而非仅执行单步指令。这有助于减少人工客服或中台处理成本,同时通过深度个性化提升转化与体验。例如,旅游平台智能体可自动完成机票、酒店、租车的跨应用协调,避免用户流失。当前最佳配置仅 52% 整体完成率、37% 多应用任务率,表明仍有巨大提升空间,早期投入的团队可能获得产品差异化优势。
与现有产品 / 工作流的接口
iOSWorld 以开源形式提供,包含全部应用、种子数据、任务、评分规则和评估代码,可直接集成到 MLOps 流程中。评测环境支持纯视觉和视觉+XML(accessibility-tree) 两种模式,可与现有的计算机使用模型(如 GPT-4V、Claude、开源 Qwen 等)直接对接。平台采用 iOS 模拟器,动作空间标准化为计算机使用 agent 格式,便于嵌入 CI/CD 做 回归评测和模型选型。企业可将该基准作为个性化 agent 的准入测试,结合自身业务数据构建变体,加速从通用指令跟随到个人智能交互的迁移。
具体场景举例:
- 全球电商平台:训练/评测移动端购物助手,能否跨消息、支付和购物应用完成“对比历史订单中已购商品,使用当前银行卡满减优惠下单”之类的任务。
- 金融服务:财富管理 app 中的 agent,需跨银行、投资和日历应用,分析个人流水与行程,自动生成月度资产配置建议。这些任务对多应用联动和记忆推理要求极高,正是 iOSWorld 的核心评估维度。
局限
- **单一用户画像限制泛化性**:iOSWorld 仅围绕一个固定的合成用户身份(包含财务、社交、旅行等数据)构建任务,虽然确保了任务间的数据一致性,但无法验证 agent 在不同年龄、文化、行为习惯的用户画像上的表现。移动 agent 的**个性化智能**高度依赖用户数据的多样性,单一 persona 可能掩盖模型对长尾用户或非常规使用模式的响应能力,同时也难以评估模型是否过度拟合该特定数据分布。
- **模拟器环境与真实设备存在差距**:所有交互均在 **iOS 模拟器** 中完成,缺少真实设备上的传感器噪声、网络波动、延迟、来电中断等动态干扰。此外,模拟器的渲染与真实硬件的像素级差异可能导致视觉模型在真实部署时出现坐标偏移或 UI 元素识别失败。论文已指出在**坐标定位**(coordinate-grounding)和**边缘滑动手势**(edge-swipe)上纯视觉模型存在较高失败率,这些问题在真实物理环境中可能更严重。
- **特权 XML 访问在实际部署中难以实现**:实验表明追加 **accessibility-tree (XML)** 可显著提升大模型性能(最多 26 个百分点),但该通路在真实 iOS 应用生态中需依赖系统级权限或越狱,普通第三方 app 很难获取。这限制了该基准从模拟向实际部署的迁移,同时也使单纯比较 vision-only 设置的结果更贴近现实,但论文中 vision-only 的整体最优仅 39%。