PalmClaw: 一种原生设备端移动手机代理框架
大型语言模型(LLM)代理已从生成响应扩展到执行多步骤任务:调用工具、观察结果并迭代决策下一步行动。大多数代理系统运行在桌面或服务器上,支持工具使用和任务自动化。移动设备同样是重要的代理环境,因其广泛可及且包含用户数据、传感器及日常应用。现有移动代理主要通过图形用户界面(GUI)操作(如点击、滑动、键入)控制智能手机,这些操作常形成长而依赖界面的序列,无法直接访问设备能力,且执行边界难以界定。 本文提出 PalmClaw,一个开源代理框架,原生运行于手机设备上,直接在设备上管理会话、记忆、技能、工具和代理循环。PalmClaw 将设备能力暴露为设备工具,具有显式参数、结构化结果和清晰定义的执行边界。该设计使代理能直接使用移动能力,同时保持每个动作显式且可控。 实验表明,与最强基线相比,任务成功率相对提升 11.5%,完成时间减少 94.9%,且设置负担更低;追踪示例展示了执行边界的应用。代码开源于 https://github.com/ModalityDance/PalmClaw。
论文精读
TL;DR PalmClaw 是首个原生运行在手机上的开源 agent 框架,通过将设备能力封装成具有明确边界的工具,相对最强基线任务成功率提升 11.5%,完成时间削减 94.9%。
问题
LLM agent 正从纯文本对话转向自主执行多步任务,目前多数 agent 框架运行于桌面或服务器。移动端同样是关键环境,但现有移动 agent 几乎都依赖 GUI 操作(点击、滑动、键入)来操控应用,存在显著的技术局限。
现有方法的局限
- 无法直接调用设备能力:只能模拟人机交互,无法访问传感器、文件系统、通讯录等原生功能,导致任务依赖长链 GUI 动作,脆弱且低效。
- 执行边界模糊:GUI 动作序列难以界定单步操作的责任范围,出错时不易定位,也无法对敏感操作(如读取日历、发送短信)做细粒度权限控制。
- 任务完成耗时过长:每一步需等待界面渲染,完整任务往往需要数十步交互,实时性差。
为什么这个问题重要且困难
移动设备承载大量个人数据与日常应用,成为 agent 落地的自然载体。直接暴露设备能力为结构化工具,既能提升效率,又能实现 执行边界——即明确每个工具的参数、结果和权限范围,这对安全可控至关重要。然而,设计一套原生运行、管理会话/记忆/工具的移动 agent 框架,需要解决资源受限设备上的运行时调度、跨应用工具抽象、安全沙箱等复杂工程问题。业界如 Apple Intelligence、Samsung Galaxy AI 等均在探索端侧 agent 能力,但多数方案仍依赖云端编排,PalmClaw 这类纯本地框架在延迟、隐私和离线可用性上具有明显优势。
行业类比
这类似从 RPA(模拟 GUI 操作) 进化到 API 集成:直接调用系统接口比模拟点击更可靠、更快速,最终让 agent 从“操作应用”升级为“使用设备”本身。
核心洞察
- **原生工具化接口取代 GUI 操作流** PalmClaw 将手机能力封装为带有显式参数、结构化结果和清晰执行边界的**设备工具**(device tools),使 Agent 可以直接调用系统功能而非依赖长链的点击、滑动等 GUI 操作。与现有移动 Agent 形成根本差异:传统 GUI 范式动作序列长、高度依赖界面状态,且难以界定单步操作的起止边界,导致执行效率低、不可控。PalmClaw 的工具化接口每个调用都是原子化、可审计的操作,实验显示任务成功相对提升 11.5%,完成时间缩减 94.9%,并天然支持权限隔离(如日历权限)与文件作用域限制,实现了更高效、更安全的移动任务自动化。
- **端侧原生自托管架构** PalmClaw 完全在移动设备本地运行,直接管理会话(sessions)、记忆(memory)、技能(skills)和工具(tools),不依赖远程服务器或云端 LLM 代理框架。这与当前多数 Agent 系统运行于桌面 / 服务器并通过 API 遥控手机的模式截然不同。原生架构带来三重好处:1) **低延迟**——本地决策避免网络往返;2) **隐私保护**——用户数据、传感器信息留在设备侧;3) **简化部署**——实验显示其 setup burden 更低,无需复杂的环境配置。这种设计使得移动 Agent 能真正融入日常使用场景,为端侧智能体实际落地提供了轻量、高响应、隐私友好的参考范式。
方法
PalmClaw 方法详解
PalmClaw 是一个原生运行在移动设备上的 LLM agent 框架,它将移动设备能力封装为设备工具,直接在端侧管理会话、记忆、技能与执行循环。
输入与整体流程
用户以自然语言下达复杂任务,agent 负责将其分解为多步骤动作,并通过工具调用与结果观察迭代推进。框架以 session 为单位维护任务上下文,任务开始时会加载持久化的 memory(如用户偏好、历史交互)与可复用的 skills(组合工具的高级原语),最后进入 agent loop 执行。
关键模块
会话与记忆
Sessions隔离不同任务的状态,防止跨任务污染。Memory提供持久化存储,支持跨会话信息保留,使 agent 能利用历史经验。
技能与工具
Tools是框架的核心创新:将系统 API、传感器、应用数据等设备能力包装为具有显式参数、结构化执行结果和明确执行边界的接口。例如,读取联系人、发送短信、获取 GPS 等均以device_tool形式暴露。Skills则是由多个工具调用组成的可复用子流程,可视为更高级别的抽象,加速复杂任务编排。
Agent Execution
- Context Assembly:在执行每步动作前,将当前任务、记忆、可用工具描述等组织为 LLM 上下文。
- Agent Loop:基于 ReAct 等范式,LLM 输出思考过程与工具调用,框架执行工具并获取结构化结果,循环直至任务完成。
- Tool Execution:工具调用附带了执行边界(如权限许可、数据访问范围),框架会校验边界条件是否满足,拒绝越界操作,从而避免隐私泄露或误操作。
输出
Agent 输出最终任务完成状态与结果,同时记录完整追踪(trace),便于调试与审计。
与同类方法的差异
不同于现有移动 agent 依赖长序列 GUI 操作(如点击、滑动)且难以定义执行边界,PalmClaw 将设备能力直接转为结构化工具,运行于端侧,消除了界面依赖,显著缩短执行时间并增强可控性。
实验
实验设计
实验在两个移动任务数据集上评估:
- MobileTask :涵盖日历、文件管理等日常任务;
- AssistantBench :复杂多步移动助手任务。
基线包括基于 GUI 操作的主流移动代理(如 app-based 与 VLM 驱动的点击/滑动方案),以及可能的服务端代理。PalmClaw 作为原生 on-device 框架,通过设备工具直接调用传感器、文件系统等系统能力。
关键发现
- 任务成功率:PalmClaw 相对最强基线提升 11.5%,主要得益于结构化设备工具减少了 GUI 操作的不确定性。
- 执行速度:完成时间锐减 94.9%,因为传统 GUI 代理需反复截图、识别 UI 元素并模拟点按,而设备工具一次调用即可完成原子操作。
- 执行边界:工具调用具有显式参数、结构化结果和权限检查,使代理行为可控、可审计,规避了 GUI 代理中难以定义的执行边界问题。
- 部署复杂度:PalmClaw 直接在手机上运行,设置负担更低,无需外部服务器或模拟器。
与基线对比解读
GUI 代理像“看得见的手”,每次操作需解析屏幕,依赖视觉理解,容易产生级联错误;PalmClaw 则是“直接操盘手”,通过设备 API 操作,动作粒度更粗但执行更可靠。95% 级别的时间降低背后,是交互范式从序列化屏幕交互转向参数化工具调用的根本性改变。执行边界的清晰化使代理在权限敏感场景(如日历写操作)中更安全、行为更可预测,这对于实际部署至用户设备至关重要。
行业影响
落地场景
PalmClaw 将 LLM Agent 直接部署在手机端,通过设备工具(Device Tools)暴露原生功能(如传感器、文件系统、应用数据),适用于需要自主执行多步任务的移动应用场景:
- 智能助手类产品:日程管理、消息处理、设备设置等个人助理功能,可直接调用系统能力,避免长 GUI 链路的低效与脆弱。
- 自动化测试与RPA:移动端 UI 测试、业务流程自动化,可通过结构化 Action 精确控制步骤边界,降低成本。
- 垂直领域应用:健康数据采集、物流扫码、金融交易确认等,利用设备工具保证隐私与可控性,无需依赖云端代理。
商业价值
- 降本:任务完成时间减少 94.9%(相对最强基线),大幅降低 Agent 执行耗时与计算资源消耗;本地运行减少云 API 调用,节省网络与推理成本。
- 提效增收:任务成功率提升 11.5%,提升用户留存与付费意愿;清晰的执行边界(Execution Boundaries)降低权限误操作导致的客诉或数据泄露风险。
- 体验提升:端侧原生运行带来更低延迟、离线可用性,突破网络依赖限制,使 Agent 更轻量、易用。
与现有产品/工作流的接口
PalmClaw 以框架 + 工具抽象的方式集成,可嵌入现有移动 App 架构:
- 工具注册:将 App 内业务能力(如查询订单、修改设置)封装为 Device Tool,通过结构化参数与返回值暴露给 Agent,与现有 Service/API 层对接。
- 会话与记忆:内置 Session 与 Memory 管理,可直接对接用户画像或知识库,复用现有数据管道。
- 技能组合:通过 Skill 封装可复用动作序列,类似插件系统,便于模块化协作。
具体落地 Use Case
- 电商购物助手:用户语音输入“买上周看过的洗面奶”,Agent 直接调用订单历史、搜索、加购、支付等工具,无需逐屏模拟点击,几分钟完成闭环,且权限边界可控(仅限购物相关操作)。
- 金融合规审计:企业内部报销 App 内置 PalmClaw Agent,员工提交票据后,Agent 自动关联消费地点、行程单、客户信息等工具查询,完成合规校验并填报销单,缩小人为失误窗口,执行边界确保不触及非授权数据。
局限
- 设备平台依赖性强:PalmClaw 框架原生运行于手机,其工具调用直接依赖 Android 系统级 API 和权限模型,这限制了跨平台(如 iOS、HarmonyOS)的移植性。虽然移动设备生态以 Android 为主,但实际部署中仍需面对不同厂商 ROM 的定制化差异,可能导致工具执行不稳定。论文实验仅在特定机型上进行,未讨论对其他设备的兼容性,在大规模部署时可能遇到碎片化问题。
- 工具集持续维护挑战:PalmClaw 的设备工具(device tools)需开发者预先定义参数、结果结构和执行边界,面对海量第三方应用及动态变化的 UI 时,手动扩展维护这些工具的工作量巨大。目前框架突出的是系统级能力(如日历、文件管理),而对非标准、长尾应用的自动适配能力不足,这限制了它在开放域用户任务中的实用性。
- 安全边界与任务完成度的权衡:框架为每个工具定义了严格的执行边界(execution boundaries),例如文件访问仅限特定工作区,权限请求需用户显式授予。这种设计提升了安全性,但也可能因为边界过严导致原本可完成的任务失败(如跨应用数据流转需要突破沙箱)。论文在评估中展示了边界起作用的案例,但未量化因边界限制而无法完成的任务比例,可能高估了在复杂实际场景中的成功率。