AOHP:一个面向个性化、高效和安全交互的开源操作系统级Agent Harness
AI Agent正在推动一种新的软件范式,能够自主调用工具、提取信息、管理内存并完成跨应用和数据源的任务。然而,现有的终端操作系统大多以应用为中心,缺乏对AI Agent的原生支持。这种不匹配限制了Agent的广泛采用,并导致在传统系统上运行Agent时产生执行开销和安全风险。尽管Agent原生操作系统的概念正在兴起,但研究界缺乏一个开放的实验平台来探索Agent交互所需的架构原语。 本文提出AOHP(Android Open Harness Project),一个基于Android开源项目(AOSP)构建的操作系统级Agent Harness。其核心设计原则是将Agent视为一等操作系统参与者,从而支持自适应用户界面和Agent友好的运行时环境。AOHP保留了成熟的Android软硬件生态系统,同时引入了三种面向Agent的系统机制:个性化服务组合、高效Agent接口和安全信息流。 在涵盖OS Agent关键能力的挑战性任务上的初步实验中,AOHP表现出明显优势: - 任务完成率提升21.12% - 执行成本(Token成本)降低51.55% - 安全策略合规性得到保证
论文精读
TL;DR AOHP 将 AI Agent 作为操作系统原生活动体,在 Android 上实现了任务完成率 +21%、token 成本 -52% 的安全高效个性化交互框架。
问题
AI agents 正推动一种新的软件范式:它们能够自主调用工具、提取信息、管理记忆,并完成跨应用和数据源的复杂任务。然而,大多数面向最终用户的操作系统仍围绕应用程序为中心的工作流设计,对 AI agents 的原生支持十分有限。这种不匹配限制了 agent 的广泛采用,并导致在传统系统上运行 agent 时出现执行开销与安全风险。虽然 agent-native 操作系统的概念正在兴起,但研究社区缺乏一个开放的测试平台,来探索 agent 驱动交互所需的架构原语。
现有操作系统的局限:主流 OS(如 Android、Linux、Windows)被设计为以应用为中心的交互模型,进程和界面围绕独立 App 构建,缺少对 agent 工作流的抽象。具体来说:
- 无法自适应呈现界面:agent 需要动态组合服务与数据,但传统 OS 无法感知 agent 的意图和上下文,导致界面僵化,用户必须手动切换应用、重复登录。
- 运行时开销高:agent 通常依赖 CLI 或 API 交互,这增加了 token 消耗(需多次 LLM 调用)和延迟;且 Sandbox 机制不透明,agent 难以安全访问系统资源。
- 权限与隔离缺失:agent 可能误触系统数据或干扰其他应用,带来安全与隐私风险。
为什么这个问题重要且困难:随着 agents 自主性增强,它们需要操作系统提供个性化、高效且安全的交互环境。设计 agent-native OS 的技术挑战在于:既要保证执行效率(减少 token 成本、加速任务完成),又要实现安全策略合规(隔离信息流、保护用户数据)。随着业界对 agent 经济价值的认可度提升,AI agents 的普及依赖一个能够原生支持它们运行的操作系统。AOHP 作为一个开放的 OS-level harness,其核心价值在于填补这一空白,为研究社区提供可实验的 agent-native 原语。
行业类比:就像自动驾驶汽车需要专用的实时操作系统(例如 ROS/RTOS)而不是在通用 OS 上打补丁,现代 AI agents 同样需要一个为其量身构建的 OS 平台——否则就会像在标准 Linux 上强行运行自动驾驶软件一样,既低效又不可靠。
核心洞察
- 将 AI 代理视为 OS 第一类参与者,突破了现有系统以应用为中心的设计惯性。传统 OS(如 Android/iOS)将代理当作普通应用进程,导致跨应用协调开销大、任务断续且安全策略粗放。AOHP 直接从系统架构注入代理友好原语,使代理能像调用本地服务一样组合个性化工作流,这与增加运行时权限或沙箱的补丁式方案有本质差异。
- 在成熟的移动生态(Android)上构建代理原生环境,而非从零设计新型 OS,降低了实验与采纳门槛。与其他仅提供仿真环境或应用层框架的研究不同,AOHP 利用 Android 庞大的硬件支持和软件生态,使验证代理交互的原型系统立即可用,并允许社区探索系统原语对代理效率与安全的真实影响,加速了代理原生 OS 的实际演进。
方法
输入
AOHP 接收用户的自然语言任务指令、设备当前上下文(如正在运行的应用、传感器数据)以及代理的历史执行记录。系统通过 OS 级钩子捕获这些信息,形成统一的任务描述。
关键模块
AOHP 围绕三个核心机制构建代理原生运行环境:
- 个性化服务组合:代理编排器根据用户历史行为与实时情境,动态组装系统服务和应用功能。它利用
Intent路由和自定义策略,将复杂任务分解为可调用的原子操作(如“发送邮件”+“附加最新照片”),生成个性化执行流程,减少 LLM 的决策开销。 - 高效代理接口:传统代理依赖屏幕解析或模拟点击,导致大量 token 消耗与延迟。AOHP 引入
AgentIntent机制,为代理提供直接调用系统 API 和第三方服务的通道。接口层将工具抽象为结构化 schema,代理直接生成调用参数,执行时绕过图形界面,显著降低 token 成本(实验显示 -51.55%)并提升完成率。 - 安全信息流:基于 TaintDroid 扩展的数据流追踪引擎为每个代理和数据项分配安全标签。代理访问敏感资源时,系统实时检测标签传播并强制执行信息流策略,防止跨安全域的数据泄漏。所有代理操作均经过最小权限校验,确保符合预设的安全规则。
输出
任务完成后,AOHP 将结果反馈给用户(如自然语言摘要、界面更新或文件保存),同时将执行日志存入代理记忆,供后续个性化优化。整个交互过程在 OS 层面完成闭环。
与在现有 OS 上叠加代理框架(如 AutoGen 或纯 API 调用)不同,AOHP 将代理作为 OS 一等公民重构了调度、接口与安全基元,从而获得了原生级别的效率与管控能力。
实验
实验设计概述
实验在一系列挑战性 OS Agent 任务上对比 AOHP 与标准 Android 系统上运行 Agent 的基线。任务覆盖了 Agent 的核心能力:工具调用、信息抽取、跨应用数据源协同 等。AOHP 引入了三种面向 Agent 的系统机制:个性化服务组合 (personalized service composition) 、高效 Agent 接口 (efficient agent interfaces) 、安全信息流 (secure information flow) 。评估维度包括任务完成率 、执行成本 (Token 消耗) 以及安全策略合规性 。
关键发现
- 任务完成率提升 21.12% ,表明 Agent 在原生支持的设计下能更可靠地完成复杂工作流。
- Token 成本降低 51.55% ,得益于高效接口减少了无关上下文传递与冗余交互。
- 安全合规方面,AOHP 的信息流机制从根本上限制了 Agent 对敏感数据的访问模式 ,避免了基线的权限提升风险。
与基线对比的深度解读
基线代表当前主流 OS 上运行 Agent 的实践:Agent 作为普通应用运行,必须依赖通用 API 和 UI 自动化,导致执行冗长、隐私控制薄弱 。AOHP 将 Agent 提升为第一公民 ,通过系统级服务重组,让 Agent 直接获取结构化上下文并安全编排操作。+21.12% 完成率 不仅反映效率,更揭示架构适配对 Agent 可靠性的非线性增益 ;51.55% 的 Token 节省 则能直接转化为 API 费用降低,对规模化部署极具工程价值。安全合规的定性提升则回答了 Agent 进入生产环境的核心疑虑。
行业影响
落地场景
AOHP 作为基于 Android 的代理原生操作系统框架,可嵌入任何需要 AI 代理自主操作移动应用的产品或业务中,主要场景包括:
- 消费级智能助手:手机代理跨 App 完成复杂任务(如“预订下周三的航班并同步到日历”),无需用户手动切换。
- 企业移动管理(MDM)与流程自动化:代理安全地访问企业应用,执行数据提取、报表生成等跨应用流程,提升移动办公效率。
- 车载与物联网设备:车机或家居中枢原生支持代理,以更低延迟和成本响应用户指令。
商业价值
AOHP 直接从三条线创造商业价值:
- 降本:代理执行任务的 token 成本降低 51.55%,大幅减少 LLM API 开销,对大规模部署的 SaaS 或平台型产品至关重要。
- 体验与增收:任务完成率提升 21.12%,带来更可靠的代理体验,可提高用户粘性与付费转化,尤其在订阅制智能助理产品中。
- 安全合规:安全信息流机制使代理行为符合企业安全策略,降低数据泄露风险,打开 B2B 市场。
与现有工作流的集成
AOHP 基于 AOSP,可无缝融入现有 Android 生态:
- 系统层可通过 Project Treble 等机制以模块形式集成至定制 ROM,或由设备厂商预装。
- 对上层代理框架(如 LangChain、AutoGPT),AOHP 提供标准化的
Agent Harness API,将跨应用操作抽象为安全系统调用,替代传统辅助服务或屏幕解析方案,显著提升效率与安全性。
具体落地案例
- 全球化电商平台移动客服代理:消费者端代理自动比价、下单、跟踪物流;商家端代理批量处理订单、回复咨询。AOHP 的安全机制确保支付信息隔离,同时降低高频 API 调用的成本。
- 远程医疗助理 App:代理帮助患者预约挂号、解读检查报告、提醒用药。OS 级安全信息流防止健康数据被无关应用窃取,满足 HIPAA/GDPR 等合规要求。
局限
- **平台耦合度过高**:AOHP 深度绑定 **Android Open Source Project (AOSP)**,所有代理友好机制(如自适应 UI、安全信息流)都依赖 Android 现有服务与权限模型。这导致成果无法直接迁移到桌面或服务器操作系统(如 Linux / Windows),限制了 agent-native OS 概念在更广泛计算场景的验证与推广。对于非移动端 AI 代理场景,需要重新设计等效原语。
- **实验覆盖度有限**:论文仅基于少量挑战性任务进行初步评估,任务集可能偏向 OS 代理的某些子能力(如工具调用、信息检索),并未在大规模、长时间运行的复杂工作流中测试。此外,缺乏与其他 agent-native OS 方案(如 **AIOS**、**MemGPT** 集成 OS 层)的直接对比,仅给出了与常规系统的相对提升,难以判断设计选择的最优性。
- **安全策略实现的黑盒风险**:AOHP 的 *secure information flow* 机制建立在 Android 权限与隔离机制之上,但未详细分析代理绕过权限的概率或攻击面。在实际部署中,代理可能通过逻辑推断、数据缓存等侧信道泄露信息,而作者未提供形式化安全验证。对安全合规要求严格的环境(如企业数据守护),这样的 OS 级代理仍存在未知风险。