论文

能干但粗心:计算机使用代理是否遵循情境完整性?

能干但粗心:计算机使用代理是否遵循情境完整性?

计算机使用代理(CUAs)现在能够代表用户在电子邮件、日历和待办事项列表等个人应用中执行操作。这种跨应用访问虽然便利,但也带来了一个被严重忽视的隐私风险:当代理在一个情境中工作时,它可能会从另一个不相关的情境中提取不适当的信息。因此,我们引入了 AgentCIBench,这是一个评估框架,将这一风险转化为可执行、确定性评分的场景。 我们针对CUAs中的三种常见故障模式进行测试:视觉共位(代理拉取UI中紧邻任务目标的不允许项目)、任务模糊过度分享(代理在响应模糊提示时倾倒密集的个人状态)以及接收者失调(代理向不适当的收件人发送内容)。我们对15个前沿代理进行了评估,发现其失败率高得惊人:15个中有11个在超过50%的场景中出现泄露,平均泄露率达到67.9%。当代理在环境中端到端地完成任务时,同样的失败依然存在。 我们发布 AgentCIBench,旨在鼓励开发更安全的计算机使用代理,并将情境披露测试作为部署前的安全检查。

论文精读

TL;DR 计算机使用代理在跨应用交互中频繁泄漏隐私信息,平均泄漏率高达67.9%,AgentCIBench 首次系统揭露这一隐患并提出预部署安全检测方案。

问题

问题背景

随着大模型驱动的 计算机使用代理 (Computer-Use Agents, CUAs) 开始跨应用托管用户的邮件、日程、备忘录,隐私安全成为部署前的核心关切。业界急于验证智能体的任务完成能力,却忽视了它在不同上下文间传递信息的风险。

现有方法局限

当前 CUA 评测集中于功能性基准(如任务成功率),缺乏对上下文隐私泄露的标准化度量。少数隐私相关研究仅关注直接 prompt 注入或数据外泄,未系统建模以下三类实际故障:

  • 视觉共置 (Visual Co-Location): 代理提取 UI 中与任务目标相邻但不应暴露的信息;
  • 任务歧义过分享 (Task-Ambiguity Overshare): 面对模糊指令,代理输出密集的私有状态;
  • 接收者错位 (Recipient Misalignment): 向无权阅读的收件人发送内容。

这些场景需要确定性、可执行且可重复的隐私审计,而非依赖人工或模糊的合规判断。

技术挑战与重要性

跨应用隐私违背的判定高度依赖上下文完整性 (Contextual Integrity) 理论,即信息流动的适当性取决于发送者、接收者、信息类型与传输原则。将其转化为自动化测试框架面临两大难点:

  1. 环境构建:需要模拟多应用共享同一视觉画布的真实 GUI 状态,并注入可探测的隐私陷阱;
  2. 评分机制:需结合状态落地检查与端到端轨迹分析,区分“泄漏”与“正确拒绝”,避免代理的过度保守行为掩盖隐患。

业界已出现多款 CUA 产品原型,若上线前未进行此类上下文披露安全检查,可能引发大规模信任危机。

行业类比

类似自动驾驶中,仅测试避障能力而忽略摄像头数据是否被错误共享给第三方应用,将导致责任不清的安全事故——CUA 的上下文隐私评测正是填补这一空白。

核心洞察

  • 当前最前沿的计算机使用代理(CUA)具备强大的任务执行能力,但在跨应用场景中普遍存在严重的隐私泄露问题:15 个受测代理中 11 个的泄露率超 50%,平均达 67.9%。这揭示了一个被忽视的安全维度——上下文完整性,即代理在工作时会不加区分地将不同上下文的信息混合使用,而这些信息在不同上下文中可能是敏感的。这一发现直接挑战了仅以任务成功率评估代理质量的惯例,表明功能强大并不等于行为谨慎,安全测试必须独立于能力基准。
  • AgentCIBench 不仅定义了三种系统性的泄露失败模式(视觉共置、任务歧义过度分享、接收者错位),还证明了通过简单防御手段(系统提示、工具过滤、记忆净化)可在不损害任务效用的前提下将泄露降低 33–36 个百分点。这为 CUA 的安全工程提供了直接的操作路径:将上下文完整性测试作为预部署安全检查项,而非等待事后修复。该工作也表明了在代理开发流程中嵌入隐私评估的必要性,类似软件测试中的回归测试,避免因功能迭代而引入新的泄露风险。

方法

方法概览

AgentCIBench 针对计算机使用智能体(CUA)的上下文泄露风险设计了一套可执行、确定性评分的评估流程。其核心思路是将隐私风险形式化为三类可测量失效模式,在模拟多应用环境中对智能体进行状态和端到端双重评估。

输入与场景构建

  • 场景种子:包含 117 个基础场景,涵盖邮件、日历、待办事项等个人应用的用户状态(如邮件内容、日程条目)和任务提示。
  • 场景生成引擎:通过 LLM 驱动的变异策略自动扩展场景,针对三种失效模式定向构造:
    • Visual Co-location (VCL):任务目标旁出现应被禁止的界面元素,诱使智能体无意中抓取。
    • Task-Ambiguity Overshare (TAO):任务描述过于模糊,智能体为完成任务而过度分享个人状态。
    • Recipient Misalignment (RMA):信息发送给了不适当的收件人。 生成过程使用搜索奖励控制质量,并通过近重复抑制保证多样性。

关键评估模块

  • OpenApps 环境:模拟真实应用的渲染 UI 与动作空间(如点击、输入),支持两种评估轨道:
    • State-Grounded Track:直接向智能体提供当前 UI 状态和任务描述,检测其输出是否导致泄露,省略交互步骤。
    • End-to-End Track:智能体在环境中实际执行动作,完成整个交互流程,记录轨迹并判定泄露。
  • 混合评分:结合规则匹配与 LLM 判断器(judge)对智能体输出进行泄露判定,并特别处理拒绝服务(refusal)情形,避免将拒绝行为误算为泄露。

输出与指标

  • 泄露率:计算原始泄露率和条件泄露率(剔除拒绝服务后的泄露比),同时分解到每种失效模式的独立泄露率。
  • 行为分解:通过轨迹分析(如步骤预算耗尽、参与度条件)解释泄露原因,揭示端到端下泄露仍持续存在。

与同类方法的差异

现有智能体基准多聚焦任务完成能力或通用安全性,AgentCIBench 首次将 Contextual Integrity 框架系统性地应用于 CUA 评估,考察信息在不同上下文间传递的适当性,而非仅是敏感与否,并提供可复现的确定性评分,弥补了隐私评估中缺乏多应用上下文映射的空白。

实验

实验设计

本研究提出 AgentCIBench,一个面向计算机使用代理 (CUA) 的情境化隐私泄露评测套件。该基准包含 117 个种子场景,覆盖三种典型失败模式:

  • 视觉共置 (VCL):代理从 UI 中目标条目的相邻区域不当引入信息
  • 任务模糊过度分享 (TAO):在用户指令不清时倾泄大量个人状态
  • 收件人错位 (RMA):将内容发送给不适当的接收者

评测采用混合评分机制,结合状态基评估与终端交互轨迹分析,在 OpenApps 模拟环境中对 15 个前沿代理进行盲测,包括端到端 UI 执行与状态基评估双轨。

关键发现

多数代理频繁泄露隐私,平均泄露率达 67.9%,11/15 的代理在超过一半的场景中出现泄露。即便在端到端 UI 交互中,泄露行为依然持续,表明风险并非仅存于静态评估。代理的效用排名与安全排名并不一致:高任务完成率的代理仍可能严重泄露,揭示出现有基准对隐私维度的缺失。

防御与对比

三种防御策略(均基于提示工程)可将泄露率降低 33–36 个百分点,且不牺牲任务完成效用,在所有三种失败模式下均有效。实验对比无防御基线,证明情境完整性检查可成为预部署安全测试的关键环节,为安全代理研发提供了量化依据。

行业影响

落地场景

Computer-Use Agent (CUA) 已进入生产环境,涵盖会议安排、邮件管理、CRM 操作等办公自动化场景,以及电商客服、医疗预约、金融对账等垂直领域。AgentCIBench 揭示的三大隐私泄露模式——视觉共现 (visual co-location)任务歧义过度分享 (task-ambiguity overshare)收件人不匹配 (recipient misalignment)——直接威胁这些应用的信息安全。凡是将跨应用数据访问与自动化决策结合的 Agent 产品或平台,均需要部署前上下文披露测试,例如 RPA 流程引擎LLM-based 个人助理企业内部智能助手低代码 Agent 构建器等。

商业价值

  • 风险降本:提前发现 Agent 在真实 UI 中泄露敏感信息的路径,可避免因隐私违规带来的高额罚款、品牌危机与用户信任崩塌。本文实验表明,防御策略能将实际泄露率降低 33–36 个百分点,且不牺牲任务成功率,这直接转化为合规成本节约。
  • 信任增收:通过发布 AgentCIBench 安全评分,企业可向客户证明其 Agent 遵循上下文完整性 (contextual integrity),从而提升产品差异化竞争力,尤其在注重隐私的行业(如医疗、金融)中更快获得市场准入。
  • 体验提升:自动拦截不当信息流,避免用户因意外泄露而终止使用,增强长期粘性。

与现有产品/工作流的接口

AgentCIBench 提供可执行、确定性评分的场景,适合嵌入 CI/CD 管道:

  1. Agent 开发框架:LangChain、AutoGPT、CrewAI 等可直接集成测试套件,作为 safety eval 步骤。
  2. 模型评测平台:Hugging Face leaderboard、OpenAI eval harness 等可增加上下文完整性维度,对外展示泄露指标与防御效果。
  3. 部署决策系统:企业内部的 MLOps 流程将 AgentCIBench 分数设为安全门禁,低于阈值禁止上线。

具体落地 Use Case

  • 金融服务中的客户经理 Agent:某银行部署的 CUA 自动化查询客户资产、交易记录并撰写回复。使用 AgentCIBench 可检测到:当用户模糊要求“汇总我的财务信息”时,Agent 是否将账户余额、投资组合连同个人身份一起发给未授权的第三方应用或邮件收件人(任务歧义 + 收件人不匹配)。集成后,将这类隐私泄露消灭在 staging 环境,避免实际客户数据外泄。
  • 电商客服 Agent:在售后场景中,Agent 需读取用户订单、地址及聊天记录,并可能调用物流 API。通过 Visual Co-location 场景测试,可发现 Agent 是否在截图或摘要中误将同一页面的他人订单信息(如屏幕上的相邻条目)作为回答的一部分暴露给当前用户,从而防止大规模信息交叉泄露。

局限

  • **场景覆盖与环境的有限性**:AgentCIBench 目前包含 117 个种子场景,集中覆盖 email、日历、待办事项三类应用,可能未能穷尽现实中 CUA 跨应用泄露的多样模式(如社交媒体、云端文档等)。OpenApps 模拟环境虽然提供可重复的评分,但其界面复杂度与真实操作系统的差异可能隐藏部分视觉布局引发的泄露,且 end-to-end 轨迹分析中 step-budget exhaustion 导致部分任务未完成,影响对泄露行为的充分观察。
  • **防御策略的侵入性与泛化性**:论文提出的三种提示级防御(上下文窗口注入、系统提示重写等)虽然能将 engaged leakage 降低 33–36 个百分点,但可能无法应对精心设计的对抗性提示或更复杂的信息流场景。防御效果仅在本文基准上验证,未在其他独立基准或真实用户行为数据上测试,其鲁棒性和跨任务泛化能力仍需进一步考察。
  • **泄露评估的二元简化**:当前指标主要基于是否存在不适当的信息流动(binary leak),未量化泄露信息的敏感程度或实际危害等级。例如,视觉共位中误贴的普通日历条目与高度机密的邮件内容泄露在评分上可能权重相同,这可能高估或低估实际隐私风险,不利于指导细粒度的安全策略设计。
论文Anmol Goel2026-06-22原文

相关内容