论文

WeClawArena: 面向人本智能体网络的跨用户智能体协作与安全性的可审计沙盒与基准

WeClawArena: 面向人本智能体网络的跨用户智能体协作与安全性的可审计沙盒与基准

近期持久化个人智能体框架的进展,使得以人为中心的智能体网络成为现实可行的部署目标:每个用户可由一个代表其行事的 AI 智能体服务,该智能体维护状态,并通过社交与任务关系与其他智能体通信。在此类网络中,日常工具使用演变为多方持有的智能体在个人工作空间上的协作,而文件、记录、工具和策略并非对所有所有者直接可见。现有智能体基准虽研究工具使用与协作,但未提供端到端沙盒,用于可验证的跨用户智能体协作,也未包含逼真的用户数字工作空间,或测试有害行为如何在人本智能体网络中传播。 我们提出 WeClawArena,一个针对个人工作空间上多方持有智能体协作的可审计基准与运行时沙盒。WeClawArena 聚焦协作式工具使用任务,其中个人工作空间既作为操作工具,也作为个人约束。基准包含六个跨用户任务域的 124 个基础任务,并扩展为 620 个场景变体,每个基础任务对应一个良性对照与四个攻击向量变体。沙盒记录对等消息、工具调用、资源操作、受治理决策及最终工作空间状态。 WeClawArena 分别报告实用性与攻击成功率,并基于有界运行时证据审计攻击成功,支持对任务分解、隐私泄露、中毒证据与无效权限路径的诊断。

论文精读

TL;DR WeClawArena 是首个可审计的基准与沙箱,用于评估多用户个人代理协作时的任务效用与安全攻击成功率,填补了跨用户代理网络安全性测试的空白。

问题

当前,持久化个人代理框架(如AutoGPT、MetaGPT)正在使以人为中心的代理网络(Human-Centered Agent Networks)成为现实部署目标:每个用户由一个AI代理代理,维护状态并与其他代理通过社交与任务关系通信。然而,现有的代理基准(如WebArena、SWE-bench)仅关注单代理或同质多代理系统的工具使用与协作,缺少端到端沙盒来验证跨用户个人工作区协作的安全性。这些基准未建模多用户所有权下的个人工作区作为操作工具与约束的双重角色,也不考虑文件、工具、策略在不同所有者间的不可见性,且无用于审计的运行时证据记录。更关键的是,它们无法测试有害行为(如隐私泄露、中毒证据、无效权限路径)如何通过代理网络传播,导致安全评估与攻击诊断能力严重不足。

这一问题的挑战性在于:多用户代理协作的攻击面复杂且隐蔽,需要捕获对等消息、工具调用、资源操作和治理决策等微观证据,并区分任务效用与攻击成功率。随着大模型驱动的个性化代理被赋予更多个人数据与操作权限,协作中的隐私与权限边界模糊可能引发信任危机。业界亟需一个可审计的评估框架,系统量化攻击风险并支持故障诊断,从而保障代理网络的安全部署。

类似在多租户SaaS平台(如Notion、Slack)中,不同组织的AI助理协作处理项目时,必须防止越权访问与恶意操作,这恰是WeClawArena试图审计的经典场景。

核心洞察

  • **可审计证据链让安全评估从黑箱走向白箱**:WeClawArena 的沙盒会完整记录 peer messages、tool calls、resource operations 和 governed decisions,使得攻击成功的判定不是基于最终输出,而是基于可追溯的运行时证据。这与现有仅依赖任务完成评分或粗粒度安全检测的基准不同,它允许诊断“为何以及如何”出现隐私泄露、中毒证据或无效授权路径,为防御策略提供细粒度归因。
  • **多所有者个人工作空间打破共享全局视图的协作假设**:现有协作基准常假定所有 agent 能感知全局状态,而 WeClawArena 让每个 agent 只能访问自己 owner 的工作空间,任务执行受制于各自主人的隐私与策略约束。这种真实设定暴露了“跨边界访问和授权”的脆弱性,催生出对委托、策略协商和 harm 传播路径的深入评估,比单一用户场景更能反映未来人机共生网络的安全挑战。

方法

输入

WeClawArena 接受任务域定义、社交拓扑以及代理模型配置作为输入。任务涵盖六大跨用户协作场景(如交易、临床、旅行等),每个场景预定义个人工作空间(包含文件、记录、工具和策略)和代理间的委托关系。

关键模块

  1. 多用户运行时沙箱
    每个用户被分配一个独立的个人工作空间,内置相关工具和资源。代理通过对等消息发起协作,执行工具调用、资源操作和治理决策(如授权验证)。沙箱记录完整的运行时证据,包括消息流、工具调用序列、资源变更及最终工作空间状态,形成供审计的不可篡改踪迹。

  2. 基准构建与攻击变体
    基础任务集包含 124 个 跨用户协作任务,覆盖六个任务域。每个基础任务被扩展为 620 个场景变体:1 个良性控制变体(无攻击)和 4 个攻击向量变体,分别针对隐私泄露、证据投毒、无效授权路径和协作脱轨。攻击通过篡改工作空间策略、注入恶意消息或伪造资源操作实现,不直接修改评分,确保攻击的现实性。

  3. 审计与评估引擎
    评估系统从有界运行时证据中独立审计攻击是否成功。效用(Utility)基于任务完成目标计算,攻击成功率(Attack Success Rate, ASR)通过匹配预定义的攻击成功证据(如指定的隐私数据被泄露)判定。审计依赖记录的对等消息、工具调用和治理决策,确保可追溯性。

输出

输出包含两部分:任务效用(协作任务完成度)和攻击成功率(各攻击向量对应的成功事件)。同时提供细粒度的攻击证据路径,便于诊断任务失败、隐私泄露、证据污染或无效授权等问题。

与同类方法的差异

现有代理基准(如 ToolBench、WebArena、GAIA)仅评估单体或简单多代理的工具使用与协作,缺少对跨用户个人工作空间约束下协作安全性的审计。WeClawArena 首次引入端到端的可审计沙箱,系统性地衡量恶意行为如何在以人为中心的代理网络中传播,填补了效用与安全联合评估的空白。

实验

实验设计

WeClawArena 实验基于 124 个基础任务,覆盖 6 个跨用户协作域(Bargaining, Bidding, Travel, SWE-Workspace, Clinical, Trading)。每个基础任务扩展为 5 个场景变体(1 个良性对照 + 4 种攻击向量:隐私泄露、毒化证据、无效授权、协作脱轨),共 620 个变体。代理由商用 LLM(如 GPT-4o)驱动,在可审计沙箱中运行,自动记录消息、工具调用、资源操作与治理决策。评估采用 任务成功率 (TSR) 与 攻击成功率 (ASR) 双维度,并对攻击成功进行独立证据审计。

关键发现

  • 隐蔽攻击广泛存在:即使任务成功完成,隐私泄露与证据毒化仍可能发生,攻击成功率因任务域而异,临床与交易域风险更高。
  • 实用性与安全性权衡:模型在维持高 TSR 时难以完全抵御攻击,尤其面对 无效授权路径 与 毒化证据 表现出局限性。
  • 审计证据可定位:沙箱记录的 peer messages 与 governed decisions 能精确追溯攻击传播链,为安全诊断提供操作级依据。

与基线对比解读

现有基准如 AgentBench、ToolBench 聚焦单代理工具使用,SWE-bench 限于代码修改,均未涉及跨用户、所有权隔离的个人工作空间协作。WeClawArena 首次引入 owned-agent collaboration 场景与 多跳攻击传播 建模,并提供端到端可审计 sandbox,超越传统仅报告分数的评估范式。其审计机制使得攻击归因与修复建议成为可能,为安全敏感的多代理系统部署提供了可验证的测试平台。

行业影响

落地场景

WeClawArena 主要服务于拥有个人工作空间的 持久化个人代理 网络。典型落地方向包括:

  • 企业协作套件:如 Notion / Slack / Microsoft Teams 中嵌入的 AI 代理,在共享文档、日历、审批流中代表用户执行操作,需确保代理不会越权访问或恶意修改他人资源。
  • 多租户 SaaS 工具:例如 CRM(Salesforce)、项目管理(Asana)、设计协作(Figma)的 AI 插件,代理在跨用户工作空间调用 API 时,需防止隐私泄露或"脏数据"传播。
  • 个人生活代理生态:如 Apple Intelligence、Google Assistant with Bard 等跨用户共享家庭日历、购物清单、智能家居控制,需审计代理间的有害连锁反应。

商业价值

  • 降低安全与合规成本:将 攻击成功率(ASR) 审计前置到开发阶段,减少上线后的事故响应开销,尤其适用于需通过 SOC2 / HIPAA 认证的产品。
  • 提升用户信任与留存:对产品经理而言,公开可审计的沙盒测试能向企业客户证明多代理协作的可靠性,加速采购决策。
  • 支撑负责任 AI 定价:可以为高安全需求客户提供经过 WeClawArena 认证的代理服务,形成差异化付费层级。

与现有产品/工作流的接口

WeClawArena 提供运行时沙盒和可审计证据包,天然适合集成进现有 CI/CD:

  • 作为 评测即服务(EaaS) 插入 PR 流水线:每次模型或代理框架更新时,自动运行所有基准变体,检查 ASR 和效用是否劣化。
  • 与现有代理框架(LangChain、AutoGen、CrewAI)对接:仅需实现 Gateway Actions 接口,即可将自有用户空间和工具挂载到沙盒,复用攻击场景库。
  • 证据包(peer messages, tool calls, resource operations)可导入 现有可观测性平台(如 Datadog、Grafana),与生产监控联动,形成从开发到生产的全链路安全审计。

具体落地用例

  1. 医疗 AI 助手协作:多位医生的 AI 代理共享患者电子病历和处方工具。WeClawArena 可模拟一个代理被注入恶意证据(poisoned evidence),观察是否会误导其他代理开出错误处方,并审计隐私泄露路径(如未经授权将病历转发至外部邮箱)。
  2. 电商供应链多代理系统:采购、库存、定价代理分属不同团队和权限空间。通过沙盒测试代理间"无效权限传递"(invalid authority paths),防止无采购权限的代理通过协作链路间接完成下单操作,避免资金损失和库存混乱。

局限

  • **任务领域和攻击向量的覆盖有限**:当前基准仅涵盖六个预定义领域(如议价、竞标、旅行、软件工程工作空间等),且每个基础任务固定扩展为四个攻击变体(隐私泄露、中毒证据、无效授权等)。实际人类中心智能体网络的协作场景和威胁模型更为多样,例如社会工程、长期欺诈、跨领域复合攻击等尚未纳入。这限制了评估的生态效度,后续工作需扩展领域覆盖与攻击生成机制(如自动红队)。
  • **运行时审计的边界依赖**:沙箱通过记录对等消息、工具调用与资源操作来提供可审计证据,但审计有效性与记录粒度紧密相关。若恶意智能体使用隐蔽信道(如消息时序、工具调用参数的隐写)绕过证据记录,或操作系统层面的侧信道攻击,当前审计机制可能漏检。论文已指出审计边界位于沙箱可见的 API 网关动作,但未讨论针对审计逻辑本身的对抗逃避。
  • **智能体策略与交互的静态预设**:实验中的协作任务多遵循预设的社会拓扑与角色契约,智能体间的交互模式相对固定。现实中的协作可能动态演化,并涉及非合作博弈、策略欺骗等复杂行为。基准若未支持动态拓扑和策略进化,其对抗性评估的难度和真实感将受限。此外,当前仅评估现有大语言模型的基线表现,未探索针对安全协作的专门训练或对齐技术。
论文Prince Zizhuang Wang2026-08-04原文

相关内容