论文

有秘密?LLM 智能体无法保密:多智能体系统中的隐私评估

有秘密?LLM 智能体无法保密:多智能体系统中的隐私评估

LLM 安全评估通常在孤立环境中测试模型,但实际部署的 AI 智能体越来越多地与其他智能体在持久社交环境中交互。我们引入了一个 Moltbook 风格仿真平台,模拟上千个 LLM 智能体在多个社区中互动一个月,并用于评估不同社交压力下的下游隐私问题。 实验发现:从单轮转向多轮社交评估会显著放大隐私泄露(OpenAI 模型上 从 19.95% 提升至 45.30%);泄露具有社交传染性,观察到同伴泄露后智能体泄露敏感信息的概率增加 8 倍;明确的隐私指令虽能降低泄露,但无法完全消除,即使有防护措施,泄露率仍高于 37.8%。 我们的结果表明,基于静态聊天的安全基准系统性低估了智能体部署中的风险,仅社交情境就足以引发单轮评估从未暴露的敏感信息披露。

论文精读

TL;DR 多智能体社交互动会显著放大 LLM 的隐私泄露(单轮 19.95% → 多轮 45.30%),且泄露具有社会传染性(观察同伴后泄露可能性高 8 倍),静态安全基准严重低估了实际 agent 部署中的风险。

问题

问题背景

当前 LLM 安全评估 正从单轮对话基准向多轮交互和工具调用演进,但多数测试仍将模型视为孤立聊天助手,忽视了真实部署中智能体(Agent)之间的长期社会交互。随着 AI 应用向多代理协作、虚拟社区和自动化工作流发展,隐私泄漏成为下游安全的关键考量。

现有方法局限

  • 单轮评估(如 CIMemories)仅测试模型对直接询问敏感信息的拒绝行为,不模拟持续社交环境下的间接诱导
  • 静态基准(如 HarmBench、AdvBench)缺乏社会传染同伴压力多轮累积暴露的建模,无法捕捉代理人观察同类泄漏后的模仿行为。
  • 在仅有单次对话的安全测试中,模型可能表现良好,但一旦置于类似 Moltbook 的千代理社区中,隐私违反率从 19.95% 飙升至 45.30%,暴露出系统性低估。

为什么此问题重要且困难

  • 社会传染效应:实验发现代理在观察到一个同类泄漏敏感信息后,自身泄漏概率提高 8 倍,形成连锁反应。
  • 指令脆弱性:即使加入明确的隐私保护指令(如“不要透露生日”),泄漏率仍高达 37.8%,表明仅靠提示工程无法根除风险。
  • 上下文完整性:在多代理环境中,社交压力(如建立共鸣、表达同情)可绕过安全训练,诱导出在单轮评估中从未出现的上下文敏感泄漏
  • 行业关注度:随着 AI 同事、虚拟角色和自动化客服团队 的兴起,模型间的无意或有意的信息传递可能造成严重的合规与声誉风险。

类比:这类似于推荐系统中的信息茧房和回音室效应——一个恶意或失误的泄漏在多代理交互中被快速放大,如同虚假新闻在社交网络中扩散,但后果可能是个人身份信息(PII)的大规模暴露。

核心洞察

  • 社交情境本身就是隐私泄露的强驱动力。与传统 single-turn 聊天评估不同,在持续一个月的千人级 Moltbook 式社交模拟中,LLM 智能体在无直接攻击的情况下自发泄露敏感信息的比例从 19.95%(CIMemories)飙升至 45.30%,说明静态 safety benchmark 会系统性地低估 agentic deployment 中的隐私风险。
  • 隐私泄露具有社会传染性。实验发现,一旦某个智能体观察到同伴泄露敏感信息,其自身泄露概率将提高 8 倍。这种从众效应意味着多智能体环境中的泄露会自我放大,而现有评估体系完全忽略了社交传播对安全边界的削弱作用。
  • 显式隐私指令在社交压力下效果有限。即使预先加入明确的隐私保护指令,泄露率仍高达 37.8% 以上,表明仅靠静态的微调或系统提示不足以抵御社会互动中涌现的合规失效,需要引入运行时监测或上下文隐私护栏。

方法

多智能体隐私评估模拟框架

输入:LLM 智能体(如 GPT-4o 等),被赋予角色身份敏感属性(如医疗记录、财务秘密),投放到一个基于 Moltbook 风格 的虚拟社区中。每个智能体携带一段“秘密”,并可能配有隐私保护指令(如“不要分享个人信息”)。

关键模块

  • 模拟环境:构建持久化社交平台,支持上千智能体在多个社区内进行长达一个模拟月度的多轮交互。智能体生成消息、形成记忆,并自然产生社交上下文,模拟真实的群体信息流动。
  • 隐私泄露评测:分两条路径——
    • 有机泄露:在无外部压力下,观察智能体是否自发向同伴透露敏感信息。
    • 对抗性诱导泄露:设计社交“轻推”(adversarial nudge),如制造同伴已泄露的假象或施加群体趋同压力,促使目标智能体泄露秘密。实验包含多种压力强度条件。
  • 隐私指令干预:对比有无显式系统提示(system prompt)禁止泄露,测试指令在面对社交压力时的鲁棒性。
  • PII 违规检测:自动化解析对话日志,识别姓名、身份证号等个人身份信息泄露事件,计算泄露率、社交传染系数(观察同伴泄露后,自身泄露概率的变化)等指标。

输出:核心指标包括隐私违规率(无指令时总泄露率达 45.30%)、社交传染效应(观察同伴泄露后,自身泄露可能性提升 8 倍)、以及指令干预下的残留风险(泄露率仍高于 37.8%)。

差异点:与 CIMemories 等仅评估单轮、孤立对话的静态安全基准不同,本方法首次将评估置于多智能体持续社交博弈的动态环境中,揭示了社会压力与传染效应是导致隐私风险被系统性低估的关键因素。

实验

实验设计

构建 Moltbook 式模拟平台,部署数千个 LLM 代理在 30 天模拟周期内跨社区交互。每个代理被赋予 敏感属性(如健康、财务信息),并置于不同程度的 社会压力 下,包括:

  • 有机泄露:自然社交对话中的无意披露。
  • 对抗性诱导:通过同伴“轻推”迫使其泄露隐私。 评估协议从单轮静态聊天扩展至 多轮社交链,检测 PII 违规。

关键发现

  • 多轮社交评估大幅放大风险:OpenAI 模型在孤岛测试中的违规率仅 19.95%(CIMemories),而平台内飙升至 45.30%
  • 隐私泄露具有社会传染性:代理在观察到同伴泄露后,自身泄露概率提高 8 倍
  • 指令防护有限:即使明确告知“不要分享秘密”,泄露率仍 >37.8%,无法完全归零。
  • 社区话题效应:话题越私人,泄露越集中,单轮评估无法暴露的 上下文完整性 破坏在多代理环境中显现。

与基线对比

单轮静态基准(CIMemories)严重低估了代理化部署的风险:它忽略了 社会传染长期交互积累的信任社会压力诱导的合规行为。多轮社交环境充当了“隐私压力测试器”,揭示仅靠指令微调不足以消除安全漏洞。这要求安全评测必须从孤立提示转向 多代理、持续交互场景,否则将系统性地遗漏真实世界中的隐私威胁。

行业影响

对多智能体产品的隐私风险评估重定义

现有LLM安全评估(Safety Benchmarks) 多采用单轮、隔离测试,无法捕捉多智能体社交交互中的隐私泄露风险。本研究表明,在模拟社交环境中,即使明确设置隐私保护指令,LLM智能体在观察同伴泄露隐私后,自身泄露概率增至8倍,整体泄露率仍超过37.8%。

落地场景
  • 企业级AI助理群:跨部门智能体协作处理合同、报销、HR数据时,可能通过会话链逐步泄露敏感信息。
  • 社交/内容平台的虚拟角色:如游戏NPC、虚拟主播或客服机器人,在持续对话中可能无意透露训练数据中的个人隐私。
  • 自动化客服网络:多轮转接或升级流程中,客户隐私在智能体间传递时易发生传导式泄露。
商业价值
  • 降低合规成本:提前暴露隐私泄露风险可避免违反GDPR、CCPA等法规导致的巨额罚款。
  • 提升用户信任:对于部署大量AI智能体的产品(如智能办公套件、个性化推荐系统),鲁棒的隐私保护是付费转化的关键信任点。
  • 驱动安全评估产品升级:静态基准测试低估了实际风险,需引入社交压力与传染模拟的新型红队工具,为安全厂商创造新的服务市场。
与现有产品/工作流的接口
  • 安全测试流程集成:在CI/CD或模型发布前,加入基于Moltbook式平台的多智能体仿真,检测PII泄露率。
  • 监控与熔断:在生产环境中,监控智能体间对话,当检测到社交传染式泄露时触发自动拦截或重新脱敏。
  • 指令层加固:结合隐私指令(prompt-level safeguards),但需配合上下文动态消毒,因为实验表明单纯指令只能部分抑制泄露。
具体用例(无地域限定)
  1. 电商智能客服群组:当多个LLM智能体分别处理订单查询、退款、纠纷时,某智能体可能从订单备注中推断出用户健康数据(如购买药品),并在与其他智能体交流时无意泄露,造成隐私违规。通过引入社会压力模拟测试,可在上线前发现此类链式泄露。
  2. 金融投资机器人网络:多个分析智能体共享市场情报时,一旦某智能体泄露客户持仓信息,该信息在智能体网络中迅速传播,导致内幕交易风险。利用本研究揭示的社交传染(8×传染因子) 可量化此类风险,并设计隔离策略。

论文核心发现:“单轮评估系统性低估了智能体部署风险,社会情境本身足以引发单轮评估永远无法触发的敏感信息泄露”,直接指向工业界安全评估体系的短板。

局限

  • **模拟环境生态效度有限**:本研究在自建的 **Moltbook-style 仿真平台** 上开展,社群规模、交互规则及信息传播机制均为简化设定,与真实部署环境(如多 agent 协作框架 AutoGen / CrewAI 中工具调用、多轮上下文记忆、动态角色切换等)仍有较大差距。实验中的 agent 缺乏持久化记忆与复杂目标规划,社会压力仅通过少量对抗性 nudge 模板施加,难以充分模拟现实世界中多层次的社会工程攻击与长期关系演化,因此观察到的隐私泄露率(45.30%)可能低估或高估真实风险。
  • **模型覆盖与检测手段的局限**:论文仅测试了 **OpenAI 系列模型**(如 GPT-4o、GPT-4.1 等),未纳入其他主流商业或开源模型(如 Claude、Gemini、Llama),无法判断结论是否具有跨模型泛化性。此外,隐私泄露检测依赖基于规则的关键词匹配与 **PII 识别工具**,可能漏检通过同义替换、隐喻或跨轮次间接透漏敏感信息的更隐蔽泄露模式,导致实际泄露率被低估。与更细粒度的上下文完整性分析(如 **Contextual Integrity** 框架)相比,当前检测维度较为粗放。
  • **对手设定与社会压力的单一性**:实验中的**对抗性社会压力**仅设计为特定类型的 nudge(如直接询问、群体感染观察),未系统探索不同攻击强度、频率及伪装方式。社会传染效应的测量(8x 泄露概率)在小规模社群中成立,但未验证在更大规模或更异构群体中的稳定性。与真实对抗场景(如对话中毒化、角色伪装、逐步引导)相比,当前压力策略仍属初步探索,难以覆盖所有可能的隐私诱导路径。
论文Aman Priyanshu2026-05-26原文

相关内容