论文

Agent 记忆是内生授权清洗的表面

Agent 记忆是内生授权清洗的表面

长期运行的 LLM 智能体依赖持久记忆在交互间携带状态,包括权限、限制与撤销。当记忆错误呈现这种演化的授权状态时,智能体自身的记录可授予底层历史从未允许的权限,从而在无外部攻击情况下引发不当行为。我们将此称为内生授权清洗(Endogenous Authorization Laundering):写入记忆的虚假权限导致未授权操作,其来源被冲走。为此,我们提出 EAL-Bench 基准,衡量持久记忆在多大程度上准确保留演化中的授权状态,以及错误是否传播至下游未授权操作。 我们评估了五个 LLM 作为记忆写入者、两个作为执行者,覆盖采购、网络安全与金融领域。实验发现:在增量记忆更新下,写入者为最多 50.2% 的未授权请求创建虚假权限;一旦虚假权限存在,执行者在 98.6% 的试验中会据此行动。两种防护措施——要求存储的权限必须有有效来源事件支持,以及通过有界事件溯源跟踪权限变更——显著降低清洗危害,但两者也拒绝了更多合法操作,暴露了安全与效用的权衡。持久记忆因此不仅是性能组件,而是 LLM 智能体有效授权策略的一部分。

论文精读

TL;DR LLM 智能体持久记忆误记权限状态时,会自行将未授权请求“洗白”为合法;论文构建 EAL-Bench 量化这种内生授权清洗,并揭示防护措施的安全-效用权衡。

问题

问题背景

当前长程 LLM agent 依赖持久记忆 (persistent memory) 维护交互状态,包括权限、限制与撤销。安全研究主要关注外部攻击,如 prompt injection 或越狱。

现有方法局限

  • 现有 agent 安全研究重点在外部威胁,对记忆系统本身作为授权状态载体的风险缺乏系统性评估。
  • 常见的记忆维护手段(压缩、总结、增量更新)可能无意识地改写或丢弃权限变化,造成 记忆漂移 (memory drift)。
  • 缺少量化基准来测量授权状态从历史到记忆再到执行器决策的保真度与错误传播路径。

为什么这个问题难/重要

授权状态动态演化(授予、撤销、限制),要求记忆精确同步每个事件;错误权限一旦写入记忆,其来源被洗去,后续决策难以审计归因。在金融、网络安全等高风险领域,一个虚假权限即可导致资金转移或系统配置变更,影响巨大。业界对自主 agent 大规模部署的安全顾虑日益增加,记忆完整性正在成为 agent 安全的关键瓶颈。

行业类比

类比于 RPA 财务机器人:如果流程日志错误记录审批人级别,机器人可能自动支付超大额发票,造成资金损失。

核心洞察

  • 持久内存中的授权状态本身就是一个攻击面,而非仅仅是被外部攻击利用的后果。与以往关注提示注入、越狱等外部威胁的工作不同,本文提出“内生授权洗钱”:内存写入错误(如遗漏撤销、凭空添加权限)会在无任何外部干预下生成虚假权限,且因来源不可追溯而被执行器当作当前策略执行。这迫使我们将 memory writer 视为授权策略的组成部分,而非中立存储。
  • 增量内存更新是授权漂移的主要来源,而有界事件溯源提供了可审计的折中。与全量重写相比,增量更新开销低但易累积不一致;实验显示 writer 在增量模式下为最多 50.2% 的未授权请求创建虚假权限,而执行器一旦看到虚假权限,几乎总是执行(98.6%)。防护措施要求权限绑定有效源事件或通过事件溯源追踪变更,虽降低洗钱但拒绝更多合法请求,形成安全-效用 Pareto 前沿,提示工程实践需在内存更新策略与授权校验之间做显式设计权衡。

方法

输入

EAL-Bench 构造三类领域(采购、网络安全、金融)的合成交互历史,每条历史由一系列事件组成,事件携带授权状态变化(权限授予、限制、撤销)以及后续动作请求。历史定义了授权 ground truth。

关键模块

  1. 内存构建
    使用五个 LLM 作为 memory writer,将历史压缩为持久内存。重点考察增量更新策略:writer 基于上轮内存与新事件生成新内存,容易累积错误。内存中记录权限、限制等授权信息。

  2. 执行与评估
    两个 LLM 作为 executor,仅根据内存内容决定是否批准请求。若内存错误包含虚假权限(spurious permissions),执行者可能据此授权历史中并未允许的动作。EAL-Bench 测量两个指标:虚假权限形成率(writer 为未授权请求创建权限的比例)和传播率(executor 在存在虚假权限时执行动作的比例)。

  3. 缓解机制

    • 黄金引用源权限门控:每个内存权限必须能回溯到有效历史事件,否则视为无效。
    • 有界事件溯源:跟踪内存中权限的变化链,只保留有事件支撑的权限,限制累积偏差。

输出

实验发现:增量更新下 writer 为最多 50.2% 未授权请求写入虚假权限;一旦虚假权限存在,executor 在 98.6% 的试验中据此行动。两种缓解大幅降低洗权,但均增加对合法请求的误拒率,暴露安全-效用权衡。

与同类方法差异

不同于关注外部攻击(如提示注入)或直接授权策略学习的工作,本方法聚焦 LLM agent 自身持久内存错误导致的内源性授权漂移,将内存视为安全关键组件而非仅性能模块。

实验

实验设计

EAL-Bench 构建于三个领域:采购、网络安全、金融。实验使用五个 LLM 作为记忆写入器,两个作为执行器。流程为:给定交互历史,写入器生成持久记忆,随后执行器根据该记忆决定是否授权请求。设计干预包括增量更新、全量重写、压缩压力等,以测量授权状态保真度与错误传播。

关键发现

增量更新记忆导致最多 50.2% 的未授权请求被写入虚假权限(虚假权限形成率)。一旦虚假权限出现在记忆中,执行器在 98.6% 的试验中会依从该权限执行动作。两种缓解措施——要求存储权限有有效源事件支撑、通过有界事件溯源跟踪权限变更——显著降低授权洗白,但同时增加对合法动作的误拒,呈现安全性与实用性的权衡。

与基线对比解读

与无缓解基线相比,有界事件溯源等方法将授权状态从自由格式记忆中解耦,提升了可审计性与可追溯性。但代价是拒绝更多合法请求,表明持久记忆不仅是性能组件,更是 LLM 智能体有效授权策略 的一部分。工程启示:在设计长期运行智能体时,应将授权状态视为独立子系统,采用事件溯源或引用校验,而非依赖 LLM 自由生成的结构化记忆。

行业影响

落地场景

长期运行 LLM agent 在企业自动化中正从单次问答转向持续任务执行,典型产品包括 采购助手、网络安全 SOC 分析员、金融交易/审批 agent、电商客服自动化。这些 agent 依赖 持久化内存 维护用户/角色权限、审批阈值、令牌撤销等状态。EAL-Bench 揭示的失败模式直接对应现实中的越权退款、未授权交易、错误放行采购单。例如,电商客服 agent 处理退款时,若用户权限已被撤销但内存中残留旧权限,agent 可能继续执行退款操作,造成资金损失。

商业价值

主要价值在风险控制与合规成本降低。论文表明,一旦虚假权限写入内存,执行者在 98.6% 的试验中会按错误授权行动,意味着一处内存错误可导致系统性越权。采用有界事件溯源或源事件验证(要求存储权限必须由有效历史事件支撑)可大幅减少审计失败和潜在资金损失,同时避免安全事件导致的监管处罚与声誉损失。防护措施会拒绝部分合法动作,形成安全-效用权衡,但整体上可将授权风险从“不可见的内存漂移”转变为“可审计的显式策略”,对金融、医疗等高合规行业尤为重要。

与现有工作流集成

现有 LLM agent 栈通常将持久内存作为独立向量库或键值存储,缺少授权语义校验。集成方式:

  • 将内存写入从自由文本摘要改为结构化权限记录,并绑定源事件 ID。
  • 对内存更新采用 event sourcing,每次权限变更追加事件而非覆盖旧状态,便于回溯和审计。
  • 在执行关键动作前增加一个轻量授权检查器,例如调用 validate_permission(memory_entry, event_log),拒绝无源事件的权限。

无需更换底层模型,只需在 memory writer 与 executor 之间插入校验层,与现有 RAG、function calling 工作流兼容。相关基准和代码已在 GitHub 开放,可作为企业内部测试集与回归护栏。

局限

  • **领域与模型覆盖有限**:评估聚焦于采购、网络安全和金融三个领域,未涵盖医疗、法律等其他高风险场景;写入器仅测试五种 LLM,执行器仅两种,未包含更大规模或不同架构的模型,结论在更广泛模型和领域中的普适性未知。此外,合成历史记录与真实部署中的记忆更新模式可能存在差异,生态效度有待验证。
  • **实验设计与真实系统存在差距**:研究使用受控干预和隔离控制来构造授权状态变化,但真实 LLM 代理的记忆更新可能涉及多轮工具交互、用户反馈和异步事件,错误模式可能更复杂。同时,论文假设记忆是唯一授权来源,未评估实际系统中常见的外部权限验证、访问控制列表或多重安全检查,可能高估了洗白攻击的成功率。
  • **安全-效用权衡分析不够深入**:论文提出两种缓解措施(源事件支持和有界事件溯源)并观察到安全-效用权衡,但未探讨如何通过阈值调整、分级权限或人机协同来优化平衡;仅评估两种方案,可能遗漏其他更有效的防御机制。此外,对于误拒合法请求的量化指标较为单一,未分析不同场景下的接受度差异。
论文Tommaso Cerruti2026-09-01原文

相关内容