Bounded Agents: 多智能体 AI 系统的委托安全
基于 LLM 的智能体可代表用户访问云服务、调用工具或调用其他智能体。在会话开始时,智能体的权限被设定,但此后保持静态,且每个请求都被独立评估,不考虑先前操作。在权限范围内,智能体可能违背委托任务、将单独允许的操作组合成被禁止的结果,或将权限委托给子智能体而不加限制。提示注入仅在智能体有权执行此类操作时才构成风险;因此,这本质上是授权架构问题,而非仅模型问题。 Agentic Principal Chain (APC) 追踪从一个主体到下一个主体的委托权限。APC 基于累积的会话状态,通过六项授权检查评估每个请求,并向前传递及限制委托范围与预算。借助组合闭包 (Composition Closure),APC 可对照先前操作检查请求,防止被禁止的组合,并在模型外部强制执行决策。 我们证明了 APC 实现的爆炸半径单调性 (Blast Radius Monotonicity) 与组合可靠性 (Composition Soundness);后者在完整限制集与串行准入条件下,仅针对被禁止的组合有效。我们评估了 3,154 个实例,涵盖 InjecAgent、AgentDojo 和 ASB。在受损模型评估中,我们在首次合法工具调用后插入真实攻击调用,以独立于模型行为测试 APC。结果显示,AgentDojo 的泄露率从 75–100% 降至 0%,覆盖全部四个域;APC 阻止了 InjecAgent 全部 544 例数据窃取。意图绑定 (Intent Binding) 将破坏率从 38.6% 降至 4.0%,操纵率从 90.5% 降至 12.1%。授权延迟在空闲主机上第 99 百分位为 0.24 ms;在 949 个 AgentDojo 任务-注入对中,两个设置下的效用分别降低 8.6 和 13.9 个百分点。实现、评估工具与数据均已公开。
论文精读
TL;DR APC 通过会话级委托链和组合闭包在模型外约束智能体权限,将 AgentDojo 数据窃取从 75-100% 降到 0%,把提示注入风险从模型问题转为授权架构问题。
问题
问题背景
LLM-based 智能体正被广泛用于代表用户访问云服务、调用工具、委派子代理。业界关注点正从单纯模型能力转向授权架构——即如何安全地约束智能体的行为边界。
现有方法局限
传统授权模型在会话开始时设定静态权限,之后每个请求独立评估,不参考先前动作。这带来三类系统性缺陷:
- 违背委托意图:智能体拥有某种权限,但在权限范围内执行与用户任务相悖的操作。
- 组合绕过:单独合法动作被组合成一个整体上被禁止的结果,静态评估无法识别跨请求的组合风险。
- 不受限委派:智能体可以将权限转交给子代理,却未对其范围、预算或限制做任何约束。
Prompt injection 攻击之所以危险,根本不在模型是否被误导,而在于授权设计本身给了模型执行危险动作的能力。
为什么这个问题难/重要
状态化工作流中,动作之间存在依赖与累积效应,需要追踪委托链、维护会话状态、并在模型外部强制执行策略。传统 RBAC、OAuth 等模型缺少对“先前动作如何影响当前请求”的语义支持。工业界非人类身份(NHI)数量激增,缺乏形式化保证的授权机制已成为真实攻击面。
行业类比
类似自动驾驶系统:车辆分别拥有“刹车”和“转向”的独立权限,但若不限制两者的组合时序,就可能产生碰撞路径。多智能体系统同理,必须对动作组合与委派链路做显式约束。
核心洞察
- APC 将授权执行与模型推理解耦,在工具调用层强制会话感知的组合约束。与依赖模型判断的 guardrails 或静态 RBAC/ABAC 不同,APC 通过 `composition closure` 检查当前请求与历史动作的组合是否落入禁止集,且决策在模型外部执行。即使模型被 prompt injection 完全控制,也无法执行越权组合,从而把安全问题从模型鲁棒性重新定位为授权架构问题。
- APC 的委托链与预算机制解决了多代理系统中的权限传递失控。OAuth 委托令牌或 OBO 流程只验证单次委托,不追踪后续会话中的权限使用;APC 则将委托上下文绑定到会话,每个子代理继承受限范围与预算,并沿途持续验证。论文证明的 Blast Radius Monotonicity 和 Composition Soundness(在完整限制集下)为权限收敛提供了形式化保证,防止 confused deputy 式的权限膨胀。
- compromised-model evaluation 直接注入 ground-truth 攻击调用,独立评估授权机制而非模型行为。传统安全评估常与模型能力混杂,无法归因;APC 的评估方法绕过模型,直接测试授权层的阻断率,在 InjecAgent 上实现 544/544 全阻断,且授权延迟仅 0.24 ms @ p99。这为安全组件提供了可复现、可度量的基准,证明架构级防护在有效性与开销之间达到实用平衡。
方法
方法详解:Agentic Principal Chain (APC)
APC 是一种会话级授权架构,用于约束 LLM Agent 在委托链中的权限范围。输入包括:主体链(Agentic Principal Chain)、会话意图(Session Intent)、委托时声明的 预算与范围、以及每次工具调用的请求上下文。
核心模块由三部分构成:
- 委托链追踪:从初始用户主体到各级子 Agent,每条链边记录父主体授予的权限子集与预算上限,形成可演进的授权上下文。
- 六项授权检查:在每个请求进入工具网关前,APC 结合累积会话状态(先前动作序列)执行检查,包括:
- 组合闭包(Composition Closure):将当前请求与先前已批准动作合并,判断是否构成被禁止的操作组合;若属于限制集(restriction set)中的复合危险模式,则拒绝。
- 意图绑定(Intent Binding):校验请求是否偏离会话初始声明的任务意图(如数据外泄、破坏性操作)。
- 预算与范围递减:确保子 Agent 获得的权限不超过父级,且资源消耗不超出预留配额。
- 策略执行点(PEP)/策略决策点(PDP)分离:PEP 部署在工具网关处,所有调用先经 PDP 评估;PDP 维护当前会话的授权信封(Authorization Envelope),并在每次批准后更新状态。
输出为批准或拒绝的决策,同时生成可审计的追踪记录。APC 的形式化保证包括 Blast Radius Monotonicity(委托链下游权限单调不增)与 Composition Soundness(在完全限制集和串行准入下,拒绝所有被禁止组合)。
与现有 RBAC/ABAC 或独立 guardrail 的差异在于:APC 将授权从单次请求静态判定升级为跨请求会话状态感知,且将组合危险与意图偏离作为独立的授权不变量强制在模型之外执行,而非依赖模型自我约束。
实验
实验设计
- 数据集:InjecAgent、ASB、AgentDojo,共 3,154 实例。
- 采用 compromised-model 评估:在合法工具调用后注入 ground-truth 攻击调用,隔离模型行为,直接测试授权架构。
- 同时测量 utility 和授权延迟。
关键发现
- AgentDojo 数据窃取率从 75-100% 降至 0%;InjecAgent 544 个数据窃取案例全部被阻止。
- 意图绑定将 destruction 从 38.6% 降至 4.0%,manipulation 从 90.5% 降至 12.1%。
- 授权延迟 p99 仅 0.24 ms;utility 在两个设置中分别下降 8.6 和 13.9 个百分点。
与基线对比
与静态授权或独立请求评估相比,APC 的组合闭包检查防止了单个允许动作组合成禁止结果,且安全提升不依赖模型抵抗 prompt injection,而来自授权架构本身。该架构可作为零训练的运行时增强层,延迟开销极低,适宜生产集成。
行业影响
落地场景
APC 可直接应用于需要多智能体协作的企业自动化场景,例如:
- 云服务代理:agent 代表用户管理多个 SaaS 账号,APC 动态限制子代理的权限范围,防止越权调用。
- 金融交易执行:交易 agent 调用下单、查询等工具,APC 的意图绑定与组合约束可阻止被注入后执行批量卖出或异常转账。
- 电商客服自动化:agent 处理退款、订单修改,APC 确保仅能访问当前会话涉及的资源,避免数据批量导出。
商业价值
- 降本:减少因 prompt injection 导致的数据泄露与破坏性操作,降低事件响应与赔偿成本。
- 增收/效率:让安全团队敢于放行高价值 agent 工作流,缩短审批周期,提升自动化渗透率。
- 合规审计:APC 生成会话级审计轨迹,满足 SOC 2、GDPR 等对非人类身份访问的追溯要求。
与现有产品/工作流的接口
APC 采用 PEP/PDP 架构,可作为轻量 sidecar 或代理部署在工具网关层,拦截 tool_call 请求并评估授权策略。其低延迟(p99 0.24 ms)适合生产环境。可无缝集成现有 IAM/OAuth 体系,通过 Authorization Envelope 携带委托链与预算,无需重构 agent 框架。
典型场景:一家跨国电商平台部署客服 agent 自动处理退换货,APC 配置预算限制(如单笔退款 ≤ $200)和组合闭包规则(禁止 refund 后触发 delete_order),即使模型被注入恶意指令,也会被策略层拦截,而合法流程不受影响。
局限
- 论文承认 Composition Soundness 仅对完全限制集和串行化准入成立。实际部署中完全限制集难以完备覆盖所有跨域组合攻击,未预见的恶意行为可能绕过检查;串行化准入假设与多智能体并发工具调用场景存在冲突,可能限制系统吞吐量或需额外同步机制,从而削弱该定理在真实复杂环境下的可迁移性。
- 实验主要在 InjecAgent、AgentDojo、ASB 等基准上开展,且 compromised-model 评估通过插入 ground-truth 攻击调用模拟模型被攻破,与真实 prompt injection 或模型内生安全缺陷存在差距。同时,APC 导致 utility 下降 8.6 和 13.9 个百分点,表明其授权约束对正常任务完成率有不可忽视的副作用,在高可用性业务场景中可能难以接受。
- 相比 OAuth 2.0 Token Exchange 或云 IAM 委托机制,APC 引入的会话状态、预算管理、组合闭包和独立 PDP/PEP 组件需要额外的策略工程、审计与运维负担。现有企业授权体系已高度复杂,集成 APC 往往需要改造已有 IAM 或新增授权服务,部署与维护成本显著,且文中未给出与企业 RBAC/ABAC 策略平滑融合的具体路径。