Agent 安全应成为运行时契约
当前主流范式将 AI 安全视为训练时通过 RLHF、DPO 或 Constitutional AI 注入模型的属性。本文认为,对于执行代码、修改文件、发送消息和操作数据库的自主 Agent 而言,这种范式在结构上是不充分的。Agent 安全应成为由 harness 强制执行的运行时契约,包含两个互补方面:预防面通过沙箱、权限门、输出过滤器和轨迹监控器在危险动作发生前予以阻止;证据面则要求提供可验证的证据证明好动作确实发生,并以测试运行、日志捕获、文件差异、引文溯源等硬证据作为任务提交的门禁。 我们基于四条公共证据线支撑这一立场,行级协议与数据见补充 JSON 文件:1) 对 52 起已记录 AI Agent 与 LLM 安全事件的调查;2) 虚假完成审计,含 31 个无争议核心案例加 1 个有争议示例;3) 对 12 个公开 Agent 系统和 harness 的轨迹模式审计;4) 对 NeurIPS、ICML、ICLR 2023-2025 全部 28,560 篇论文的标题级审计,显示训练时与部署时发表数量存在 8-12 倍的不平衡。此前需要强制安全的两个领域——计算机安全与实验科学——都已收敛于同时包含预防和证据元素的运行时契约;Agentic AI 正面临同样压力。 我们形式化 Agent Trajectory Schema 与 Evidence Chain,提出基于标准监控器组合的组合式门控命题,并概述研究议程。Agentic AI 中安全的正确单元是「带可核查证据的轨迹」,而非模型本身。
论文精读
TL;DR 主张智能体安全应是运行时契约,由 harness 执行预防性阻断与证据性验证,而非仅靠训练对齐;基于四类实证证据,为 agent 安全提供新范式。
问题
问题背景
当前 AI 安全研究重心集中在训练期对齐,主流技术包括 RLHF、DPO 与 Constitutional AI。但自主 Agent 正在进入真实生产系统,执行代码、修改文件、发送消息、更新数据库,风险面不再只是文本生成。
现有方法局限
训练期对齐本质是对模型参数的统计约束,在 Agent 场景存在结构性缺陷:
- 分布外失效:训练语料无法覆盖运行时工具调用、长程多步轨迹和对抗性提示,模型在未知环境状态中仍可能输出危险动作。
- 证据缺位:RLHF 优化的是“看起来合理”的响应,不产生日志、文件 diff、测试结果等可验证凭据;Agent 声称完成的任务可能未执行,审计无从定位。
- 安全属性不可组合:模型级对齐不保证工具组合后行为可控,奖励函数容易被 hack,通过偏好标签即可绕过安全过滤。
为什么这个问题难/重要
Agent 安全必须从“模型属性”转为运行时契约,难点在于需要在开放动作空间上同时实现事前拦截与事后验证。预防面涉及沙箱、权限门、输出过滤、轨迹监控;证明面要求测试运行、日志捕获、文件 diff、引用溯源作为任务提交门槛。行业压力明确:52 起公开安全事件、31 起非争议性虚假完成、NeurIPS/ICML/ICLR 2023–2025 训练期与部署期论文 8–12 倍失衡,说明现有研究结构与实际风险严重错位。
行业类比
就像 CI/CD 要求代码合入前必须跑测试并展示 diff,Agent 的任务提交也应由可检查证据 gating:没有 checkable evidence 的 trajectory 不可交付。
核心洞察
- 安全单元应从模型权重转向运行时的轨迹与可验证证据。传统 RLHF、DPO 等方法在训练时注入安全属性,但自主代理执行代码、修改文件、发送消息时,模型输出只是完整行为轨迹的一部分。作者提出 trajectory-with-checkable-evidence 作为安全评估最小单位,并形式化 Agent Trajectory Schema 与 Evidence Chain。与只关注单步输出过滤或事后审计的工作不同,该框架把预防性拦截和证据性验证统一到 harness 的运行时契约中,使安全性可组合、可审计。
- 安全不应只是预防,还需要证据证明正确动作确实发生。论文将运行时契约分为预防面(sandbox、permission gates、output filters)与证据面(test runs、log captures、file diffs、citation grounding),并借鉴计算机安全与实验科学的历史收敛模式。这种双重结构解决了模型对齐无法提供的操作性保证,尤其适用于自主代理的虚假完成(false completion)问题,其 31 个核心案例的 false-completion audit 提供了实证支撑。
方法
方法框架:运行时安全契约
输入:agent 在部署中产生的轨迹(trajectory),包含动作、工具调用、文件修改、消息发送、数据库操作等。
关键模块分为两面:
- 预防面 (Preventive Face):在动作执行前拦截,组合
sandboxes、permission gates、output filters、trajectory monitors等机制,阻断危险操作。 - 证据面 (Evidential Face):定义
Agent Trajectory Schema与Evidence Chain,要求任务提交时附带可验证证据,如test runs、log captures、file diffs、citation grounding。
组合门控 (Compositional Gating):基于标准 monitor composition,将多个预防与证据监控器合成最终 gate,使安全性质在组合下保持。
输出:每个动作的 allow/deny 决策,以及任务提交是否满足证据门槛。
论文以四项实证审计支撑该框架:52 起 AI-agent/LLM 安全事故调查、31 例非争议误完成审计、12 个公开 agent 系统 trajectory-schema 审计、28,560 篇 NeurIPS/ICML/ICLR 2023--2025 论文标题审计,发现训练时与部署时发表比达 8--12 倍失衡。
与 RLHF、DPO、Constitutional AI 等训练时对齐方法不同,本工作将安全单元从模型权重转移至推理时 harness 的轨迹-证据契约,强调预防与证据双重约束。
实验
实验设计
论文不依赖单一模型训练,而是设计四项互补审计:
- 事故调查 收集 52 起公开 AI agent / LLM 安全事件;
- 假完成审计 检查 31 个核心案例(另 1 例争议)中模型声称完成任务但缺乏证据的情形;
- 轨迹模式审计 分析 12 个公共 agent 系统或 harness;
- 论文标题审计 统计 NeurIPS、ICML、ICLR 2023-2025 共 28,560 篇论文中训练时与部署时安全工作的数量。
关键发现
- 52 起事件中,模型虽经对齐仍能产生危险动作;
- 假完成审计显示模型可能高概率给出虚假完成信号,31 个非争议案例缺少可验证证据;
- 12 个系统在轨迹记录上缺乏统一的 证据链 结构;
- 标题审计显示训练时安全论文数量是部署时安全论文的 8–12 倍,研究资源配置严重倾斜。
与基线对比
传统基线是仅依赖训练时对齐(RLHF/DPO/Constitutional AI)。论文指出该范式在代理场景存在预防性失配(无法覆盖执行期的新风险)和证据性失配(无法证明正确行为实际发生)。运行时合约用预防面(沙箱、权限门)和证据面(测试运行、日志、文件 diff)补齐缺口,与计算机安全和实验科学的成熟做法一致,提出以轨迹-可核验证据为安全单元。
行业影响
落地场景
自主 agent 在 企业服务、电商运营、内容平台、金融交易 等场景中,需要执行代码、操作文件、发送消息、修改数据库。runtime contract 可直接嵌入 代码助手 的 patch 提交流程,也可用于 客服自动化工单 或 广告投放 agent 的预算调整:preventive face 通过 sandbox + permission gate 阻止越权操作;evidential face 要求提供 test_run、file_diff、log_capture 等硬证据后才允许任务完成。
商业价值
- 降本:减少 agent 误操作造成的资损与人工回滚成本;自动化事前拦截 + 事后审计,降低安全事件响应开销。
- 信任与合规:轨迹带证据链,可满足审计和监管要求,提升 enterprise 客户对 agent 交付的接受度。
- 体验提升:false completion 被证据门槛过滤,用户看到的是经过验证的结果而非幻觉。
与现有产品 / 工作流接口
可将论文提出的 Agent Trajectory Schema 和 Evidence Chain 实现为可插拔 middleware,集成进现有 agent 框架(如 LangGraph / OpenAI Agents SDK):
- 在 tool 调用层接入 permission gate 与 sandbox(Docker / gVisor);
- 将轨迹按 schema 记录到现有日志系统(OpenTelemetry / DataDog),并生成可验证的
evidence字段; - 通过 compositional gating 把多个 monitor 组合成发布门禁,对接 CI/CD 或 human-in-the-loop 审批流。
例如,电商 agent 在修改商品价格前必须通过权限检查,在提交任务前必须附上价格变更前后
file_diff和模拟结算test_run;内容平台审核 agent 的自动下架动作需要携带违规片段引用作为 citation evidence。
局限
- 本文是立场性论文,提出的运行时安全契约与两类机制主要基于已有沙箱、权限、监控等概念的整合,未给出可运行的实现或基准验证。证据部分虽然包含四项审计,但均为回顾性描述,未展示所提 schema 在实际 agent 部署中的拦截率、误报率或完成质量提升。
- 标题级审计只检查 NeurIPS/ICML/ICLR 论文标题,可能漏掉使用不同措辞的运行时安全研究,且无法区分论文实际内容是否涉及部署期安全;由此得出的 8-12 倍不平衡可能存在系统性偏差。52 起事件与 31 例误完成案例的样本量有限,且来源依赖公开报道,难以全面代表 agent 安全风险分布。
- 与现有 agent harness 或安全中间件工作相比,本文没有对比具体系统(如 OSWorld、AgentBench 等)中的防护实现差异,也未提供统一的接口规范或开源工具,导致工程落地指导性不足。研究议程覆盖面广但缺少优先级和可度量的里程碑,后续验证成本较高。