RedAct:编辑智能体能力轨迹以保护程序技能
用户依赖执行轨迹来观察智能体行为、诊断故障并确保问责。这些轨迹包含丰富的过程细节,包括工具调用、中间决策和错误恢复逻辑。然而,这些细节可能暴露私有的程序技能,使得下游方法能够在不访问模型权重或技能文件的情况下恢复关键公式、阈值和策略。 为量化此风险并评估保护措施,我们构建了CapTraceBench基准,包含75个专业的长时任务和154个跨七个领域的精选技能。我们还提出了RedAct框架,一种受保护的轨迹发布框架,它定位受保护的关键信息,重写轨迹同时保留验证者所需的证据,并嵌入行为水印用于下游溯源分析。 在代表性轨迹复用方法上,RedAct将归一化技能转移 (NST) 从原始轨迹的44.7–67.1%降低到无技能基线以下,同时保留审计证据。其独立的行为水印达到93.6–100.0%的真正检测率,误报率最多1.9%。 这些结果表明,公共智能体轨迹可作为安全接口,而选择性编辑可以在不删除审计证据的情况下减少程序能力泄露。
论文精读
TL;DR RedAct 通过选择性编辑与行为水印,在保护 Agent 轨迹中程序性技能不被窃取的同时,保留审计证据,将技能迁移降至基线以下,水印检测率超 93% 且误报极低。
问题
问题背景
随着 LLM-based agent 在自动化工作流中的广泛部署,执行轨迹 (execution trace) 成为审计、调试和问责的核心证据。这些轨迹记录了 agent 的工具调用、中间推理和错误恢复过程,对利益相关方透明公开,但同时暴露了丰富的过程性知识。
现有方法的局限
当前实践中,轨迹通常以全量明文形式发布,缺乏系统化的保护机制。简单的脱敏策略(如 token 屏蔽或字段删除)会破坏审计证据的完整性,使得下游验证者无法确认 agent 是否遵循预定规则、是否正确使用了关键工具。更重要的是,agent 的技能往往隐藏在决策序列的组合模式 而非单一敏感词中,现有方法无法在不损失审计性的前提下抑制这种泄露。已有工作如差分隐私或对抗扰动主要针对训练数据保护,难以直接迁移到半结构化的多步代理轨迹,因为轨迹要求精确的工具调用参数保持可验证。
为什么这个问题难且重要
轨迹层面的技能泄露 风险正在加剧:通过分析公开轨迹,攻击方或无权限用户可以不接触模型权重或内部技能文件,直接恢复阈值参数、分诊逻辑、定价策略等程序性专有知识 (procedural skills)。这构成了 IP 窃取的新向量。与此同时,法律法规和合规要求又强制某些应用场景提供可审计的证据。因此,轨迹发布成为一个既要透明又要保密的安全接口 问题。技术挑战在于,技能可能散布在多步决策的微妙模式中,难以用规则穷举,且保护措施必须可证明不影响审计结论(即保留 verifier 关键证据)。
行业类比
这类似于将微服务调用链路日志公开发布后,竞争对手通过分析调用顺序、参数规律和异常处理路径反向推导出业务编排引擎的核心算法。
核心洞察
- 将智能体执行轨迹视为安全接口而非被动审计日志,揭示了程序性技能泄露的新威胁模型。相比于直接攻击模型权重或提示词,下游方法仅从公开轨迹(工具调用、中间决策、错误恢复逻辑)即可恢复专有技能,如关键阈值、公式和策略。CapTraceBench 量化了这种风险,表明原始轨迹可造成 44.7%-67.1% 的技能转移,凸现轨迹必须纳入安全边界。
- 选择性重写与行为水印的组合实现了隐私保护与审计能力的兼顾,区别于全遮蔽或加噪的朴素防御。RedAct 框架先定位受保护的关键信息,再重写轨迹以保留验证所需的审计证据,同时嵌入可溯源的行为水印。实验显示 normalized skill transfer 降至无技能基线以下,且水印检测率达 93.6%-100.0% 而误报率不超过 1.9%,证明精确控制信息暴露的可行性。
- 通过构建长程多领域基准和标准化技能转移指标,将轨迹保护从定性论述推向可量化工程实践。CapTraceBench 涵盖 75 个任务、154 个技能,覆盖七大领域,配合 NST 指标,为防御方法提供了统一评测。RedAct 在该基准上证明,针对性的局部重写即可让下游技能恢复退化为随机猜测水平,为轨迹发布与复用建立了安全基线。
方法
方法概述
RedAct 是一个保护性轨迹发布框架,目标是在公开 Agent 执行轨迹时,减少程序性技能泄露,同时保留必要的审计证据。整体流程遵循 输入 → 关键模块 → 输出 级联结构。
- 输入:Agent 在长程任务中产生的完整执行轨迹,包含工具调用、中间决策、错误恢复逻辑等细粒度操作。
- 关键模块:
- 关键信息定位器 (Key Information Localizer):识别轨迹中暴露程序性技能(如关键公式、阈值、策略)的片段,标记为受保护区域。
- 轨迹重写器 (Trace Rewriter):对标记区域进行改写,模糊敏感细节,但故意保留验证者所需的证据(如最终输出、成功/失败信号),确保可审计性不丢失。
- 行为水印嵌入器 (Behavioral Watermark Embedder):在重写后的轨迹中插入独特的行为水印,用于下游溯源分析,可在不依赖轨迹内容的情况下检测轨迹是否源自特定发布版本。
- 输出:经过重写并嵌入水印的保护轨迹,语义完整且可审计,但无法从中恢复出原始程序性技能。
评估与基准
论文构建了 CapTraceBench,包含 7 个领域、75 个长程任务和 154 个精心设计的技能,用于量化技能泄露风险。使用 归一化技能迁移度 (NST) 衡量下游方法从轨迹中恢复技能的能力。在典型轨迹重用方法上,RedAct 将 NST 从原始轨迹的 44.7–67.1% 降至低于无技能基线的水平,同时保持审计证据。行为水印的检测正确率达到 93.6–100.0%,误报率最高仅 1.9%。
与同类方法的差异
传统轨迹脱敏通常直接删除敏感字段或整体泛化,这会导致审计信息丢失或无法验证。RedAct 的创新在于选择性重写:仅移除技能关键信息,保留验证者必需的结构与证据,并引入行为水印提供独立的溯源机制,在安全、可用与责任追溯之间取得工程平衡。
实验
实验设计
CapTraceBench 是首个专门评估过程性技能泄露风险的基准,覆盖 75 个长程任务与 154 个精选技能,涉及七大领域。实验选取具有代表性的轨迹复用方法(如通过轨迹提取规则、阈值、策略的模仿或微调),在原始轨迹和 RedAct 保护后的轨迹上分别测量 Normalized Skill Transfer (NST),以量化技能迁移水平。同时,通过独立行为水印检测实验,评估水印对下游溯源分析的可靠性。
关键发现
RedAct 将 NST 从原始轨迹的 44.7–67.1% 降至 无技能基线以下,表明选择性信息重写几乎消除了可被下游复用的过程性知识,同时保留了验证器所需的审计证据。其内嵌的行为水印在所有测试条件下实现了 93.6–100.0% 的真阳性检测,假阳性率最高仅 1.9%,能可靠追溯轨迹来源。
深度解读
与将轨迹视为无风险日志的常见做法不同,RedAct 首次将公开的 agent 执行轨迹定义为潜在的安全边界。相较于基于差分隐私或简单脱敏的方案,RedAct 不是去除所有信息,而是通过关键信息定位 + 面向审计的重写,在证据完整性和技能保护之间找到平衡。实验证明,仅靠掩码或扰动无法有效阻断技能提取,而 RedAct 的结构化重写能从根本上降低复用方法的归一化技能迁移,且不引入额外高昂计算开销。这为构建可公开的 agent 交互数据生态提供了实用路径。
行业影响
落地场景
RedAct 面向任何需要公开 Agent 执行轨迹但又必须保护内部技能的行业。核心场景包括:
- RPA 与自动化服务商:向客户交付审计轨迹时,必须隐藏配方、阈值、回退策略等 proprietary know-how。
- 企业级 AI 助手:如客服 Agent 在对话日志中展示决策细节,但需保护业务规则(如折扣上限、风控阈值)。
- 多 Agent 协作平台:跨组织共享任务轨迹时,防止合作方从调用模式中恢复定价模型或谈判策略。
- LLM 应用安全审计:安全团队需重放失败案例,但原始轨迹可能泄露 prompt 设计、内部工具参数等关键资产。
商业价值
RedAct 在保护核心技能的同时保留审计证据,直接降低知识产权泄漏风险,从而:
- 降低合规与诉讼成本:避免因轨迹暴露导致商业机密外泄,减少法律纠纷和品牌损失。
- 加速企业级 LLM 应用的对外交付:安全团队可快速批准轨迹共享,缩短销售周期。
- 提升客户信任与续费率:客户获得可验证的审计记录却看不到敏感逻辑,兼顾透明度与安全性。
- 支持 Agent 生态的开放协作:推动跨组织 Agent 的可靠交互,形成新的平台型商业模式。
与现有产品/工作流的接口
RedAct 可作为轻量级中间件嵌入现有 Agent 框架:
- 在轨迹生成阶段:插入
Redact模块,通过信息定位器标记保护字段,然后重写轨迹并嵌入行为水印。 - 发布阶段:输出经过脱敏的轨迹,下游审计工具可直接解析,水印用于溯源性验证。
- 与现有监控栈集成:轨迹格式兼容常见日志管道(如 ELK),水印检测器可部署为独立服务或作为 SIEM 插件。
具体落地 Use Case
电商平台的智能定价 Agent
电商企业使用 Agent 动态调价,需向卖家/监管部门解释价格变化理由,但原始轨迹包含边际成本、库存弹性系数、竞品爬取间隔等敏感参数。
- 接入 RedAct 后,轨迹中价格计算步骤被重写为 "基于市场条件与库存水平综合计算",同时保留决策时间戳、最终价格等审计证据。
- 行为水印可在后续争议中证明轨迹确实来自该 Agent 版本,防止伪造。
金融风控决策 Agent
银行信贷审批 Agent 输出决策轨迹供复核,原始轨迹可能暴露模型特征权重、黑名单数据源、内部评分阈值。
- RedAct 定位并重写这些敏感节点,例如将 "score > 680 则通过" 替换为 "综合评分达到通过标准",并嵌入不可察觉的数字水印(如 token 选择模式)。
- 监管机构仍可验证决策过程的一致性,但无法逆推风控逻辑。
局限
- **CapTraceBench 的覆盖范围有限**:该基准包含 7 个领域、75 个长程任务和 154 个精选技能,但实际 agent 工作流可能涉及更复杂的工具组合、动态适应和跨域技能迁移,Bench 中的任务设计未必能涵盖所有可能的程序性技能泄露路径。攻击者可能利用 RedAct 未覆盖的轨迹特征(如时序模式、工具选择的微妙偏差)恢复技能,因此保护效果的泛化性仍需在更开放、对抗性的真实场景中验证。
- **关键信息定位依赖先验知识与人工介入**:RedAct 需要预先指定受保护的关键信息(公式、阈值、策略片段等),这在实际部署中要求安全专家对每个技能泄露面进行建模。若关键信息未被正确定位,重写无法根除泄露;自动定位方法尚未集成,导致面对未知攻击或零日泄露时可能失效。这限制了框架在大规模、持续演进的 agent 生态中的适用性。
- **行为水印在强对抗场景下的鲁棒性未充分评估**:实验在标准轨迹复用攻击下验证了水印检出率,但若攻击者有意识地进行轨迹混淆、重放或水印移除训练,当前嵌入的水印可能被削弱。论文未探讨水印容量与不可感知性的权衡,也未分析长期部署下环境漂移对水印信号的影响,因此在审计溯源的真实威胁模型中,水印的可靠性仍有待加强。