论文

DeepSeek Harness 安全性评估与 A.I.G: 针对间接提示注入的抵抗力评估

DeepSeek Harness 安全性评估与 A.I.G: 针对间接提示注入的抵抗力评估

本研究评估 DeepSeek Harness (DSH) 中的间接提示注入风险,使用 AI-Infra-Guard (A.I.G) 构建测试、传递受控污染、执行 DSH、收集轨迹并判定结果。实验覆盖 16 种间接内容渠道、文本与文件两种载体模式、35 种载荷目标、一个未修改的基线以及 12 种攻击方法,共进行 14,560 次受控执行。 实验保留 DSH 的代理循环、工具注册表、模型适配器与会话事件路径;源工具与敏感汇点为本地模拟,记录尝试操作而不产生外部副作用。每条轨迹由确定性规则判定器(RuleJudge)与基于语义的 LLM 判定器(LLMJudge)共同评估。观察到的最强攻击成功率包括:文本模式下假完成攻击为 17.0%(LLMJudge 判定),文件模式下隐藏 Unicode 攻击为 25.5%(LLMJudge 判定),文件模式下技能渠道为 16.0%(LLMJudge 判定)。此外,LLMJudge 比 RuleJudge 更常分配部分合规结果(7.3% 对比 2.0%)。 我们将这些结果与 DSH 对工具结果的处理、附加上下文及工具调用策略钩子相关联,并识别出应置于不受信任内容与敏感操作之间的控制措施。代码已开源:https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 。

论文精读

TL;DR 系统评估 **DeepSeek Harness** 对**间接 prompt 注入**的抵抗能力:通过 **A.I.G** 构建 14,560 次受控执行,覆盖 16 个间接内容通道与 12 种攻击方法,最高攻击成功率 25.5%,并给出在不可信内容与敏感操作之间加控制的工程建议。

问题

问题背景:随着 LLM Agent 在自动化工作流中的普及,间接提示注入(indirect prompt injection)成为突出攻击面。工具返回结果、解析文件、外部网页等不可信内容都可能携带恶意指令,诱导 Agent 执行越权操作。

现有方法局限:传统评估多聚焦于单模型或简单提示,缺乏对真实 Agent Harness 完整执行链路的建模。例如,静态分析无法捕捉 tool registry、session-event path 等运行时动态行为;红队测试常依赖单一裁判(规则或 LLM),难以量化 partial compliance,且未覆盖多种 carrier 与 channel 的组合。

为什么难/重要:Agent 系统将不可信内容与敏感工具调用直接相连,攻击面随集成增多而扩大。在保留 agent loop、工具调用策略与模型适配器不变的前提下,测量不同攻击方法、载体模式与 payload 目标的成功率,对部署安全控制至关重要。业界对 AI Agent 安全高度关注,尤其在生产环境中文件处理、技能调用等场景。

行业类比:类似 AI 客服助手处理用户上传的简历时,简历中嵌入隐藏 Unicode 指令,诱导助手访问内部数据库——评估此类风险需要全链路仿真与双裁判交叉验证。

核心洞察

  • 间接注入成功率高度依赖内容载体形式,文本与文件通道的威胁面不可互换。同类工作通常将提示注入视为单一文本序列评估,而本研究在 16 个通道、文本/文件两种模式下发现文件模式隐藏 Unicode 攻击达到 25.5%(RuleJudge),skills 通道文件模式 16.0%,显著高于文本模式最优的 17.0%(LLMJudge)。这表明评估和防御必须按内容来源与解析路径分别建模,不能假设模型对所有输入统一处理,否则会高估或低估真实风险。
  • 规则裁判与语义裁判对攻击成功与部分合规的分歧揭示了单一评估维度的盲区。LLMJudge 识别出 7.3% 的部分合规,而 RuleJudge 只有 2.0%;且 LLMJudge 对文本 fake-completion 更敏感(17.0% vs 规则可能更低)。这说明确定性规则容易低估模糊操纵,语义评估能捕捉更细微的目标偏离。建议 agent 安全评估同时采用两类裁判,并报告分歧作为风险度量,避免仅依赖规则导致的漏报或误判。
  • 工具调用策略钩子是防止注入从不可信内容传导至敏感动作的关键架构控制点。DSH 的 agent loop 保留 tool registry、model adapter 和 session-event path,但攻击成功表明仅靠模型输出过滤不够。论文建议在系统边界保留 provenance、独立授权敏感 sink、将 skills 视为代码资产。这与仅强化 prompt 或微调模型不同,强调在 agent 框架内实施纵深防御,为部署者提供了具体可落地的控制清单。

方法

方法按 “输入 → 关键模块 → 输出” 展开。

输入:定义评估矩阵,包括 16 个间接内容通道、文本/文件载体模式、35 个 payload 目标、12 种攻击方法,并保留一个未修改的基线对照组。

关键模块:A.I.G 通过 runtime adapter 与 DeepSeek Harness 集成,完整保留其 agent loop、tool registry、model adapter 和 session-event path。受控污染由本地 fixtures 注入 source tools 与 sensitive sinks,仅记录尝试动作,不产生外部副作用。执行期间收集每一跳 trace。

输出:对每一条 trace 使用 RuleJudge(确定性规则)和 LLMJudge(语义模型)进行双重判断,输出攻击成功率、部分合规率等指标,并捕捉 “暴露但未完成攻击” 的信号。

与同类方法的差异:该方法在真实 agent 架构上执行端到端的源到汇全路径评估,而非仅测试单轮提示注入,同时双 judge 提供互补的定量视角。

实验

实验设计

使用 A.I.G 框架对 DeepSeek Harness (DSH) 构建间接提示注入测试集:覆盖 14,560 次受控执行、16 个间接内容通道、文本/文件两种载体、35 个 payload 目标、12 种攻击方法及一个未修改基线。实验保留 DSH 的 agent loop、tool registry、model adapter 和 session-event path;所有源工具与敏感 sink 均为本地 fixture,仅记录动作不产生外部副作用。采用双评判器:确定性规则评判器 RuleJudge (𝒥_R) 和语义 LLM 评判器 LLMJudge (𝒥_L)。

关键发现

  • 最强攻击成功率:fake-completion 攻击(文本模式)在 𝒥_L 下为 17.0%;hidden Unicode(文件模式)在 𝒥_R 下为 25.5%;skills channel(文件模式)在 𝒥_R 下为 16.0%。
  • 𝒥_L 比 𝒥_R 更常判定 partial compliance(7.3% vs 2.0%),语义评判对模糊输出更宽容。
  • 结果暴露 DSH 在处理工具结果、附加上下文及 tool-call policy hooks 时的注入脆弱性。

基线对比解读

文中包含一个未修改基线,因此上述攻击成功率为相对该基线的增量(未提供基线绝对值)。文件模式攻击成功率普遍高于文本模式,且 hidden Unicode 在文件模式下达到最高 25.5%,说明载体表示对注入有效性影响显著。双评判器分歧(partial compliance 比例差 5.3 个百分点)提示语义评测可能高估安全态势。建议在不受信任内容与敏感动作之间引入控制:在模型边界保留 provenance、独立授权敏感 sink、将 skills/integrations 视为代码邻近资产,并在部署变更后重跑评估矩阵。

行业影响

落地场景

A.I.G 可嵌入 AI agent 平台的安全评测流程,覆盖 DeepSeek Harness 等 agent runtime 的多通道间接内容(文本、文件、技能)。适用于电商客服、企业知识库、内容审核等依赖工具调用的自动化业务,评估潜在间接提示注入风险。

商业价值

通过自动化评估间接提示注入攻击成功率,降低数据泄露、未授权操作带来的合规与赔偿成本;同时提升模型供应链安全信任,加速面向企业客户的 Agent 产品交付,减少人工红队审计开销。

与现有产品 / 工作流的接口

作为安全测试套件集成到 CI/CD 或 MLOps 流水线,与漏洞扫描、红队测试工具并行。利用 RuleJudge 与 LLMJudge 双重判定,生成结构化报告,可对接 SIEM/SOC 告警或安全审计平台。控制点可映射到模型边界(provenance)、敏感 sink 授权和工具策略钩子。

具体落地 use case

  • 电商智能客服:用户上传的订单截图嵌入隐藏 Unicode 指令,诱导 agent 执行退款或泄露内部数据;通过 A.I.G 评估并在模型边界保留来源元数据、对敏感操作独立授权。
  • 企业知识库助手:员工上传 PDF 包含 fake-completion 攻击,使 agent 泄露其他文档内容;在文件读取 sink 前增加工具调用策略校验,阻断未授权访问。

局限

  • **评估环境与真实部署存在差异**:实验使用本地夹具(`local fixtures`)模拟源工具和敏感 sink,虽然避免了外部副作用,但无法完全复现生产环境中的复杂交互(如多步状态依赖、真实工具返回的不确定性、网络延迟与并发等),因此攻击成功率可能被低估或高估,结论外推至真实 DSH 部署时需谨慎。
  • **LLM 评审的可靠性与偏差**:`LLMJudge` 作为语义评审,虽然比 `RuleJudge` 更灵活,但其自身可能受到间接提示注入或上下文干扰,且 LLM 判断存在主观性和随机性,导致部分合规与攻击成功的边界模糊(如 7.3% 与 2.0% 的差异),可能影响结果的一致性和可重复性。
  • **未提供防御方案的有效性验证**:论文识别了若干控制建议(如保留来源、独立授权敏感 sink、将技能视为代码邻接资产),但未实际实现并测试这些防御措施在降低攻击成功率上的效果,因此评估的最终价值停留在诊断层面,缺少闭环验证,后续工作可在此基础上构建防御基线。
论文Zonghao Ying2026-08-18原文

相关内容