论文

中间层知道什么:从熵动力学检测越狱攻击

中间层知道什么:从熵动力学检测越狱攻击

越狱攻击揭示了对齐大语言模型(Large Language Models)的持久弱点:精心设计的提示能够绕过安全训练(safety training)触发违反策略的响应。现有防御大多在提示或输出层面操作,但有害意图如何在模型内部表示中编码仍不清楚。本文通过 logit lens 分析冻结LLM的 token-level predictive entropy 轨迹来探究该问题。 研究发现,提示层熵的静态聚合统计(如均值、方差)几乎不携带区分信号,而捕捉熵随 token 位置演化的特征(如 monotonic rank-based trend scores)则更具信息量。重要的是,该信号在模型深度上不均匀:它集中于 intermediate layers,并在最终层退化,表明越狱相关结构在中间网络表示中最显著,而非输出层。 在多种模型(Llama、Qwen、Gemma)和对抗基准上,这些熵动力学提供了架构一致的区分能力,无需额外训练。综合来看,本文表明越狱行为反映在结构化的中间不确定性动力学中,明确了哪些熵派生特征编码了有害意图,以及该信号在网络的何处最为显著。

论文精读

TL;DR 用中间层 token 预测熵的**单调趋势**替代静态统计量,无需额外训练即可在 Llama/Qwen/Gemma 上稳定检测越狱攻击,且信号集中在**中间层**而非输出层。

问题

问题背景

对齐后的大语言模型仍易受越狱攻击(jailbreak attacks) 操纵,精心设计的提示可诱导模型输出违规内容。行业当前关注如何从模型内部表征中识别此类有害意图,而非依赖提示或输出层面的防御。

现有方法局限

多数检测方法在提示或输出级操作:

  • 静态统计量(如提示级熵的均值、方差) 对越狱判别力弱,信号被噪声淹没。
  • 基于分类器的对抗训练需额外标注数据,泛化性受限,且引入训练开销。
  • 终层表征分析忽略了越狱相关信息可能在网络中间层集中,导致性能不足。 这导致现有防御无法低成本、架构一致地捕获越狱的早期内部信号。

问题难点与重要性

越狱攻击的演进速度远超安全更新周期,防御需深入模型表征机理。技术挑战在于:

  • 跨越 token 位置与层深度的熵动态结构复杂,如何提取无需训练的、可跨模型迁移的有效特征;
  • 定位模型内部最脆弱层级,避免将不可靠输出层作为判别依据;
  • 保证方法架构一致性(architecture-consistent),在多模型(如 Llama、Qwen、Gemma)上均有效。 业界急需低成本、可解释的内部表征检测方案,以应对层出不穷的对抗攻击。

行业类比

如同在智能座舱语音助手安全中,通过分析中间层声学特征而非最终文字转写来检测恶意指令,本文在 LLM 中间层发现越狱检测的信号富集区。

核心洞察

  • 中间层熵动态比最终输出或 prompt 级特征更可靠地编码越狱意图。传统防御常聚焦于 prompt 表层或输出文本,而本文发现 token 级熵轨迹在中间层形成结构化的不确定性模式,这种模式与有害意图强相关。该洞察重新定义了安全检测的「表征位置」,意味着防御不必依赖最终输出层(易被对抗绕过),而应关注中间网络层的内部动态,为训练无关的越狱检测提供了新的架构视角。
  • 熵变化的单调趋势(如 rank-based trend scores)是区分越狱与良性 prompt 的关键动态特征,而非简单的均值或方差。静态统计量在不同类型 prompt 间几无区分力,而 token 位置间的趋势性变化反映了模型在解析越狱请求时逐渐攀升的预测不确定性。这一发现凸显了熵的动态结构信息比聚合标量更丰富,启发了后续工作可探索其他序列级动态特征,如局部突变速率或长程依赖模式。
  • 越狱检测信号在不同模型家族(Llama, Qwen, Gemma)中均集中于中间层,展现出架构级一致性。这意味着中间层对有害意图的表征并非模型专属,而是某种通用属性,可能源于对齐训练在中间层形成的「安全边界」。对于工程落地,该结论支持构建模型无关的越狱检测层,仅需在中间层提取熵特征,无需模型微调,极大降低了部署成本和跨模型迁移的难度。

方法

方法概览

本方法通过分析冻结的 LLM 内部中间层的预测熵动态来检测越狱提示,无需训练或修改模型参数。整体流程为:输入提示文本 → 逐层提取 token 级熵轨迹 → 逐层抽取聚合特征 → 单层线性分类器输出判别结果。

关键模块

  1. 中间层熵计算 (Logit Lens)
    对输入提示的每个 token 位置 $t$,在目标 LLM 的每一层 $l$ 取出隐藏状态 $h_t^l$,直接通过模型的输出投影矩阵 (unembedding matrix) 映射到词表空间,经 softmax 得到概率分布 $p(w|h_t^l)$,再计算熵 $H_t^l = -\sum p(w)\log p(w)$。由此获得一个 $L \times T$ 的熵矩阵,反映模型各层对后续 token 的预测不确定性如何随输入位置和网络深度变化。

  2. 特征提取
    将每层的 token 级熵序列压缩为一个标量特征,用于后续分类。研究对比了两大类特征:

    • 静态聚合特征:如均值、方差、最小值、最大值等,仅反映熵的整体分布而不保留顺序信息。
    • 动态趋势特征:重点捕获熵沿 token 位置的单调变化模式。采用基于排名的趋势分数 (monotonic rank-based trend scores),例如计算序列的 Mann-Kendall S 统计量或秩相关系数,衡量熵是否随攻击性内容的推进而持续上升或下降。这类特征对位置顺序敏感,能揭示越狱提示在模型内部引发的结构化扰动。
  3. 评分与决策
    对每一层单独训练一个极简线性分类器(如逻辑回归),输入为该层提取的特征标量,输出提示为越狱的概率。所有实验均在已对齐的冻结模型上进行,特征提取与分类均极轻量,不涉及反向传播或微调。

输出

直接给出越狱/良性二分类判断,并可输出中间层各层的危险信号强度分布,便于分析信噪比最优的层位。

与同类方法的差异

不同于在输入层修改提示或输出层检测回复的防御方案,本方法聚焦冻结模型中间层的内部表征,利用 token 位置的熵动态序列而非静态整体指标,且无需额外训练模型或访问生成过程,仅靠前向传播即可捕获越狱证据。

实验

实验设计

实验在多个冻结的大语言模型(Llama, Qwen, Gemma)上展开,使用对抗攻击基准 JailbreakBench(含多种越狱提示变体)。研究者通过 logit lens 在每个 token 位置提取各层的预测分布,计算 token 级预测熵,然后构造跨 token 位置的动态特征,如 单调秩趋势得分 (monotonic rank-based trend scores),同时对比静态统计量(均值、方差)。检测性能以 AUROC 量化,整个过程仅需一次前向传播,无需额外训练。

关键发现

  • 动态特征远优于静态聚合:均值、方差等静态指标几乎不携带区分信号,而动态特征(尤其秩趋势得分)能显著提升越狱提示检测能力。
  • 信号集中于中间层:判别信息在模型深度上呈非均匀分布,在中间层达到峰值,至最终输出层大幅退化,表明有害意图被编码在 中间表示 而非预测头。
  • 跨架构与跨基准一致性:该现象在多种模型系列和不同对抗基准上稳定复现,具备良好的泛化性。

与基线对比

此前防御多聚焦于提示层或输出层,本工作首次揭示 中间层不确定性动态 才是越狱信号的关键载体,解释了仅靠最终层或浅层统计难以奏效的原因。与静态熵统计量相比,动态趋势特征捕获了 token 间序列依赖,这一信息增益验证了 秩序变动在越狱意图编码中的核心作用。该分析为无需训练、仅基于中间层熵动态的实时检测提供了新范式,且与现有输出层监控方法互补,可嵌入轻量级安全模块。

行业影响

落地场景

该方法可嵌入所有部署了大型语言模型(LLM)的产品,尤其适用于对安全性和内容合规性要求严格的实时交互场景:

  • 在线客服与对话系统:电商、金融、医疗等领域的智能助手,需防止用户通过越狱提示获取违规信息(如虚假评论生成、价格操纵、病人隐私泄露)。
  • 内容审核与生成平台:社交媒体、教育、新闻摘要等服务的 LLM 后端,需拦截诱导模型输出仇恨言论、虚假新闻或成人内容的攻击。
  • 企业级知识库问答:内部工具需避免员工通过越狱泄露商业机密或生成有害代码。

商业价值

  • 降低安全防护成本:无需额外训练专用分类器或维护大规模标注数据,可直接利用冻结模型内部信号,节省模型迭代和人工审核成本。
  • 提升风险响应速度与用户体验:在推理早期阶段(中间层)即识别有害意图,避免生成不安全回复,减少品牌声誉损失和法律风险;同时低延迟开销(仅需提取中间层熵特征)保障用户交互流畅。
  • 增强模型信任度:为开放域 LLM 应用提供轻量级可解释性安全护栏,助力产品通过安全审计。

与现有产品 / 工作流的接口

该方法可作为轻量级安全中间件集成到现有 LLM 推理管道中:

  1. 在模型推理框架(如 vLLM、TGI)中插入 pre-processing hook,对输入提示进行正向传播并收集指定中间层的 logit 输出。
  2. 计算 token 级熵轨迹的动态特征(如单调趋势得分),与预设阈值比较,判断是否为越狱。
  3. 若判定为有害,则拦截请求或重定向到安全模板;否则正常生成回复。
  • 兼容 LangChain / Guardrails 等应用框架,可作为 Guard 模块接入。
  • 与现有基于规则或困惑度过滤的方案互补,提供模型内部语义层面的异常检测信号。

具体落地 Use Case

  • 电商平台客服机器人:某国际电商使用 Llama-3 提供多语言客服。攻击者尝试通过角色扮演提示绕过限制生成虚假折扣码或竞品诋毁文案。部署本方法后,在用户输入的 token 序列经过第 22 层时,熵单调性特征触发告警,系统直接返回预设安全回复,避免不当输出,保护品牌形象,且额外延迟仅增加约 2 ms。
  • 社交媒体内容审核助手:某内容平台采用 Gemma 模型辅助自动审核,需防止越狱攻击产生仇恨言论。将我们的检测器集成到推理管道,对每条用户 Prompt 实时分析中间层熵动态,将越狱请求拦截在生成之前。对比实验显示,该方法在多个对抗基准上 AUC 平均达 0.92,无需对审核模型进行任何微调,显著降低人工复审负担。

局限

  • **依赖单一信息源(预测熵)**:本文完全基于 token 级别的预测熵动态来捕获越狱信号,未结合其他潜在有效的内部表示(如注意力模式、隐藏状态方向)。虽然熵在实验中表现出色,但对抗性攻击未来可能通过刻意压低或平滑熵轨迹来绕过检测,单一特征可能被针对性破坏。与一些利用表示线性探测或自编码器重构误差的防御相比,本方法的鲁棒性上限尚不清楚。
  • **logit lens 近似的局限性**:通过 logit lens 读取中间层的预测分布是一种高效但粗糙的近似,它假设各层的残差流可以直接投影到词表空间,忽略了中间层可能编码了更丰富的非词汇信息。这种近似可能导致某些层(尤其是底层和顶层)的熵估计失真,影响动态特征的可靠性。此外,该方法要求模型为冻结的、无状态改变的推理,无法适应需要微调或自适应防御的场景。
  • **评估基准的覆盖与安全集合偏移敏感性**:论文主要在标准越狱基准(JailbreakBench、AdvBench 等)上验证,但真实世界攻击更复杂多变;文中也指出检测性能对“安全”提示的分布敏感(例如 JailbreakBench 的 benign 集降低了可分离性),说明方法需要谨慎选择对比分布,这在开放域应用中可能面临冷启动问题。此外,跨模型泛化实验虽然显示了一定的一致性,但并未涵盖规模梯度(如 7B vs 70B)或指令微调版本差异的详尽分析,实际部署时的稳定性仍有待验证。
论文Sofiia Nikolenko2026-06-23原文

相关内容