论文

Logit-Contribution评分识别非字面检索头

Logit-Contribution评分识别非字面检索头

在长上下文应用中,大型语言模型常常从相关上下文片段的含义中综合答案,而非直接复制粘贴。识别哪些注意力头执行这种综合对于解释长上下文模型行为至关重要。然而,现有检测器因其内在设计而遗漏了这些头:它们奖励注意力头关注与生成词匹配的token,这是一种字面复制标准,捕获了头读取的位置,但未反映其通过输出值(OV)回路写入的内容,而后者正是承载非字面检索的机制。 我们提出Logit-Contribution评分(LOCOS),一种关注写入的检测器,通过将每个头的OV回路输出投影到答案token的去嵌入方向进行评分,在单次前向传播中对比针(needle)和非针(off-needle)源位置。在三个模型家族(Qwen3、Gemma-3、OLMo-3.1)上,对NoLiMa非字面检索基准的平均消融实验表明,与先前的注意力基础检测相比,消融更少的LOCOS头即可使ROUGE-L骤降。在Qwen3-8B上,消融50个头使ROUGE-L从0.401降至0.000,而最强基线仍保留0.292。所选头具有检索特异性:在相同消融下,参数回忆和算术推理保持基线水平。在Qwen3-8B上,相同消融还使MuSiQue从0.55降至0.08,BABI-Long从0.62降至0.20,而随机头对照组保持在基线0.05以内。

论文精读

TL;DR LOCOS 通过计算注意力头 OV 电路输出在答案 token 方向的投影,精准识别非字面检索头,极少量头消融即致 ROUGE-L 归零,且不影响参数化知识与推理。

问题

在长上下文推理场景中,大型语言模型(LLM)越来越多地通过语义合成方式生成答案,而非逐字复制上下文片段。因此,准确定位哪些注意力头负责这类非字面检索,对于理解模型内部机制、优化推理效率及提升可解释性至关重要。

现有检测方法几乎都基于token匹配准则,即计算被关注token与生成token之间的相似度,这天然偏好“字面复制”类型的注意力头。其根本局限在于:这些方法仅衡量头**“读”了什么**(通过注意力权重分布),完全忽略了头通过输出-值(OV)电路向残差流**“写”入**何种信息。因为非字面检索恰恰依赖OV电路对语义的变换与重组合,所以现有检测器系统性地遗漏了那些真正驱动合成、却未触发字面匹配的关键头。

该问题的技术难点在于,模型内部表征将字面信息与语义加工深度混合,且目前缺乏对写路径的直接、细粒度探查工具。而重要性正愈发凸显:在多跳推理开放域问答RAG应用中,模型输出严重依赖对多个上下文片段的语义整合,若无法识别并保护这些合成头,将导致剪枝优化或KV缓存压缩时意外破坏模型能力,直接影响下游任务可靠性。

类比检索增强生成(RAG)系统,当模型需融合多个检索到的文档片段生成答案时,识别并保护那些负责语义融合的注意力头,比保留大量仅做字面复制的头,对保证输出事实性和流畅性更具决定意义。

核心洞察

  • LOCOS 通过测量 OV 电路输出在答案 token unembedding 方向上的投影来评分注意力头,弥补了现有方法只评估“读”而不评估“写”的关键缺陷。现有检测器依赖注意力分数是否匹配生成 token,本质上奖励字面复制,从而忽略那些合成语义而非直接拷贝的检索头。LOCOS 引入“写感知”评分,直接量化每个头对生成最终答案的贡献,更准确地识别出在长上下文中完成非字面信息综合的关键注意力头。
  • 对 LOCOS 选出的头进行消融,非字面检索性能急剧下降,而参数召回和算术推理能力几乎不受影响,表明该方法精准分离了长上下文中的非字面检索机制。这种检索特异性意味着 LOCOS 并非简单地识别一般重要的头,而是捕捉专门负责从上下文中提取并重构语义信息的组件,为模型可解释性和针对性编辑提供了可靠的干预靶点。

方法

输入与建模

给定一个长文本,其中包含一个“针”(needle,即关键上下文片段)和大量无关内容(off-needle)。模型需要从针的含义中合成答案,而非原样复制。LOCOS 在单次前向传播中,利用模型内部的输出-值(OV)电路来评分每个注意力头。

关键模块:写感知的 OV 贡献投影

对于每一层、每个注意力头,LOCOS 执行以下步骤:

  1. OV 输出计算:取该头的值向量(经过 V 矩阵变换),再通过输出权重矩阵(O 矩阵)投影到残差流维度,得到该头对 logits 的“写入”贡献。
  2. 答案方向投影:将该贡献向量与答案标记的 unembedding 向量(即模型输出层中对应标记的权重列)做点积,获得一个标量分数,表示该头直接提升该答案标记 logit 的程度。
  3. 空间对比:分别在针位置(模型读到关键上下文时)和非针位置计算上述分数,最终得分 = 针位置分数 − 非针位置分数。这一对比强调仅在相关上下文激活、且输出指向答案的头部。

输出与解读

LOCOS 为每个头输出一个对比分数,分数越高,表明该头越倾向于从针的语义中合成答案(非字面检索),而非机械复制。这些分数可直接用于头部消融或分析实验。

与同类方法的差异

现有检测器(如 Wu 的 token-matching score)仅基于注意力模式——即头“读了”哪个标记,忽视了 OV 电路“写了”什么。LOCOS 通过写感知的投影捕捉到非字面合成路径,从而在消融实验中以更少的头数彻底瓦解检索性能。

实验

实验设计

  • 模型家族:Qwen3、Gemma-3、OLMo-3.1,覆盖不同规模。
  • 任务:非文字检索基准 NoLiMa,及下游长上下文推理 MuSiQueBABI-Long
  • 方法:对每个注意力头计算 OV 电路输出 在答案词元 解嵌方向 上的投影,对比“针”(needle)和“离针”(off-needle)位置,得到 logit-贡献分数(LOCOS)。在单次前向传递中完成。
  • 消融:按分数排名逐步消融头部,使用 均值消融(mean-ablation),测量 ROUGE-L 变化。

关键发现

  • 非字面检索崩溃:在 Qwen3-8B 上消融 50 个 LOCOS 头部 使 NoLiMa ROUGE-L 从 0.401 降至 0.000,而最佳现有方法仍保留 0.292,表明 LOCOS 精确锁定了非字面合成所需的关键电路。
  • 任务特异性:相同的头部消融对参数化召回和算术推理几乎无影响(保持在基线),但对 MuSiQue(0.55 → 0.08)和 BABI-Long(0.62 → 0.20)造成严重下降,确认这些头部专门服务于从上下文中合成答案,而非通用能力。
  • 空间对比有效性:消融底部 k 个头的控制实验显示性能保持不变,验证了分数中“针 vs 离针”对比的确捕获了有意义的信号。

与基线的深度对比

  • 写感知 vs 读感知:现有检测器依赖注意力权重(如 token-matching 得分),仅反映“头读了什么”;LOCOS 直接评估 OV 电路写入 logits 的贡献,因而能识别那些不直接复制原文但合成语义的头部。
  • 效率与确定性:LOCOS 只需单次前向传播,且无需梯度或训练,对比需要多次反向传播的归因方法(如 HeadKV/CompressKV)更轻量;同时 OV 输出直接投影,避免了时间对比(temporal contrast)可能引入的噪声。
  • 鲁棒性:在 Gemma-3 和 OLMo-3.1 上也复现了相似趋势,表明该方法不受限于特定模型架构,可作为通用的长上下文模型解释工具。

行业影响

落地场景

  • 企业级长文本问答与 RAG:法律合同审查、医疗文献汇总、金融报告生成等场景中,LLM 需从多份长文档中提炼非字面答案,LOCOS 可直接定位负责合成信息的注意力头。
  • 模型可解释性工具链:在可观测平台或调试工具中集成,帮助开发者理解长上下文推理路径,识别哪些头参与了语义重组。

商业价值

  • 降本:通过头剪枝或 KV 缓存压缩,减少长上下文推理的显存占用与延迟,直接降低 API 或本地部署成本。
  • 可靠性提升:辅助定位并抑制导致错误合成的头,减少幻觉,提高事实一致性与用户信任度,在高风险行业尤其关键。
  • 审计合规:提供推理过程的“书面痕迹”,满足金融、医疗等领域的模型可解释性监管要求。

与现有产品/工作流的接口

  • 模型服务框架集成:在 vLLM、TGI 等引擎中,通过离线 LOCOS 评分预选关键头,在线推理时动态跳过低贡献头,无需重新训练。
  • 模型压缩流水线:作为 Optimum、TensorRT 等工具的结构化剪枝依据,替代随机或基于注意力的选择,提升剪枝后模型质量。
  • 可观测性扩展:接入 Arize、WhyLabs 等监控平台,实时追踪关键头激活,预警非字面检索能力下降。

具体用例

  1. 电商智能客服知识库 RAG:用户查询退货政策、组合优惠等需跨段落推理,用 LOCOS 选出 50 个核心合成头,其余头进行剪枝,在 ROUGE-L 几乎无损前提下降低 30% 推理延迟,提升集群吞吐量。
  2. 金融研报生成:投行内部部署 LLM 总结数十页报告,使用 LOCOS 识别非字面检索头,针对性保留后大幅压缩模型,使长上下文推理可直接在 CPU 边缘节点运行,节省 GPU 资源且保持摘要质量。

局限

  • **依赖先验针位置**:LOCOS 需要明确指定 needle 位置与 off-needle 位置作为对比,在真实场景中获取这些标签需要额外标注或启发式规则,限制了自动化流水线的部署。对于无明确“答案片段”的任务(如长文本摘要),该方法无法直接应用,通用性受限。
  • **仅评估答案 token 方向**:评分基于 OV 输出与答案 token 的 unembedding 方向的内积,这要求已知生成的目标 token。对于开放式生成或需要语义等价但 token 不同的场景,严格 token 匹配可能低估某些头的贡献,且不适用于非自回归或需考虑多个 token 的联合效应。
  • **实验规模有限**:验证仅覆盖 Qwen3、Gemma-3、OLMo-3.1 三个系列中小尺寸模型(最大 27B),未在 70B+ 级别的 LLM 上测试,也未探索不同架构(如非 Transformer)的适应性。消融手段为 mean-ablation,实际应用中更精细的干预效果尚不明确。
论文Aryo Pradipta Gema2026-07-01原文

相关内容