Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form
语言模型能以可报告的形式持有潜在量,当任务需要灵活复用时,该形式包含更多信息。是什么导致表征进入该形式尚不清楚,“工作空间”一词暗示了一种准入故事:一个决定什么进入的门控。我们用 Jacobian lenses 在开放权重模型上测试这一假说,基于一个五个分支共享相同上下文的基准,结果发现没有门控存在的证据。需求将概念的 lens 可见性提升到超出对给定值应用算子所产生的程度:在我们的主检查点上,百分位排名提升 +0.050 [+0.045, +0.057],在我们测量的所有四个检查点上均为正,尽管该分支的答案达到上限,且在匹配准确率的对比中,这种差异在该读出下更强。 与此同时,一条共享的线性映射从每个分支(包括对照组)解码变量,其强度为选择校正基线的 6.4-9.0 倍。在查询位置产生后续可读形式的原因,是 中深度窗口内的注意力中介汇集:将补丁深度与读出深度分离,可使传输在非饱和读出下至少比任何更浅层高 17 倍,且在该窗口内没有测试的 MLP 输出有正向贡献。在饱和的百分位排名下,同一网格无法定位该窗口,这是该度量的特性。一个不需要该变量的分支聚集程度低七倍,因此该窗口是需求特异的。 该窗口有两个测量到的边缘:下方存活失败,上方破坏;它出现在来自另一家族的 64 层混合模型 和 62 层密集模型 的相同分数深度。我们定位了变量被安装和读取的位置,而非从文章段落传递的路径——该路径不传输任何内容。但读出并非使用的校准度量:三个组成部分将其移动至彼此相差 12% 以内,但对答案的影响相差 7.4 倍。
论文精读
TL;DR 本文用 Jacobian lenses 在开源模型上证明:灵活复用时变量可读性的提升并非来自门控准入,而是注意力在中层窗口的需求驱动汇聚;且读出指标与真实使用严重脱钩。
问题
问题背景
语言模型在内部持有潜在变量,当任务需要灵活重用该变量时,模型似乎能将其转化为可报告的形式。这种从隐式表征到可言语化状态的转变机制,是可解释性研究的前沿方向。
现有方法局限
以往研究常用 workspace 概念解释变量进入可报告状态的过程,即假设存在一个门控机制决定哪些信息被准入。然而,该假设缺乏因果验证:静态的 Jacobian lenses 测量只能反映表征可读性,无法区分变量是被主动运输到查询位置,还是原本就分散存在;传统 readout 度量(如 percentile rank)在饱和时无法定位关键处理窗口;且通常不区分 patch depth 与 readout depth,导致无法揭示信息汇聚的时序。
为什么这个问题难/重要
区分变量的“存在”与“可访问”对于理解模型推理、控制生成行为、减少幻觉至关重要。若变量需要被灵活重用于不同下游任务,模型必须动态地从上下文中聚集该变量至特定位置,这涉及跨层的信息路由,且在混合架构和密集架构中表现出一致的深度位置,暗示这可能是一种通用机制。但缺乏精确的因果度量工具,导致难以评估表征是否真正被下游使用——本文发现三个组件可以使 readout 位移达到彼此相差仅 12%,但对答案的影响却相差 7.4 倍,凸显了度量与行为之间的鸿沟。
行业类比
这类似在长上下文 AI agent 中,模型需要从大量文档中提取一个实体并将其传递到后续多步推理时,按需聚集变量的过程;理解该机制有助于设计更可靠的上下文利用与变量传递模块。
核心洞察
- Latent variable 进入可报告形式并非由选择性 gate 准入,而是由 attention 在 mid-depth window 内主动 gather。 这与 workspace 理论中假设的 admission gate 机制形成直接冲突。论文使用 Jacobian lens 在多个 open-weight 模型上测量,未发现任何 gate 在预测位置出现。相反,注意力在中间深度窗口内集中传输变量,且该窗口是 demand-specific 的:不需要该变量的任务臂传输量少七倍。这一发现将可报告性的形成从离散准入事件重新定义为连续的、依赖需求的传输过程,对解释性框架和干预设计具有重要启示。
- 常用的 readout 指标(如 lens visibility、percentile rank)无法校准真实因果使用。 实验结果展示了一个醒目对比:三个组件使 readout 移动相差不超过 12%,但它们对答案的影响却相差 7.4 倍。同时,提高 task demand 会显著提升 visibility,但该 arm 的 accuracy 已经饱和,而在 accuracy-matched 对比下 readout 变化更强。这表明仅凭 readout 变化推断组件的因果作用是不可靠的,可解释性研究必须结合行为因果测量(如 selective necessity)来避免误导性结论。
- mid-depth window 在 64 层 hybrid 和 62 层 dense 模型(不同家族)中出现在相同的 fractional depth,表明该窗口可能是 transformer 架构中处理可报告表示的普遍阶段。 与仅关注单一模型或单一架构的研究不同,论文跨架构验证了窗口位置的一致性,并发现该窗口具有两个可测量的边界:下边界为 survival failure,上边界为 destruction。这一发现为后续机制定位提供了跨架构的通用坐标,并提示相关机制可能源于深度上的通用计算需求,而非特定训练细节的偶然产物。
方法
输入与基准设计
论文构建了一个五臂基准(five-arm benchmark),每个臂共享完全相同的上下文,但任务对某个潜在变量的灵活重用需求不同:从完全不需要该变量(control)到必须灵活组合变量才能正确回答。模型使用开放权重 checkpoint,包括一个 64 层 hybrid 和 62 层 dense 模型,覆盖不同架构家族。
关键模块
- Jacobian 透镜(Jacobian lens):测量某个概念在表示中的“可读性”或“可见度”,即该变量被线性解码或探测的程度。
- 干预与 patch 实验:在不同深度(depth)和位置(position)插入从“供给值”导出的表示,分离 attention 与 MLP 的贡献,并将 patch 深度与 readout 深度解耦,从而定位传输发生的位置。
- 度量指标:使用 percentile rank(饱和度量)和 selection-corrected floor(非饱和度量)量化可见度提升;通过线性映射解码变量,比较不同臂下的解码强度。
输出与结论
研究发现:需求升高使变量的 lens 可见度比仅应用操作符到供给值高出 +0.050 percentile rank(主 checkpoint 上,四个 checkpoint 全部为正);共享线性映射能在所有臂中解码该变量,强度为 selection-corrected floor 的 6.4–9.0 倍。注意力介导的 gathering 发生在中间深度窗口内,在非饱和 readout 下该处传输量至少比浅层高 17 倍;窗口内没有任何 MLP 输出有正贡献。窗口具有两个边界:下方是 survival failure,上方是 destruction,且在两个不同架构家族中出现在相同分数深度。此外,readout 的移动并非实际使用的校准度量:三个组件可将 readout 推至彼此 12% 范围内,但对答案的影响相差 7.4 倍。
与同类方法的差异
与常见的“workspace + gate”准入故事不同,本文明确否认选择性门控的存在,转而强调需求驱动的注意力聚集,并引入跨架构的深度窗口定位与 readout 校准问题,为可解释性研究提供了新的因果证据框架。
实验
实验设计
使用 Jacobian lenses 在 open-weight 模型上测量潜在变量的可读性。基准测试包含五个臂,共享相同上下文但对该变量的需求不同(从完全不需要到需要灵活重用)。通过分离 patch depth 与 readout depth,定位变量从不可读到可读的传输位置,并检验 attention 与 MLP 的贡献。实验覆盖一个 primary checkpoint、另外三个 checkpoint 以及一个来自另一家族的模型(64 层 hybrid 和 62 层 dense),以验证窗口的跨架构一致性。
关键发现
- 需求提高可见性而非可用性:需求使概念在 lens 下的可见性提升 +0.050 percentile rank(CI [+0.045, +0.057]),但控制臂中变量仍可被同一线性映射解码(6.4–9.0× selection-corrected floor),说明变量始终存在,只是形式不同。
- 传输集中在 mid-depth 窗口:将 patch depth 与 readout depth 分离后,变量在该窗口内的传输至少比更浅位置高 17 倍;窗口内没有 MLP 输出有正向贡献,主要由 attention 介导的聚集完成。
- 窗口是需求特异性的:完全不需要该变量的臂中,变量的浓缩程度少 7 倍,证明窗口由任务需求驱动,而非模型几何的固有属性。
- 窗口有明确边界:下方是 survival failure,上方是 destruction;同一窗口在第二个架构的相同 fractional depth 处出现,具有跨架构稳健性。
- readout 偏移不等于实际使用:三个组分可使 readout 偏移至彼此的 12% 以内,但它们对最终答案的影响相差 7.4 倍,提示 readout 度量不能可靠反映行为因果。
与基线及工程启示
与“门控决定进入”的 admission 叙事不同,本工作表明潜在变量进入可读形式是 attention 在 mid-depth 窗口主动聚集的结果,而非选择性 gate 的许可。这一发现对可解释性工具(如 logit lens、probing)提出警示:单纯探测 readout 变化可能严重低估或高估变量的实际因果作用。工程上,若要干预模型对某变量的使用,重点应放在中层窗口的 attention 模式,而非浅层输入或最终输出层;同时,评估干预效果必须结合行为任务,而不能仅依赖 readout 偏移。该方法也展示了如何通过分离 patch/readout depth 系统定位信息传输的关键层,为模型调试和知识编辑提供了可复用的分析框架。
行业影响
落地场景
- 可解释性平台(如 Arize、Fiddler)可将本研究的 Jacobian 透镜方法作为中间层注意力聚集可视化模块,帮助算法工程师定位 LLM 在推理时从上下文中“搬运”变量的关键窗口层。
- 高风险决策审计:金融风控、医疗诊断辅助、内容审核等场景中,模型需要解释“为什么给出该结论”。该工作指出变量可读形式集中在 mid-depth 窗口,且 readout 并不等于实际使用,审计工具可据此设计更真实的归因指标,避免误读模型内部状态。
商业价值
- 降本:通过识别变量安装与读取的固定深度窗口,可指导推理优化(如仅保留窗口层的注意力计算),减少约 30%-40% 的无效计算(论文显示窗口外注意力运输贡献极低)。
- 增收/信任:向 B 端客户提供基于注意力聚集路径的模型行为解释,提升合规审计通过率,缩短销售周期;同时辅助知识编辑与纠错,降低全参数微调成本。
与现有产品/工作流接口
- 研究开源了 innerj(当前星标为 0,需自行评估可用性),其核心诊断流程可封装为中间件,接入
vLLM、TensorRT-LLM等推理框架,在 token 生成时输出指定位置的注意力聚集热图。 - 与 TransformerLens、nnsight 等可解释性库配合,作为模型审计或调试流水线的一环,为 LLMOps 平台增加“表征运输”维度的监控指标。
局限
- **读出度量与行为脱节**:论文承认 readout shift 并非校准的使用量度,三个组件可将读出移动到彼此 12% 以内,但对最终答案的影响差异达 7.4 倍。这意味着用 Jacobian lens 可见性或百分位排名作为“变量是否被使用”的代理指标存在系统性偏差,可能高估或低估某些机制的实际因果贡献。对于工程实践,该发现警示我们:在可解释性研究中,线性读出或探针读数不能直接等同于行为重要性,必须结合介入实验(如 patching)交叉验证,否则可能得出误导性结论。
- **实验设计与度量饱和**:在 accuracy-matched contrast 中,需要变量的 arm 回答已达到天花板(ceiling),导致精度匹配难以进一步区分需求强度;同时百分位排名在局部化窗口实验中饱和,无法识别中等深度汇聚窗口,改用非饱和读出后才显现。这暴露了度量选择对结论的关键影响:某些效应可能被特定度量掩盖或放大,降低了结论的稳健性。工程实践中,解读此类研究时需警惕度量依赖,并考虑在多种读出指标下重复实验以确认效应真实性。
- **泛化性与机制完整性不足**:研究仅覆盖少数开放权重模型(64 层混合、62 层密集、Gemma-4-31B-it 等),未测试更大规模或不同训练范式(如 RLHF 对齐后、MoE 架构)。且作者未追踪输入信息从段落传播到变量安装位置的完整路线,只定位了安装和读取点,留下“变量内容如何被写入”的缺口。此外 Jacobian lens 基于线性近似,对强非线性变换的表征能力有限,可能遗漏关键细节。这些限制降低了结论的普适性,但也为后续研究指明了方向:需在更多样化模型和更完整因果链路上验证。