Sparse Readout Prism:以特征而非词元解释 Logit-Lens 分数
语言模型对下一个词元的预测是逐层发展的,而透镜方法(lens methods)通过将中间隐藏状态解码为词元来追踪这一过程。然而,透镜读数既反映隐藏状态,也反映用于解码的读出矩阵(unembedding matrix)。许多透镜是在语料上拟合的,我们证明:两个仅拟合语料不同的透镜,对同一隐藏状态可能报告不同词元,此现象称为语料条件性。为独立于拟合语料考察读出结构,我们提出 Sparse Readout Prism(SRP),它仅利用读出权重进行分解,并将任意词元 logit 或 logit 差表示为稀疏读出特征贡献之和。 SRP 揭示了读出特征作为透镜分析的新分析单元,能暴露词元身份所掩盖的结构,并支持跨词元、上下文、层和透镜的比较。实验中,用 SRP 的稀疏近似替换原始读出,对测试 logit 差的重构比基于读出行几何关系的六种最强基线高出 8.9–17.3 个百分点。消融特征会使 logit 差按其 SRP 贡献比例移动。尽管词元读数随拟合语料变化,主导读出特征保持稳定。由于 SRP 构建不依赖语料,它为透镜分析提供了独立于拟合语料的对照。
论文精读
TL;DR SRP 将 unembedding 矩阵分解为稀疏 readout features,用特征贡献解释 logit-lens 读数,替代 token 级读数,从而剥离拟合语料库造成的条件性偏差,并稳定复现大部分 logit differences。
问题
问题背景:可解释性研究关注语言模型如何从输入逐层构建下一 token 预测。lens methods(如 logit lens、tuned lens)通过将中间隐藏状态解码为 token 分布来追踪这一过程,已成为分析模型内部表征演化的常用工具。
现有方法局限:lens 读数由隐藏状态和用于解码的 readout 矩阵(unembedding 矩阵)共同决定,但许多 lens 需要在语料库上拟合解码器,引入 corpus conditionality——同一组隐藏状态,仅因拟合语料库不同,lens 可能报告不同 token。这使得读数难以区分哪些模式来自模型真实表征,哪些来自拟合语料库的偏好。现有几何方法(如利用 readout 行向量相似度或方向)无法充分解释 logit 差异,也缺乏对 readout 内在结构的独立分解。
为什么难/重要:readout 矩阵维度高(词表大小 × 隐藏维度),行向量虽与 token 一一对应,但 token 间语义关系不能简单映射为行向量几何关系;同时,大量下游分析(如干预实验、归因)依赖 lens 读数,如果读数受语料库污染,结论可靠性存疑。因此,可解释性工具需要提供与训练数据无关的对照基线,以验证发现的稳健性。
行业类比:类似推荐系统中对用户-物品交互矩阵做稀疏因子分解以提取可解释的偏好因子,避免仅依赖特定日志数据带来的偏差;SRP 为语言模型输出层提供了无语料库先验的分解视角。
核心洞察
- SRP 在参数空间而非激活空间对读出矩阵做稀疏分解,将 logit 差异归因于稀疏 readout features,提供了一种独立于 hidden state 和语料的分析单元。与 activation SAE 在激活空间中寻找特征不同,SRP 直接分解 unembedding 权重的行,因此不受 fitting corpus 影响。相比基于行几何的六种 baseline,SRP 对 logit differences 的重建能力高出 8.9–17.3 个百分点,说明行几何关系不足以刻画读出结构。这一视角把 lens 解释从 token 身份转向特征贡献,暴露了 token 身份可能掩盖的跨 token 共享结构。
- 论文系统揭示了 lens 方法的语料条件性:两个仅 fitting corpus 不同的 lens 可能对同一 hidden state 报告不同 token,而 SRP 不使用任何语料,可作为独立于 fitting corpus 的控制。实验表明 token readings 会随语料变化,但 dominant readout feature 保持稳定,说明特征层面的解释更稳健。对可解释性工程而言,这提示在报告 lens 结果时必须标注 fitting corpus,并将 SRP 作为无偏参照,避免把语料特定现象误认为模型通用行为。
方法
输入与目标
SRP 的输入仅为语言模型的读出矩阵(unembedding matrix / LM head),不使用任何拟合语料。目标是将读出矩阵分解为一组稀疏读出特征,使任意 token logit 或 logit 差可以表示为这些特征的贡献之和。
关键模块
- 稀疏读出特征分解:对读出矩阵的行空间进行稀疏字典学习,得到一组稀疏读出特征(sparse readout features)。每个特征对应读出矩阵中的一个稀疏方向,类似于对参数空间做稀疏自编码。
- 选择性分数分解:给定任意需要解释的 logit 或 logit 差(例如两个候选 token 的 logit 差),SRP 将其表示为各稀疏特征的贡献加权和,并追踪每个特征的贡献大小。
- 跨上下文与透镜比较:由于分解只基于读出矩阵本身,不依赖拟合语料,因此同一个隐藏状态在不同透镜(不同语料拟合的透镜)下的读数可以被放到同一特征坐标系中比较,从而识别出语料条件性造成的假象。
- 保真度诊断:使用稀疏近似后的读出矩阵替换原始读出,计算重建误差、logit 差重建率等指标,并与基于行几何关系的基线(如行向量相似度、最近邻行等)对比。
输出
SRP 输出:(1) 一组可解释的稀疏读出特征;(2) 任意 logit 差的特征贡献分解;(3) 稀疏读出矩阵保真度指标。实验表明,SRP 的稀疏近似重建 logit 差比最强几何基线多恢复 8.9–17.3 个百分点,且消融特征引起的 logit 差变化与分解预测的贡献成比例。
与同类方法的差异点
与基于 token 身份的透镜解读或基于读出矩阵行几何的方法不同,SRP 直接在参数空间中分解读出矩阵,将特征作为分析单元,从而摆脱对拟合语料的依赖,提供独立于 lens 拟合语料的控制基线。
实验
实验设计
论文在多个 LM 家族(Qwen3.5-9B、Ministral、R1-Distilled)上,用 SRP 将 LM head 分解为稀疏 readout features,并重建指定的 logit differences。比较对象包括六种基于 readout 行几何关系的基线;同时通过改变 lens 拟合语料、语言与语料大小,检验 corpus conditionality,并进行特征消融实验。
关键发现
SRP 稀疏近似在 tested logit differences 重建上,比最强几何基线多出 8.9–17.3 个百分点。消融特征引起的 logit difference 位移与 SRP 贡献成比例,说明分解具有因果可预测性。即使 token readings 随拟合语料变化,dominant readout feature 保持稳定,且不同 token 可共享同一 dominant feature,揭示 token 身份掩盖下的 readout 结构。
与基线对比
六种基线依赖 readout 行向量的几何关系,无法刻画行内部的多义结构;SRP 仅用权重本身分解,不引入拟合语料,因此可作为 lens 分析的 corpus-independent control。其重建增益表明,sparse readout features 比几何关系更接近 LM head 的真实计算单元。
行业影响
落地场景
SRP 可直接用于 LLM 可观测性与可解释性平台,尤其适合需要审计模型 next-token 决策的场景。例如,电商推荐理由生成 中,平台要解释“为什么模型推荐该商品”。用 SRP 将 logit 差异分解为稀疏 readout features,定位主导特征,判断是否来自价格、品牌或用户偏好等可审计因素,而非语料拟合的伪相关性。另一个场景是 金融/医疗合规助理:对生成内容的关键 token 差异提供特征级归因,满足监管对模型决策透明度要求。
商业价值
- 降低调试成本:SRP 提供语料无关的 readout 分解,减少因 lens 拟合语料不同导致误判,缩短模型问题定位时间。
- 减少事故风险:在模型上线前,用 SRP 对比不同版本/微调模型的 readout 特征,提前发现主导特征偏移。
- 提升用户信任:特征级解释比 token 级 lens 更稳定,可用于对外可解释性报告或模型卡片。
对实际工程而言,SRP 的稀疏近似重建比几何基线多恢复 8.9–17.3 个百分点的 logit 差异,干预效果可预测,适合作为质量门禁指标。
与现有工作流接口
已有 GitHub 实现 可直接集成。工程上建议:
- 加载模型
unembedding matrix,离线计算稀疏 readout features,存入特征库(如FAISS或列式存储)。 - 在推理侧挂接一个轻量分析器:对目标 token 的 logit 或 logit 差异调用 SRP 分解,返回 top-k 特征贡献,延迟可控制在毫秒级。
- 与现有 lens 工具(如 Logit Lens、Tuned Lens)并行运行,将 SRP 作为 corpus-independent control,输出到监控面板或 tracing 系统(如 LangSmith / Arize)中。
这样不必改造模型训练或推理主链路,只需在 readout 层外接一个可解释性组件。
局限
- **方法局限**:SRP 仅分解读出矩阵(unembedding),而透镜分数同时依赖隐藏状态与读出。尽管 SRP 消除了读出侧的语料依赖性,隐藏状态本身仍可能受训练数据分布影响,因此整体 lens 解读仍可能随上下文或训练分布偏移。此外,稀疏分解引入近似误差(论文报告了较高的重构率,但在个别 logit 差异上误差可能放大),误差传播到下游分析时可能影响结论稳健性。
- **实验范围**:论文主要在 Qwen3.5-9B 等有限模型套件上验证,虽然附录包含跨模型家族与规模实验,但核心结论的普适性仍需更多证据。稀疏度等超参数的选择对结果影响较大,论文虽然描述了选择流程,但未系统分析超参数敏感性。另外,实验中使用的重构率(8.9-17.3 个百分点提升)是针对特定基准(logit 差异),在其他评价指标或任务上的表现尚未充分展示。
- **工程落地**:该方法目前定位为可解释性诊断工具,尚未展示对下游任务性能(如生成质量、推理能力)的直接改善。对于实际工程应用,SRP 的集成成本和计算开销(训练稀疏读出特征、推理时替换读出矩阵)未充分量化。与现有激活稀疏自编码器(SAE)等工具链的整合也缺乏明确指导,对于希望在生产环境中利用该技术的团队而言,可能需要额外适配工作。