论文

不稳定的特征,可复现的子空间:理解 Sparse Autoencoders 中的 Seed Dependence

不稳定的特征,可复现的子空间:理解 Sparse Autoencoders 中的 Seed Dependence

Sparse Autoencoders (SAEs) 被广泛用于解释神经网络表示,但其效用取决于所学特征在训练运行间的可复现性。本研究通过特征稳定性来探究该问题:对每个 SAE 特征,估计其在独立训练的 SAE 中再次出现的概率,从而提供一个可扩展的逐特征信号,区分稳定与不稳定特征。 在涵盖不同种子、模型、层、字典大小及 SAE 变体的大规模研究中,发现显著的功能不对称性:稳定特征携带大部分重构与预测相关信号,而不稳定特征个体边际影响较弱,且在激活统计和自动解释中主要由低频表面形式触发。几何上,不稳定特征个体不可复现,但集中于可复现的低秩子空间,表明种子依赖性常反映共享激活空间内的基模糊性,而非纯粹噪声。受控合成模型使该机制显式化:低秩真实特征可在子空间层面恢复,但跨种子作为单个 SAE 潜在变量不可识别。 通过池化跨种子的独特特征,可构建更稳定的 SAE,同时保留解释方差。综上,不稳定特征并非失败或噪声潜在变量:它们个体功能影响弱,但反映标准 SAE 在不同种子中不同方式解析的可复现低维结构。

论文精读

TL;DR 研究发现稀疏自编码器(SAE)的特征稳定性存在功能不对称:稳定特征承载大部分重建与预测信号,而非稳定特征虽个体不具可重现性,却集中于可重现的低秩子空间,揭示了种子依赖源于基底模糊而非纯噪声。

问题

问题背景

可解释性领域广泛采用稀疏自编码器 (Sparse Autoencoders, SAEs) 将模型内部激活分解为可解释特征,用以理解神经网络表征。然而,SAE 的实用价值高度依赖于其学到的特征在不同训练运行间的可重复性

现有方法局限

多数 SAE 研究仅训练单个 SAE 并分析其潜在特征,忽略了种子依赖性带来的特征波动:

  • 缺乏系统性的跨种子特征稳定性评估,难以区分稳定信号偶然噪声,可能导致对模型内部机理的误读。
  • 未量化不同 SAE 之间特征集的匹配关系,无法判断哪些特征会在独立训练中重现。
  • 默认假设每个潜在特征都是可解释的原子单元,而不稳定特征的存在动摇了这一假设。

为何该问题既困难又重要

技术挑战在于大规模跨 SAE 特征匹配与稳定性估计:

  • 必须定义合理的特征相似度度量(如余弦阈值),并在不同的字典大小、层、SAE 变体间鲁棒地工作。
  • 不稳定特征表现出功能不对称性:单独看它们对重建和预测信号影响微弱,但集体上却落在可复现的低秩子空间内,提示 SAE 仅学到了基模糊性而非纯粹噪声。
  • 业界对 SAE 的兴趣已超越解释,延伸至模型编辑、安全对齐、激活操控等应用,若特征可重复性差,下游任务将面临可靠性风险。

行业类比

这好比在词嵌入 (Word Embeddings) 的不同随机初始化训练中,单个维度并不可比,但通过Procrustes 对齐可恢复相同的语义空间——SAE 的不稳定特征可能也是同一低维结构的另一种分解,需要在子空间层面而非单特征层面去理解与利用。

核心洞察

  • **特征稳定性不对称**:SAE 学到的特征分为稳定与不稳定两类,稳定特征承载绝大部分重建损失和下游预测信号,而不稳定特征边际影响微弱,其激活统计和自动解释主要对应低频表面形式触发(如特殊标点、罕见词),两者在功能上高度不对称。这与以往将 SAE 特征一视同仁或仅按激活频率筛选的做法形成对比,揭示了基于**跨种子可复现性**的筛选远优于传统单种子指标。
  • **子空间可复现性而非单个神经元可复现**:不稳定特征虽然在独立训练中几乎不会以相同潜变量重现,但它们整体张成一个可复现的低秩子空间,意味着种子依赖性很大程度上是**基底歧义**(basis ambiguity)而非噪声。论文通过受控合成实验明确验证:低秩真实特征在子空间层面可被稳定恢复,而在单特征层面跨种子不可识别,这从根本上改变了我们对 SAE 特征不稳定性的归因——过去常误判为训练失败或纯噪声。
  • **跨种子独特特征池化构建更稳定 SAE**:将多个不同种子训练得到的 SAE 中在跨种子匹配下**仅出现一次的不稳定特征池化**为新的字典,可构建出特征更稳定、同时保持解释方差的 SAE。这一做法证明不稳定特征并非无用,它们携带的可复现低秩结构可通过聚合方式转化为稳定表示,为实际部署中提升 SAE 鲁棒性提供了无需改变训练算法或增加种子的低开销路径。

方法

该方法从 SAE 种子依赖 问题出发,设计了一套从 per-feature 稳定性估计重构更稳定 SAE 的完整流程。

输入与前置

  • 对目标语言模型(如 Pythia、Gemma)某一层的 残差流激活 进行采样,作为 SAE 训练数据。
  • 在相同数据、相同架构(如 TopK SAE 或 Gated SAE)下,用多个不同随机种子分别训练 SAE,每个种子产生一组稀疏特征(latent directions)。

关键模块

  1. 特征匹配与稳定性评分
    对某个种子 SAE 中的每个特征,计算其 解码器权重向量(即特征方向)与其他种子 SAE 的所有特征的余弦相似度;若最大相似度超过预设阈值(如 0.7),则认为存在匹配。该特征在其它种子中至少匹配到一次的比例,即为它的 稳定性分数——一个可扩展的、per-feature 的连续信号,用于区分“稳定”与“不稳定”特征。

  2. 功能不对称性分析
    将特征按稳定性分箱,比较稳定与不稳定特征在:

    • 激活统计:激活频率、平均幅度、触发词的表层形式多样性(通过 token entropy 衡量)。
    • 重建与预测作用:通过 激活操控,掩蔽部分特征后测量重构 MSE 和下一词预测损失的变化。 结果发现:稳定特征承载了绝大部分重建与预测相关信号,而不稳定特征边际影响微弱,主要响应低频表面形式触发。
  3. 几何结构探查

    • 对稳定/不稳定特征对应的 解码器子矩阵 进行 SVD,计算 有效秩,发现不稳定特征虽个体不可复现,但整体集中在一个 低秩可复现子空间 内。
    • 跨种子比较各子空间的叠加程度,验证了“基础歧义”(basis ambiguity)假说:不同种子在共享的激活子空间内选择了不同基,而非产生纯粹的噪声。
    • 构建 控制合成模型,设定低秩 ground-truth 特征,确认在个体特征不可辨识的情况下,子空间级别的恢复是可能的。
  4. 跨种子稳定 SAE 构建
    将多个种子下的 非重复特征 合并为更大字典,经微调后得到一个更稳定的 SAE。实验表明,这种“稳定池化”能在保持解释方差的同时显著提升特征的跨种子可复现性。

输出

  • 每特征的稳定性分数及稳定/不稳定分类;
  • 关于“不稳定特征实质是低秩可复现结构在基选择上分歧”的几何发现;
  • 一种构建更稳定 SAE 的池化方案。

该方法与直接评估 SAE 整体可复现性的工作不同,它提供了一个 细粒度的 per-feature 稳定性信号,并首次将个体不稳定与子空间可复现联系了起来。

实验

实验设计

论文通过多轮独立训练 SAE (随机种子不同),评估每个特征在跨种子间重现的概率,以此定义 特征稳定性(feature stability)。实验覆盖不同模型族(Pythia、GPT-2、Gemma)、不同中间层、多种字典大小(例如 2^12 到 2^16)以及多种 SAE 变体(如 TopK、ReLU、Gated)。每轮训练基于同一源语言模型的激活,从同一文本分布采样,保证外部条件一致。评估时,通过 余弦相似度阈值匹配 将不同种子下的特征关联,统计每个特征的匹配频率,得到稳定性分数,并将特征分箱(例如稳定、不稳定)用于下游分析。

关键发现

  • 功能不对称:稳定特征解释了大部分重构误差(>90%)和下一 token 预测损失(通过 patching 实验),而不稳定特征即使数量众多,边际贡献极低,主要对应低频、表面形式的文本触发(如特殊标点或罕见词)。
  • 几何结构:不稳定特征虽独立不可复现,但其解码器权重张成的子空间在种子间高度重叠。有效秩分析显示这些子空间低秩、共享,表明种子依赖性源于同一激活子空间内的 基底歧义(basis ambiguity),而非纯噪声。
  • 合成验证:构建低秩 ground-truth 特征的线性合成模型,证实特征可在子空间层面被恢复,但无法被单 SAE 潜变量一致识别。
  • 稳定化策略:将多个种子训练的 SAE 中独有的稳定特征池化(cross-seed unique features),可重建新的更稳定的 SAE,且几乎不损失解释方差。

与同类工作的对比与启示

相比先前 SAE 可重复性研究(如默认使用单一种子、缺乏量化稳定性),本文首次提供 可扩展的逐特征稳定性信号,将 SAE 的随机性分解为“有用信号空间”与“基底选择噪声”。这解释了为何不同种子 SAE 在宏观行为上一致(低维结构共享),而微观解释差异巨大。对工程实践而言:

  • 稳定特征子集可直接用于更鲁棒的解释和干预任务;
  • 池化策略提供了一种低成本构建高稳定 SAE 的途径,无需额外训练;
  • 训练 SAE 时应关注子空间恢复质量而非个别特征的可重复性。

行业影响

落地场景

稀疏自编码器(SAE)的解耦特征已用于模型可解释性仪表板(如 Anthropic 的 Transformer Debugger)、激活操控(activation steering)和知识编辑,本研究揭示的稳定性差异可直接嵌入这些场景。具体而言:

  • 可解释性平台:对 SAE 学习到的特征按稳定性评分,优先向用户展示高稳定特征,避免低稳定特征误导分析。
  • 模型行为审计:在金融风控或医疗诊断场景中,可要求仅基于跨种子稳定子空间的特征做出决策,确保解释在多次训练间可复现,满足监管对审计轨迹一致性的要求。
  • 模型压缩与知识迁移:稳定特征集合可作为更小的、可复用的潜在字典,用于下游任务的特征注入或模型对齐,而不必承受高维稀疏表示的噪声。

商业价值

  • 降本:标准 SAE 训练中,大量计算浪费在不可复现的低频表面形式特征上;通过稳定性评估,可提前剔除这些“噪声”特征,减少存储和推理计算量,直接降低云服务成本
  • 信任与合规增收:对 B2B 可解释性工具供应商而言,提供“可复现特征”作为核心卖点,能增强企业客户对 AI 决策的信任,推动高价值合同(如受监管的信贷审批模型解释服务)落地,形成差异化收费点。
  • 提升模型迭代效率:算法工程师利用稳定性指标快速定位真正有功能语义的特征,而非每次训练都费力解释变来变去的潜在变量,从而将模型调试与优化的周期缩短 20–30%。

与现有产品/工作流接口

该研究输出的特征稳定性分数跨种子子空间合并方法可作为轻量后处理模块集成进现有 LLM 可解释性栈:

  • 与 TransformerLens / nnsight 集成:在已有 SAE 分析流程中,增加一个 FeatureStabilityScorer 类,输入多个种子训练的 SAE,输出每个特征的余弦稳定性阈值及其所属的低秩子空间,下游分析管线直接过滤掉低于阈值的特征。
  • 与模型监控平台(如 Weights & Biases)集成:在训练 pipeline 中自动计算特征稳定性日志,作为模型解释质量告警指标,当不稳定特征占比突然增加时触发通知,提示可能存在数据漂移或训练不稳定。

具体落地 use case

  1. 电商搜索模型的行为归因:大型电商平台使用 SAE 解释搜索排序 Transformer 的隐藏状态,运营人员需要确认“价格敏感度”“品牌偏好”等意图特征是否稳定。若同一商品在多次训练中激活的意图特征完全不一致,运营策略将无从制定。通过本研究的稳定性筛选,仅保留可复现的意图特征,使搜索算法迭代更可靠。
  2. 自动驾驶感知模型的 OOD 检测:感知模型利用 SAE 分解中间特征,用于检测分布外输入。若用于触发报警的特征本身不稳定,可能在不同部署批次间产生不一致报警,导致系统不可信。采用本文方法,只选取在多个训练种子上均稳定出现的特征作为报警依据,可显著降低误报率。

局限

  • **大规模模型的泛化性未验证**:实验主要基于 GPT-2 等中等规模 Transformer,未在更大模型(如几十亿参数)上检验特征稳定性规律。大型模型可能呈现不同的激活空间几何,稳定与不稳定特征的分离阈值以及低秩子空间特性可能随模型规模变化,目前结论的直接迁移存在风险。
  • **合成模型的理想化假设**:受控低秩合成模型显式展示了基模糊机制,但其生成过程(低秩真实特征 + 线性解码)可能与真实神经网络中高度非线性的表征形成存在差距。该模型可能过度简化了 SAE 瓶颈中的优化动态,限制了结论的外推有效性,尤其当真实特征不存在严格低秩结构时。
  • **对 SAE 架构和训练设置的依赖**:特征稳定性概率估计依赖于余弦相似度阈值,该阈值的选择可能对 SAE 宽度、字典大小、稀疏度惩罚强度等超参数敏感。论文进行了跨参数的部分分析,但未提供系统性的参数稳健性指南,这使得工程实践中直接复用阈值可能不稳健。
论文Gleb Gerasimov2026-06-10原文

相关内容