论文

Bag of Dims:基于维度级符号模式的免训练机制可解释性

Bag of Dims:基于维度级符号模式的免训练机制可解释性

我们提出 Bag of Dims 框架,证明 transformer 隐藏状态的标准基已可作为免训练、架构通用的特征表示。每个维度通过符号(+/-1)编码语义内容,通过幅度编码置信度,相当于独立的二进制寄存器;一个特征即一组具有一致符号模式的维度子集,通过计数符号一致度来读取,无需学习旋转。该框架在七个模型上验证,涵盖语言(Qwen 3.5-4B, Gemma 3-4B, Mistral 7B, Qwen3-32B)、视觉(DINOv2, ViT-Base)和音频(AST)。 实验表明,仅符号即携带预测内容:单位幅度符号模式通过 LM head 保留 60-93% top-5 下一词准确率,无解码器的 Hamming 评分达 80-90% top-4096。使用单 token 缓存(每个 token 一次前向,无上下文、无标签),通过符号一致检测 175 个类别,AUC 0.97-0.99;有监督探针仅增加 +0.018 AUC,且权重收敛至轴对齐。这些特征是因果可操作的:它们存活于 K/V 注意力投影,可追溯到写入它们的 FFN 神经元联盟(随机权重对照从不复现),在实时前向中翻转某个特征的符号可抑制其概念(幅度匹配、概念特异性)。维度保持独立(成对互信息低于 0.006 bit)。 该结构并非语言特有:相同维度符号模式出现在自监督视觉(DINOv2,9/12 ImageNet 超类)、监督视觉(ViT-Base,11/12)和音频(AST,50/50 ESC-50 类别),反映 transformer 训练的通用性,而非语言建模目标。标准基已足以在一次前向中读取特征,无需优化和 GPU 天数。开放问题从寻找正确旋转转变为编录每个维度编码的内容。

论文精读

TL;DR 发现Transformer隐藏状态的标准基直接构成无需训练的特征基:各维度正负号独立编码语义,形成可阅读、可操控的二元寄存器,在语言、视觉、音频等7个模型上验证因果有效。

问题

问题背景

Transformer 隐藏状态的可解释性研究长期受困于特征表示的非结构化——模型内部各维度的激活通常是稠密、纠缠的,研究者不知如何从中提取语义结构。当前热点包括使用稀疏自编码器 (SAE) 或线性探针寻找可解释方向,试图将隐空间旋转为可阅读的基底。

现有方法局限

主流做法需额外训练一个阅读器(探针或 SAE),成本巨大:探针依赖标注数据,SAE 训练动辄数千 GPU 小时,且学习到的“旋转”往往并非轴上对齐——这意味着每个所谓特征仍由大量维度加权构成,难以精确定位因果单元。更关键的是,旋转后的特征基底与原模型计算路径脱节,无法直接确认前向传播中哪些确切的维度参与写入与读取,割裂了表示与机制的联系。

为何困难且重要

难题在于:无任何参数训练的“自然”基底是否可能存在?若存在,则意味着模型维度本身就是独立二进制寄存器,无需任何优化的解码方案。这挑战了叠加假设——过去认为维度间必须共享表示,但若符号模式直接承载语义且维度间互信息极低(<0.006 bits),那么维度级特征即插即读将成为现实,大幅降低解释性研究的工程门槛。同时,因果操控性验证(翻转符号即可抑制概念)确认了这些特征不是虚假相关,而是功能性的计算基元,对齐了业界对理解与调试大模型内部计算的迫切需求。

行业类比

如同直接使用像素原始 RGB 值也能在图像分类中取得合理精度,本工作揭示标准基向量无需旋转已是高质量特征基底——解释性工作从“寻找最佳旋转”转向“编目每个维度的编码内容”,这类似于从手工特征工程跳跃到直接使用预训练表示的范式转换,有望将机械解释性推进到训练无关、一键式特征发现的新阶段。

核心洞察

  • **标准基维度符号本身就是轴对齐的特征基底,训练旋转几乎无增益。** 与 SAE、探针等方法需要大量优化来寻找有意义的旋转不同,Bag of Dims 发现 transformer 残差流的每个维度正负号已直接编码语义特征(+-1),幅度则编码置信度,相当于内置了二值寄存器。仅通过汉明距离计数符号一致就能以单次前向传播实现高精度概念检测和因果操控,训练一个探针只能带来 +0.018 AUC 的微弱提升,且其权重最终收敛为轴对齐。这从根本上挑战了可解释性中长期主导的“寻找正确基”范式,将问题简化为“编目每个维度编码什么”。
  • **现象超越语言模型,是 Transformer 训练的普适属性。** 该框架在语言(Qwen、Gemma、Mistral)、自监督视觉(DINOv2)、监督视觉(ViT-Base)和音频(AST)共七种模型中一致成立,跨模态表明这种维度级符号结构并非来自语言目标,而是 Transformer 架构与梯度优化自然导致的内部分布。这暗示基础模型的内部表示可能远比预想结构化,且无需额外代价即可提取全局可解释特征。对于工程实践,可直接基于单 token 缓存构建零样本分类器、审计模型概念或实现轻量级概念编辑,无需 GPU-days 训练,为部署端可解释性工具开辟了低门槛路径。

方法

输入与前提

Bag of Dims 直接以 Transformer 隐藏状态的标准基(standard basis)为输入,即层归一化后的残差流向量,无需学习任何旋转矩阵或自编码器。框架的核心前提是:每个神经元维度本身就是一个二值寄存器,符号(+1/-1)携带语义内容幅度携带置信度,且维度间高度独立(两两互信息 < 0.006 bits)。

关键模块

  1. 标准基特征表示与汉明读取
    一个“特征”被定义为一个维度子集及一组一致的符号模式。对于任意输入向量,只需计算其与目标特征模式在对应维度上的符号一致性分数(汉明距离的变形),即可得到该特征的激活强度,无需训练参数。

  2. 单token类型缓存与零训练特征发现
    对词汇表中每个 token 执行一次前向传播,记录其残差流激活的符号(不保留幅度),形成“类型缓存”(type cache)。随后,对每个预设类别计算逐维度 AUC,选出对类别判别力最强的维度及其典型符号,自动构建特征的符号模式。整个过程无上下文、无标签、无梯度,仅依赖词汇本身的激活。

  3. 因果操控与特征定位
    在前向传播中,翻转特征关联维度的符号,即可实现对对应概念的定向抑制,且抑制效果与幅度匹配、概念特异。进一步可追溯至 FFN 神经元联盟:这些维度已轴对齐地存在于 FFN 的激活空间中,经 SwiGLU 门后仍保持符号可读性,并能在 K/V 注意力投影中存活。

输出与应用

  • 直接读取:对任意输入 token,通过符号一致性即可实现高 AUC(0.97–0.99)的概念检测,训练探针仅带来 +0.018 AUC 的微弱提升,且收敛到轴对齐权重。
  • 纯符号预测:仅用单位量级的符号模式通过 LM head,即可保留 60%–93% 的 top-5 下一 token 准确率;甚至无需解码器的汉明评分在 top-4096 上达到 80%–90% 准确率。
  • 跨模态泛化:在语言、自监督视觉、监督视觉、音频模型中均观察到相同的符号机制,表明这是 Transformer 训练的一般性质,而非语言建模特有。

与同类方法的关键差异

与需要学习旋转矩阵的 SAE/探针端到端训练的概念向量不同,Bag of Dims 证明标准基本身已是训练无关、架构通用的特征基,特征解读只需计数符号一致性零 GPU-天、零优化步骤。

实验

实验设计

实验围绕 Bag of Dims 框架,在 7 个不同模态的 Transformer 模型上验证标准基特征表示的有效性,包括语言模型 Qwen 3.5-4B / Gemma 3-4B / Mistral 7B / Qwen3-32B,自监督视觉 DINOv2,监督视觉 ViT-Base 和音频 AST

  1. 符号编码内容实验:将隐藏状态幅度统一设为 1,仅用符号 (±1) 通过 LM head 预测,评估 top-5 准确率保留比例。
  2. 维度独立性:计算隐含维度间成对互信息,验证是否独立。
  3. 特征发现:基于单 token 缓存 (每个词汇 token 一次前向,无上下文、无标签),通过符号一致性置检测语义类别 (ImageNet 超类或 ESC-50 类别),计算 AUC。
  4. 因果操控:在活跃前向过程中翻转特征符号,观察概念抑制效果。
  5. 注意力投影追踪:检查特征在 K/V 投影后的存活情况,并一路溯源至 FFN 神经元群。

关键发现

  • 幅度几乎无关:仅符号即可保持 60-93% 的 top-5 准确率,纯汉明评分 (无解码器) 也达 80-90% 的 top-4096 准确率。
  • 特征轴对齐且因果有效:从单 token 缓存发现的 175 类别的 AUC 达 0.97-0.99,线性探针仅带来 +0.018 的微幅增益,且探针权重几乎轴对齐,证实标准基已近乎最优。符号翻转可跨模型特异性抑制概念,证明特征不仅可读,更是推理过程中活跃的“运作单元”。
  • 通用性:维度符号模式在语言、视觉、音频三者中均出现,且维度间互信息极小 (<0.006 bits),表明该结构来自 Transformer 训练的共性,而非语言建模特有。
  • 可追溯性:轴对齐特征可穿过 SwiGLU 激活、存活于 K/V 投影,并定位至 FFN 神经元联盟。

与基线对比解读

相比当前主流机械可解释性方法 (如 SAE、训练有旋转矩阵的探针),Bag of Dims 揭示了训练隐藏状态无需任何额外旋转或优化即可直接使用的语义基底。传统方法需学习一组过完备基,消耗 GPU 数天,而本工作仅需单 token 前向缓存,成本极低。这种“零训练”特性颠覆了“必须找到正确基”的预设,将研究重心从“旋转寻找最优特征”转向“直接编目维度编码内容”,为轻量级特征解释与边侧控制开辟了新范式。

行业影响

落地场景

Bag of Dims 直接解锁了一系列无训练特征操控与诊断的工业落地路径:

  • 内容安全与审核:在语言模型推理时,实时翻转有害概念(暴力、歧视等)的符号模式以抑制相关内容,无需重新训练或对抗样本,适合部署在 API 网关或安全审计层。
  • 模型调试与可解释性工具:为 AI 开发平台(如 MLflow、Weights & Biases)提供维度级特征字典,自动发现并标注模型的内部概念,支持因果验证(翻转符号观察输出变化)。
  • 多模态模型分析:同一框架适用于语言、视觉(DINOv2、ViT)和音频(AST),可统一集成到企业级 MLOps 流水线中,快速定位跨模态模型中的偏差或错误特征。

商业价值

  • 降本:完全免去训练旋转矩阵、探针或自编码器的 GPU 消耗,特征发现仅需单次前向传播(单 token 缓存),AUC 即可达到 0.97–0.99,而训练探针仅增加 0.018 AUC——近乎零成本获取可解释特征。
  • 增收与体验:通过因果操控维度符号实现模型行为的精确编辑,可提升产品的安全合规性,降低舆情风险,同时增强用户对 AI 输出的信任(例如金融风控、医疗诊断场景)。
  • 效率提升:维度间相互独立(互信息 < 0.006 bits),支持轻量级干预而不破坏其他功能,且标准基读数天然兼容现有推理栈,无额外推理延迟。

与现有产品 / 工作流的接口

无需改动模型架构,可用轻量级后处理模块集成:

  1. 在推理服务器(如 Triton、vLLM)的 logits 计算前,注入符号一致性计数器特征掩码
    • 基于离线构建的概念-维度字典,运行时根据输入文本/图像标识激活的概念,执行 symbol flipping 或 magnitude scaling。
  2. 与可解释性仪表板(如 LIT、TransformerLens)对接,提供实时维度归因图因果编辑控件,供模型审计人员直接操作。
  3. 作为自动化评估套件一部分,在模型发布前扫描有害或偏差特征的轴对齐程度,输出量化报告(AUC / 互信息),替代部分手工 red-teaming。

具体场景

  • 内容平台:在 AI 写作助手中,实时抑制“仇恨言论”子空间,无需为每个新概念重新微调模型,安全团队仅需维护维度掩码文件。
  • 医疗影像诊断:解释肺结节检测模型(如 ViT)的决策依据,通过翻转与“恶性”相关的符号模式,验证模型的因果可靠性,辅助医生决策并满足监管透明性要求。

局限

  • **特征发现仅基于单 token 缓存**,未利用上下文信息。虽然作者验证了特征在上下文中具有因果效应,但初始的无监督特征发现过程完全忽略了 token 间交互,可能导致无法检测依赖上下文的语义特征(例如句法功能、指代消解)。此外,从单 token 缓存提取特征的 AUC 极高,但在实际多 token 语境中,这些维度符号的一致性可能受到上下文干扰,其鲁棒性有待进一步验证。
  • **模型规模有限**,最大仅测试到 32B 参数(Qwen3-32B),对于百亿或千亿级模型,标准基的独立性和语义可解释性是否依然保持未知。随着隐藏维度增加,维度间可能出现更强的叠加(尽管当前成对互信息极低),特征可能由更多维度组成,直接计数符号一致性的方法是否仍能高效工作、是否会出现维度使用率的饱和等问题未探讨。
  • **特征目录化仍为开放问题**。尽管论文表明标准基已足够,且无需旋转即可读取特征,但如何系统地为每个维度(或维度子集)标注语义概念仍缺乏自动化方案。目前依赖已知类别集合的 AUC 排名(如 ImageNet 超类或 ESC-50 类别),本质上仍是一种有监督的发现方式,对于未见概念、跨模态通用概念或细粒度特征,尚无发现方法。作者将此列为未来的开放问题,而非已解决的方案。
论文Varun Reddy Nalagatla2026-06-17原文

相关内容