论文

通过方向分解解耦 Transformer 中的表征演化

通过方向分解解耦 Transformer 中的表征演化

Transformer 表征通过学习到的加性变换演化,这些变换要么保持当前方向,要么将其重新导向。我们把这种演化视为一种函数几何,将学习到的更新分解为平行与垂直两个分量。在多个预训练模型中,我们发现除 residual 恒等路径之外还存在大量平行分量。 随后我们将该分解应用于两个空间:一是相对于 hidden state 的 attention 与 MLP 更新,二是相对于当前 token value 的 attention value 聚合。定向编辑揭示出强烈的空间依赖不对称性:exclude-self 的 value-space 平行操控明显比 residual-space 与垂直方向的同类操作更稳健,它保留直接的 self message,同时只缩放非自身聚合。同一分解还为压缩引起的更新误差提供了分量级描述:垂直误差比平行误差更能清晰区分不同压缩方法。 大量实验进一步表明,在 from-scratch 预训练中抑制全聚合平行分量可降低验证损失轨迹并提升下游平均表现,其中 value-space 变体效果最强。总体而言,这些结果将表征几何与编辑鲁棒性、压缩诊断以及训练期干预联系起来。代码见 https://github.com/Shwai-He/Transformer-Geometry 项目仓库。

论文精读

TL;DR 将 Transformer 更新分解为平行与垂直分量,发现平行缩放冗余、垂直转向脆弱;该几何框架统一解释编辑鲁棒性、压缩误差与训练干预。

问题

问题背景:Transformer 表示演化机制是当前可解释性与模型编辑领域的焦点,但多数分析将层间更新视为整体向量,只关注残差流幅值缩放。

现有方法局限:现有研究未区分更新中的平行分量(保持方向)与垂直分量(改变方向),导致两个关键盲区:1) 平行分量常被当作冗余忽略,但论文发现其在预训练模型中大量存在;2) 只在残差空间分解,未考虑注意力值空间(value aggregation 相对于自身 value)的几何差异,因而无法解释为何值空间平行编辑比残差空间或垂直编辑更稳健。压缩诊断中常用的余弦相似度等整体指标也混淆了平行/垂直误差,难以分离压缩方法的优劣。

为什么难/重要:高维非线性表示中定义方向分解的投影基准并不平凡,且编辑干预会扰动后续层输入分布。实验显示垂直分量极度脆弱,表明方向重定向承载行为关键信息;而值空间平行分量存在可压缩冗余。这种方向-空间不对称性直接关系到模型编辑、压缩和训练干预的可靠性。

行业类比:类似生产环境中的数据库索引维护——调整索引填充因子(平行缩放)通常无感,但修改索引结构(垂直重定向)可能引发查询计划崩溃,因此必须精确识别哪类变更安全。

核心洞察

  • - 提出将 Transformer 表示更新分解为平行与垂直分量,在残差流和注意力值空间两个几何视图中量化方向演化。该视角不同于以往仅关注向量范数或隐式相似度的做法,直接对更新向量做正交投影,揭示平行分量广泛存在但功能冗余,垂直分量才是行为关键,为解释 Transformer 表示演化提供了精确工具。
  • - 在注意力值空间中进行排除自身消息的平行编辑非常鲁棒,可以大幅缩放非自身 token 聚合而不显著影响下游性能。这比残差空间编辑更稳定,表明 self-token 直接信息流是性能锚点,非自身上下文聚合可灵活调节。该发现对模型编辑、上下文剪枝和推理加速具有实际工程价值,也为多头注意力中 self/context 信息分离提供了干预证据。
  • - 训练时对全聚合平行分量进行抑制能降低验证损失并提升下游平均分数,尤其在值空间变体中最强。这表明默认 Transformer 学习过程中平行分量可能过度积累,主动干预其分配可改善训练动态。该方法提供了一种新的训练正则化手段,不同于权重衰减或 dropout,直接作用于表示几何,可能更高效地引导模型学习。

方法

方法概述

输入:预训练 Transformer 各层的 hidden states,以及 attention 模块的 value 聚合结果。

关键模块 1:方向分解(Directional Decomposition) 将每个 sub-layer 的 additive update(即输出与输入的差)分解为 平行分量(parallel component,与输入方向一致的缩放)和 垂直分量(perpendicular component,改变方向的 steering)。该分解在两个互补空间进行:

  • 残差空间(Residual space):分析 MLP 或 attention 完整子层更新相对于当前 hidden state。
  • 注意力值空间(Attention value space):分析 attention 聚合结果(未经过输出投影)相对于当前 token 自身 value 的方向,区分 self 消息与 non-self 聚合。

关键模块 2:方向干预(Directional Interventions) 对分解后的分量进行定向缩放(component scaling),例如在值空间中仅缩放 non-self 聚合同时保留 self 消息。采用对角形式(diagonal form)实现精准干预,评估不同分量对模型行为的影响。实验发现垂直分量高度敏感,平行分量(尤其值空间的平行缩放)较为冗余。

应用:该方法用于三个场景:

  • 推断时组件编辑:通过缩放分量测试鲁棒性与可编辑性;
  • 压缩诊断:用垂直误差区分压缩方法的优劣;
  • 训练时分配:在预训练中抑制 full-aggregate 平行分量,改善验证损失与下游任务平均性能。

输出:对表示演化几何的解析、组件重要性的定量判断,以及训练/压缩策略的指导。

与其他仅关注残留流范数或各向同性缩放的方法不同,本文显式分离方向与幅度,并在注意力值空间内区分自身与非自身消息,从而定位到行为关键区域。

实验

实验设计

论文在多个预训练 Transformer 模型(涵盖不同规模与架构)上进行定向分解实验。首先将每个子层更新向量 Δh 分解为与当前隐藏状态 h 平行的分量 Δh_∥ 和垂直分量 Δh_⊥。在两处空间执行干预:一是残差空间,对完整子层输出做缩放;二是注意力值空间,对聚合后的 value 向量(区分自身与非自身 token)做分量缩放。推理时通过编辑系数控制平行/垂直分量强度,并观察模型行为;同时将该分解用于压缩误差诊断,对比不同压缩方法的误差分量分布。最后在 GPT-2 规模模型上执行从头预训练,训练期间对 value 空间的全聚合平行分量施加抑制,评估损失曲线与下游任务均值。

关键发现

实验发现 Transformer 更新中存在远超恒等残差路径的平行分量,并非冗余。编辑实验呈明显的方向性与空间不对称:垂直分量编辑在任何空间都高度脆弱,轻微缩放即显著破坏性能;平行分量编辑则相对稳健,尤其在 value 空间保留自身消息、仅缩放非自身聚合时,模型对较大缩放幅度仍具有极强的鲁棒性。压缩诊断中,垂直误差比平行误差更能区分压缩方法优劣。训练时压制 value 空间全聚合平行分量,使验证损失曲线下移,下游平均指标提升,且 value 空间变体效果最强。

与基线对比解读

相比将残差流视为各向同性添加的常见视角,本文的方向性分解揭示了几何偏置的结构性差异。传统残差缩放或整体剪枝通常忽略方向信息,而本方法通过分离 Δh_∥ 与 Δh_⊥,定位到具体可编辑的几何分量。尤其 value 空间的平行编辑鲁棒性远高于残差空间,说明 token 自身信息与聚合信息的解耦程度是模型架构的关键属性。该发现对压缩、编辑和训练干预有直接工程启示:设计低秩近似或量化时应显式约束垂直误差,而非仅看整体误差;训练时可引入方向性正则以引导优化路径,可能获得更平滑的表示演化。

行业影响

落地场景

论文提出的方向分解与平行/垂直分量操纵可直接用于三类场景:

  • 模型压缩与部署:通过监控压缩引入的垂直误差,评估量化/剪枝/蒸馏方案的优劣,选择对表示方向扰动最小的压缩方法,适用于边缘设备上的大模型轻量化。
  • 可控生成与知识更新:利用值空间平行编辑的鲁棒性,在不破坏模型整体行为的前提下定向调整特定事实或风格,可用于电商产品描述生成、金融报告审校等需要精准修改模型知识的场景。
  • 预训练效率优化:训练时抑制全聚合平行分量能降低验证损失并提升下游任务平均分,作为即插即用的训练技巧加速大模型收敛。

商业价值

  • 降本:预训练阶段减少不必要的平行更新,可节省 GPU 算力与时间;压缩诊断工具帮助选择更优压缩方案,降低推理硬件成本。
  • 增收:下游任务性能提升(如文本分类、问答)直接增强产品竞争力,尤其在垂直领域模型服务中可议价更高。
  • 体验提升:精准的方向编辑让模型行为更可控,减少生成内容的偏离或幻觉,提升用户信任。

与现有产品/工作流的接口

论文提供代码仓库 Transformer-Geometry,可封装为 PyTorch 模块或回调,集成进 HuggingFace Transformers 训练循环;压缩诊断部分可作为轻量插件嵌入 模型评估流水线,例如在 CI/CD 中自动报告垂直误差指标。训练期平行抑制只需在注意力输出投影前增加一个可微缩放操作,兼容主流并行训练框架(如 DeepSpeed),可作为 训练超参数直接配置。

典型落地案例如下:

  • 电商推荐中的序列模型压缩:对基于 Transformer 的用户行为序列模型做量化前,先用垂直误差筛选最优量化位宽,在不明显损失点击率预测精度的前提下降低延迟。
  • 内容平台的事实更新:当知识库更新时,用值空间平行编辑定向修正模型中的过时事实,避免全量重训,同时保持其他知识不变。

局限

  • 论文虽在多个预训练模型上进行推理编辑实验,但覆盖模型可能集中于中等规模(如 GPT-2 系列、OPT 等),未验证在数十亿参数以上的大模型上的适用性;预训练干预实验也仅在较小规模(可能 ≤ 1B 参数)进行,其结论能否迁移至产业级大模型尚不确定。此外,干预效果依赖手动设定缩放系数,缺乏自动化调参方案。
  • 将 Transformer 更新分解为平行和垂直分量基于线性残差结构,但实际表示演化涉及多层非线性交互和跨层耦合;该分解只在局部单层或单头聚合上应用,可能无法捕捉全局几何特性。此外,垂直分量的定义依赖于方向选择,当表示维度很高时,分解可能对噪声敏感,导致编辑结果不稳定。
  • 与现有表征编辑或可解释性方法相比,干预的鲁棒性证据仍有限:作者在特定任务(如常识推理、上下文扩展)上展示了编辑鲁棒性,但未与更通用的激活修补、CAA 等方法进行系统性对比;压缩诊断部分仅比较了少数压缩方法,未扩展到量化、蒸馏等更广泛类型。总体而言,该方法目前更适合作为分析工具,而非可直接部署的优化技术。
论文Shwai He2026-09-14原文

相关内容