大语言模型的信息几何是共享的、可学习的且可控的
大语言模型会习得相似的行为,但它们共享何种结构、以及如何在不干扰其他行为的前提下改变某一行为,仍不清楚。下一 token 概率的 Fisher-Rao 几何 将这些问题串联起来:行为在输出保持对称性意义下唯一决定该几何,而 激活几何 则依赖坐标选择。 在 transformer、状态空间模型 与 循环模型 中,输出几何的一致性高于激活几何,且共享几何支持 语义类别迁移。与人类词汇选择的一致性随预测精度、规模和训练量提升而增强,并可在仅对模型做 校准 后进一步提高。Token 概率与 读出几何 能共同预测谱及其 有效维度。 受控语言指派实验表明,几何在各架构上均遵循 语言定律。预训练语料统计量可在不重新校准的前提下预测 留出事实的获取。随机化实验则显示,更深的证据会显著延迟获取,且这一现象在所有受测架构与证据构造中一致。 该几何还能给出 最小扰动局部干预、预测其相对代价,并支持 可复用控制:在 donor prompt 上习得的更新可迁移到未见 prompt,同时比 欧氏控制 更好地保持参考 prompt 上的行为。同一几何校正亦可改进 steering、编辑、归因、字典学习 与 微调。
论文精读
TL;DR 该研究用 next-token 概率的 Fisher-Rao 几何统一解释 LLM 的共享、学习与控制:输出几何跨架构稳定、可预测知识获取,并能设计极小扰动且可复用的干预,显著优于欧氏控制。
问题
问题背景
当前 LLM 可解释性与可控性研究试图回答:不同模型学到相似行为时,它们内部共享哪种结构?以及如何在不干扰其他行为的前提下修改单一行为。
现有方法局限
- 激活几何 依赖坐标选择:不同架构的隐藏维度、层索引、神经元编号不可比,导致跨模型对齐困难,语义类别迁移往往需要额外映射。
- 常见干预方法(如
activation steering、LoRA)使用欧氏距离作为扰动度量,忽略了输出概率空间自身的统计结构。这导致:干预一个概念会意外扰动无关行为;在 donor prompt 上学到的编辑难以迁移到 unseen prompt;干预成本无法预先估计。 - 学习动态预测缺失:现有归因方法通常在训练后分析,无法回答“模型何时获得某条事实知识”,也无法用语料统计提前预测。
为什么这个问题难/重要
输出概率空间是统计流形,其 Fisher-Rao 度量 由行为唯一决定(Chentsov 定理),但将其 pullback 到参数空间需消除 output-preserving symmetries,而高维 token 概率使谱估计和有效维度推断计算昂贵。论文发现该几何在 Transformer、状态空间、循环模型间共享,且与人类词汇选择一致性随尺度/训练提升——这意味着存在架构无关的行为表征。若能预测干预成本与知识获取时间,就能将模型编辑、安全对齐、持续学习从经验试错变成可计算设计。
行业类比
类似自动驾驶系统的局部标定:调整“识别行人”行为时,不能破坏“识别交通灯”等其他已校准能力;本文几何提供最小扰动“扳手”,让修改更精准、可迁移。
核心洞察
- Fisher-Rao 输出几何是模型间共享的“行为指纹”,跨 Transformer、状态空间与循环架构一致,且比激活几何更稳定。独特之处在于它不是比较激活向量对齐,而是使用 next-token 概率上的唯一自然黎曼度量(Chentsov 定理保证),因此不受输出保持对称性的影响;这为解释不同架构学到相似行为提供了几何基础,并支持跨模型语义类别迁移。
- 输出几何不仅能描述模型,还能预训练前预测学习动态:语料 n-gram 统计可预测 held-out 事实获取,证据深度在对数时间尺度上造成乘法延迟,且跨架构与证据构造均成立。与事后分析类工作不同,本工作建立了从语料统计到训练动力学再到几何谱的定量链条,为理解涌现能力的时间点提供了可计算先验。
- Fisher-Rao 几何为模型编辑定义最小扰动局部干预,干预向量可跨 prompt 迁移复用,且比欧氏空间控制更少扰动行为。该框架统一改善 steering、editing、attribution、dictionary learning 与 fine-tuning,表明几何感知的更新方向能保留参考行为同时实现目标修正,提出可复用的模型控制范式,而不仅是单点编辑技巧。
方法
核心方法流程
输入:多个 LLM 架构(Transformer、状态空间模型、循环模型)的 next-token 概率输出;预训练语料统计;人类补全数据;干预任务(如知识编辑、激活操控)。
关键模块:
输出几何构建:基于 Chentsov 定理,在 next-token 概率流形上定义 Fisher-Rao 度量,并通过拉回(
pullback)映射到模型参数空间,得到坐标无关的行为几何。通过 profiled-loss 实验识别 read-out 几何,排除激活空间的坐标依赖。跨模型一致性分析:比较不同架构的输出几何与激活几何,量化一致性衰减与下限;验证共享几何支持语义类别迁移和特征向量共享。
学习动态与频谱预测:使用语料 n-gram 统计在训练前预测 held-out 事实获取;随机化证据深度实验显示更深证据带来乘法级延迟;联合 token 概率与 read-out 几何预测模型频谱和有效维度。
最小扰动控制:在输出几何上求解最小扰动局部干预,预测干预成本,并训练可复用控制更新,从 donor prompts 迁移到 unseen prompts,与欧几里得控制对比保持参考行为。
输出:统一的行为几何描述、跨模型可迁移的干预算子,应用于 steering、知识编辑、归因、字典学习和 LoRA 微调。
跟同类方法的差异点:该方法以输出概率空间的 Fisher-Rao 几何为操作基底,而非激活空间或参数欧几里得几何,因此对架构和坐标选择不敏感,能为行为编辑提供可复用的、最小副作用的控制。
实验
实验设计
通过跨架构(Transformer、状态空间模型、循环模型)比较下一 token 概率的 Fisher-Rao 几何;设计因果语言分配、证据深度随机化、人类完成数据对齐以及最小扰动干预实验。
关键发现
- 输出几何 跨架构一致性高于激活几何,支持语义类别迁移。
- 人类词选择一致性随预测准确率、规模与训练提升,模型校准后进一步提升。
- 语料库 n-gram 统计可在训练前预测事实获取;证据深度增加时获取显著延迟。
- Fisher-Rao 几何规定的最小扰动干预可跨 prompt 转移,并优于欧氏控制保留参考行为。
对比解读
相比仅用激活的几何或欧氏控制,Fisher-Rao 输出几何在 steering、editing、attribution、dictionary learning 与 fine-tuning 等任务中均显示改进,说明基于行为不变量的几何更具可迁移性与稳定性。
行业影响
落地场景
论文提出的 Fisher-Rao 几何 与最小扰动干预,可直接用于大模型行为编辑与治理:
- 内容安全与合规:在内容平台精准移除违规响应,同时保持其他能力不变,降低误伤。
- 个性化与垂直适配:电商推荐或客服模型中,调整特定语义类别(如价格敏感、品牌偏好)的响应倾向,通过 donor prompt 迁移实现可复用控制,缩短适配周期。
- 事实更新与持续学习:利用语料 n-gram 统计预测事实获取时间,优化数据配比和训练干预点。
商业价值
- 降本:几何处方的最小扰动微调和编辑避免全量重训,可复用控制减少多次调试开销;谱分析与有效维度估计帮助提前预估干预成本,降低实验浪费。
- 体验提升与增收:低扰动干预保持模型整体性能,避免回归风险,提升用户信任与留存;精准行为控制使大模型快速进入金融、医疗等高合规要求场景,缩短上市时间。
- 产品差异化:几何度量可作为模型健康度、校准水平的可解释指标,转化为企业级模型治理服务。
与现有工作流集成
- 兼容现有 LoRA、activation steering、dictionary learning 等库,论文提供的几何修正可作为插件式模块加入推理或训练管线。
- 提供 GitHub 仓库 和 项目页,接口基于 next-token 概率与 read-out 矩阵,可嵌入主流 transformers 框架。
- 建议作为模型监控层:部署前对输出几何做谱分析,预测有效维度与干预成本,自动选择最优编辑策略。
具体 use case
- 电商推荐解释:平台需在推荐理由中强化“环保”属性但避免干扰“价格”相关推荐。利用语义类别迁移方法,从少数 donor prompt 学得更新,泛化至未见 prompt,对其他商品类别的扰动显著低于欧氏距离控制。
- 新闻聚合平台事实核查:修正模型对近期事件的事实错误,使用几何最小扰动编辑,在保持语言流畅性的同时更新知识,且可通过语料统计预估哪些事实需要优先干预,优化编辑资源的分配。
局限
- 该框架的核心度量——next-token 概率的 Fisher-Rao 几何——本质上刻画的是输出分布结构,对需要长程推理、事实一致性或多步规划的任务,单一 token 概率可能无法反映模型内部推理链或记忆调用行为。论文并未系统验证该几何在 RLHF 或指令微调模型上的稳定性,因此结论是否适用于当前主流对话模型存疑。此外,对输出保持对称性的讨论集中在 token 层面,未充分涉及更高层语义等价或隐含知识表征。
- 论文提出的最小扰动干预和可重用控制虽在多个任务中验证,但扰动度量基于几何距离,与人类可感知的行为变化之间的映射尚不明确;实际部署中很难判定何种扰动幅度不可接受。可重用控制的迁移实验仅在少量提示模板和特定层上完成,跨任务域、跨数据分布时的泛化能力未充分评估。同时,方法依赖模型校准,而校准本身可能引入额外偏差或需要额外分布数据。
- 语料统计预测事实获取依赖预训练语料的 n-gram 统计,实际应用中语料集常不可得或受版权限制,方法在闭源模型上难以复现。实验覆盖的模型规模最多到数十亿参数级别,缺少对超大规模(>100B)或 MoE 架构的验证。此外,随机实验中的证据深度设置范围有限,未探索更极端的延迟或不同类型知识(如程序性知识)的差异。