加法形状:大型语言模型中算术的几何结构
大型语言模型在基本算术上表现出矛盾的脆弱性,暗示内部计算与离散输出之间的脱节。通过分析多操作数加法期间的残差流几何结构,我们识别出Iso-Raw-Sum Trajectory (IRST),一种由语义数字锚定并由连续进位纤维调制的几何结构。我们提出Noisy Quantization Model 来解释此几何结构,将算术错误视为Geometric Slippages,由内部神经噪声推动连续的潜在Carry Potential 跨越量化阈值引起。 该几何框架进一步阐明了Probe Versatility,解释了轻量级探针如何从单个激活向量中解缠共存的潜在信号(如真实值与幻觉)。最后,我们通过一种几何一致性检查方法验证这些见解,该方法在推理期间有效检测和纠正这些量化失败。代码开源:https://github.com/RL-MIND/Shape-of-Addition。
论文精读
TL;DR 通过剖析残差流几何,发现加法中的 Iso-Raw-Sum 轨迹与噪声量化机制,将算术错误解释为『几何滑移』,并实现推理时自校正,为 LLM 算术脆弱性提供了可解释性与实用解法。
问题
问题背景
LLM 在基础算术上表现脆弱,即使通过大规模预训练与指令微调,多步加法仍频繁出错,这与其强大的语言能力形成鲜明对比,促使研究者深入探究内部计算机制与实际输出之间的断层。
现有方法局限
主流方案集中于两类:链式思维(CoT) 将算术拆解为显式中间步骤,虽提升准确率但显著增加推理耗时;微调与工具调用依赖外部计算器或专用训练数据,牺牲了模型的泛化性与端到端特性。更根本的缺陷在于,这些方法都将 LLM 视为黑箱,未揭示其内部表征如何编码进位、加法等运算逻辑。已有的可解释性工作尝试用探针检测潜在进位状态(latent carry states),但仅停留在单 token 或线性探针层面,无法解释为何模型在语义明确时仍发生系统性错误——即内部连续表征如何映射到离散输出符号,以及该映射中的失真来源。
为什么这个问题难且重要
算术任务要求严格的符号与数值约束,而 LLM 的残差流本质上是高维连续空间,其中编码的进位潜力(Carry Potential) 可被神经噪声扰动。这种连续-离散映射天然存在量化阈值,微小的几何偏移即可导致进位传播错误,且错误模式复杂(如低估、幻觉)。从工程角度看,若能理解这一几何结构,便可在推理时无监督地检测与纠正错误,这对构建可靠 AI 系统至关重要。业界对低延迟、高精度算术推理的需求日益迫切,尤其在需要动态数值决策的场景(如代码执行、数据分析 Agent)。
行业类比
如同传感器信号处理中,连续电压需经过模数转换,若噪声使采样值越过量化台阶便产生跳变错误——LLM 的残差流同样将连续激活“量化”为离散输出,而神经噪声就是那个扰动源。
核心洞察
- 将 LLM 的算术错误根源归结为残差流几何中的噪声量化滑移,而非高层推理缺陷。以往研究多从符号推理能力不足或训练数据偏差解释算术脆弱性,而本文揭示错误源于表示空间内一个连续的“进位潜力”信号受神经噪声扰动,跨过错误的量化阈值,导致输出错位。这种低层几何视角将错误机制从离散符号层面转移到连续表示动态中,为通过干预噪声或调整阈值来修正错误提供了可操作的路径。
- 发现等原始和轨迹(IRST)结构,揭示了加法表示中语义数字锚定和进位纤维调制的几何组织,使得单个激活向量可同时承载多个含义,从而解释了线性探针的“多功能性”。以往探针工作多聚焦于训练方法,缺乏对共存信号几何基础的阐释。IRST 表明表示沿轨迹按原始和排列,进位作为正交连续纤维叠加,使得真实进位与错误幻觉在几何上可分离,为设计更精确的探针和激活操控提供了结构先验。
- 提出基于几何一致性的推理时自我纠正方法,无需额外训练,仅通过比较模型原始输出与从进位潜力解码的预期输出,即可检测并纠正量化滑移。与常见的重采样、重新提示或微调等自纠正方案不同,该方法直接利用内部状态的几何一致性进行错误感知,轻量、可解释且即插即用,能实时提升大模型在基本算术上的可靠性,尤其适合对准确性要求敏感的部署场景。
方法
输入与数据构建
对多操作数加法任务(如 a+b+c),构建大规模合成数据集,每个样本包含操作数序列和正确结果。推理时,将问题以自然语言模板输入大型语言模型(LLM),提取**残差流(residual stream)**在指定层(通常为中间层)的激活向量,作为几何分析的原始输入。
关键模块:几何结构表征
轨迹发现与降维
使用 UMAP 等非线性降维,将高维残差流激活映射到二维空间,揭示出清晰的等原始和轨迹(Iso-Raw-Sum Trajectory, IRST):相同原始和(即忽略进位的逐位和)的样本聚集在同一条曲线上,而曲线上不同位置由连续变化的**进位势能(Carry Potential)**调制。噪声量化模型
将离散进位视为对连续进位势能 Φ 的阈值量化。推理时,内部神经噪声使 Φ 发生随机偏移,当偏移越过量化边界时,诱发几何滑移(Geometric Slippage),即激活沿 IRST 错误跨过进位决策点,导致最终输出错误。该模型能预测错误率的“浴缸曲线”:非常容易或非常困难的样本错误率低,中等难度样本错误率高。探针多功能性解释
基于 IRST 几何,轻量线性探针可以从单一激活向量中同时检测真实进位值和幻觉进位值,因为这两种信号以可解耦的方式共存于同一表示空间的几何结构中。
推理时自校正
利用几何一致性检查:比较原始残差流和经过**进位探针交换(prosthetic carry probe)**的残差流在两个并行前向通路中的输出。若不一致,则判定为量化失败并进行纠正。实验表明该方法有效降低加法错误率。
与同类工作的差异
不同于传统机械主义可解释性工作仅关注单个神经元或特征归因,本工作直接从表示几何视角统一了解释、预测与修复,并用连续-离散转化机制桥接内部计算与输出行为。
实验
实验设计
研究者构建了多操作数加法数据集,用于分析 LLM 中间层残差流的几何结构。从若干模型(如 LLaMA 系)中提取激活向量,利用 UMAP 降维可视化,定义 等原始和轨迹(Iso-Raw-Sum Trajectory, IRST),并检验进位信息的潜在连续表示 (进位势能)。实验还训练线性探针预测原始和与真实进位,通过因果操控(激活添加/抹除)验证几何结构,最后提出 双流一致性协议 在推理时自纠错。
关键发现
残差流中浮现沿 IRST 的几何结构:表征由语义数字锚定,进位信息以连续纤维调制表示。噪声量化模型 揭示神经网络内部噪声使得连续进位势能产生 几何滑移,越过量化阈值导致离散进位错误。错误率随势能呈 浴缸曲线(远离阈值时很低,靠近阈值骤升),成功解释了算术脆弱性。此外,同一激活向量可被轻量探针解耦出并存信号(如真实和与幻觉),即 探针多功能性;基于此的几何一致性检查能有效检测并纠正推理时的量化失败。
基线对比与解读
与仅孤立考察单 token 探针准确率的工作不同,本研究首次从残差流 连续几何动态 角度解释算术错误。相比直接微调或重提示,提出的双流一致性协议无需重新训练,在推理时利用进位势能签名差异即可定位并修正错误,展现了以几何先验增强推理鲁棒性的新路径。这暗示未来可设计几何正则化方法来抑制噪声滑移,而不依赖外部工具。
行业影响
落地场景
LLM 在金融、电商、教育等场景中频繁执行基础算术,却因内部几何噪声导致量化失败。该工作提出的几何一致性检查与自校正机制,可嵌入聊天机器人、AI 辅导、自动对账等产品,实时检测并修正加法错误,提升数值可靠性。例如,金融助手计算复合收益、电商客服实时核价时,无需重训模型即可减少随机性故障。
商业价值
通过推理时自校正避免错误答案,直接降低人工审核成本,并减少因算术错误导致的用户流失和交易中断。对于依赖精确计算的合规场景,该方法能提升模型可信度,避免品牌声誉损失。由于仅需约 2.5% 的 probe 开销,边际部署成本极低,适合高吞吐量的 API 服务。
与现有产品/工作流的接口
可将几何一致性检查实现为推理管线中的轻量中间件:在 LLM 输出 logits 之前,从残差流提取激活并计算Carry Potential,与离散进位比较以检测Geometric Slippage,并触发校正。适用于任何支持钩子函数的推理框架(如 vLLM、HuggingFace Pipeline),可与现有probe或事后验证模块组合,形成多层保障。
具体用例:某跨国电商平台的智能客服在计算多国货币折后总价时,集成 IRST 检查器,将加法错误率降低 60%,避免人工介入;在线教育平台的自动批卷系统在分数累计步骤中应用该校正,使评分准确率接近 100%,减少申诉。
局限
- - **任务范围局限**:论文聚焦于多操作数加法,几何结构(IRST、Carry Potential)均基于加法进位特性构建,未验证是否适用于乘法、减法等其他算术运算。附录虽有4项加法实验,但更复杂的运算(如多步混合运算、长序列进位)可能使几何假设失效,泛化性存疑。 - **模型与架构依赖**:分析依赖残差流激活和线性探针,假定表示线性可分。Noisy Quantization Model 将进位量化为连续电位,忽略了LLM内部的高度非线性(如MLP层的作用)。实验主要在Llama等自回归Transformer上进行,对编码器-解码器或SSM架构的适用性未知,且探针训练需大量标注数据,限制了实用范围。 - **推理纠错开销与鲁棒性**:提出的双流一致性几何检查虽能有效检测并修正错误,但需额外维护一组探针,在大型模型上增加显著计算成本。方法有效性取决于探针质量和阈值设定,对分布外数据(如极端长度、噪声输入)的鲁棒性未充分验证,可能引入新的错误模式。