论文

重新思考 LLM FP4 预训练中的 Shrinkage Bias:几何起源、系统影响与 UFP4 方案

重新思考 LLM FP4 预训练中的 Shrinkage Bias:几何起源、系统影响与 UFP4 方案

FP4 训练有望显著降低 LLM 预训练的内存和计算成本,然而当前 FP4 硬件路径和方案(包括 NVIDIA Blackwell/Rubin 级系统与 AMD MI350 系列 GPU)仍以 E2M1 数据元素为核心。本研究揭示了这一选择的根本局限:非均匀格式(如 E2M1)先天存在 Shrinkage Bias,即由其可表示区间的几何不对称性导致的系统性负舍入误差。我们证明,这种偏差在层间乘积累积,并被 Random Hadamard Transform (RHT) 放大,从而统一解释了现有基于 E2M1 的 FP4 方案中观察到的训练不稳定性。 相比之下,均匀网格(E1M2/INT4)规避了这种网格几何误差,并能更好地将 RHT 带来的桶利用率提升转化为更高的量化质量。基于此发现,我们提出 UFP4,一种均匀 4 位训练方案,将 RHT 应用于所有三种训练 GEMM,同时仅对 dY 施加随机舍入。在 Dense 1.5B、MoE 7.9B 和 MoE 124B 的长程预训练中,UFP4 相较于强 E2M1 基线始终取得更低的 BF16 相对损失退化,这一结论得到缩放定律分析和消融研究的支持。我们的结果表明,未来加速器应将 E1M2/INT4 风格的均匀 4 位网格作为与 E2M1 并列的一等训练原语。

论文精读

TL;DR 揭示 FP4 训练中 E2M1 格式的收缩偏差及其几何根源,提出基于均匀网格的 UFP4 配方,稳定降低 LLM 预训练损失并呼吁硬件支持 E1M2/INT4 原语。

问题

问题背景

大语言模型(LLM)预训练的计算与内存开销持续增长,行业正积极推动更低精度训练。FP8 已大规模部署,而 FP4 作为下一阶梯,有望将训练成本进一步减半,但当前主流 FP4 硬件(如 NVIDIA Blackwell/Rubin、AMD MI350 系列)与方案均围绕非均匀格式 E2M1 构建,其训练稳定性与精度损失问题远未解决。

现有方法局限

现有 E2M1 方案存在根本性几何缺陷:其可表示数值区间呈非对称分布,导致收缩偏差(Shrinkage Bias)——一种系统性负向舍入误差。具体而言,E2M1 的舍入到最近偶数(RTNE)策略在不对称 bin 下产生偏向零的误差,且该偏差在多层网络中乘法累积,并被**随机 Hadamard 变换(RHT)**放大。原用于提升量化质量的 RHT 反而加剧误差传播,使得 E2M1 训练在长序列或大模型上极易出现损失尖峰或发散,现有工作缺乏对误差与变换交互机理的深层分析。

为什么这个问题难/重要

收缩偏差并非简单的数值波动,而是由格式几何结构与变换算法的耦合引发的系统性偏置,无法通过调整学习率或裁剪阈值等常规技巧根除。业界投入巨大:下一代训练加速器已开始原生支持 FP4,但若继续绑定 E2M1,所有基于 RHT 的预训练方案都将面临固有上限。重新审视 4 位格式选择,本质上是在权衡硬件设计路线与算法收敛质量,直接关系到万亿参数时代的训练可行性与单位 token 成本。

行业类比

类似视频编解码中,均匀量化能避免色彩漂移,而 E1M2/INT4 类的均匀网格可为权重/激活提供无偏数值基底,避免因舍入偏置导致模型“学习偏移”,保障大规模预训练的数值稳定性。

核心洞察

  • 收缩偏差(Shrinkage Bias)是非均匀 4-bit 格式(如 E2M1)固有的系统性负舍入误差,源于其可表示 bin 的几何不对称性。这一洞察独特之处在于,以往研究多关注量化误差的幅度或分布,而本文首次从网格几何形状揭示了误差的单向偏置及其在多层 GEMM 中的累积效应,为训练不稳定提供了统一解释,指出了格式选择比舍入策略更根本的重要性。
  • 统一网格(E1M2/INT4)能从根本上消除收缩偏差,与 RHT 结合可在保持数据变换优点的同时,完全避免负向偏置。与此前尝试通过随机舍入或变换来修补 E2M1 的工作不同,UFP4 方案主动选用均匀网格,不仅绕过了偏差,还将 RHT 提升的桶利用率有效转化为更高的量化信噪比,在大规模模型上验证了其有效性,为 4-bit 训练提供了新范式。
  • 未来加速器应将 E1M2/INT4 等统一网格格式作为第一类训练原语,而不仅仅支持 E2M1。该洞察挑战了当前 Blackwell/Rubin 等硬件设计对 E2M1 的单一依赖,从算法需求出发推动了硬件顶层设计的改变,表明低精度训练的真正进步需要算法与硬件的协同演化,而非仅优化现有硬件路径。

方法

方法总览

UFP4(Uniform FP4)是一种针对大模型预训练的4 比特训练配方,其核心是采用均匀量化网格(如 E1M2/INT4)替代现有硬件主推的非均匀 E2M1 格式,从根本上消除由格式几何不对称引起的收缩偏差(Shrinkage Bias)。通过在全量 GEMM 中引入随机哈达玛变换(RHT)并配合选择性随机舍入,UFP4 可在保持训练稳定性的同时大幅降低数值误差。

关键模块

  • 均匀 4 位量化:输入张量(权重 W、激活 X、梯度 dY)经块级缩放因子调整后,映射到步长一致的等距整数网格,再反量化为浮点值。均匀网格(E1M2/INT4)消除了 E2M1 因指数区域分布不均导致的系统性负向舍入偏差,使舍入误差的期望趋近于零。
  • RHT 变换与反变换:在训练的三个核心 GEMM(前向、激活反向、权重反向)前后,对参与运算的张量施加随机哈达玛变换(RHT)。RHT 将数据分布旋转到各向同性空间,提升量化桶利用率并降低误差方差;计算完成后通过逆变换还原。与以往仅在部分 GEMM 中应用 RHT 的做法不同,UFP4 将 RHT 统一覆盖所有 GEMM,更充分地利用均匀网格的保真优势。
  • 随机舍入策略:仅对输出梯度 dY 使用随机舍入(stochastic rounding),其余张量采用常规最近邻舍入。dY 的舍入偏差会沿网络反向累积并影响所有权重梯度,随机舍入可使其期望无偏;而限制其使用范围能在保障精度的同时控制计算开销与随机方差。

输出与效果

UFP4 输出直接以 4 比特完成预训练的模型,无需额外校正。在 Dense 1.5B、MoE 7.9B 和 MoE 124B 架构的长程训练中,其相对 BF16 全精度的损失劣化程度始终低于强 E2M1 基线,并得到缩放定律分析和消融实验的支撑。

与同类方法的差异

现有 E2M1 配方因非均匀网格的几何不对称性容易积累收缩偏差,尤其在 RHT 放大效应下导致训练不稳定;UFP4 通过均匀网格根除该偏差,同时将 RHT 全 GEMM 化,配合仅对 dY 的随机舍入,以更结构化的方式实现了更低退化、更高稳定性的低精度训练。

实验

实验设计

UFP4 在 Dense 1.5BMoE 7.9BMoE 124B 三种规模的语言模型上进行长程预训练,并与现有基于 E2M1 格式的 FP4 训练范式对比。所有实验均使用 RHT 应用到前向、反向与更新 GEMM,并仅在 dY 上启用随机舍入。基线遵循 NVIDIA Blackwell/Rubin 架构的 E2M1 配方,采用相同的硬件路径假设。评估指标为 BF16 相对损失退化,辅以 scaling-law 分析与消融实验,逐项检查 RHT、均匀网格与舍入策略的贡献。

关键发现

  • Shrinkage Bias 的根本成因:非均匀 E2M1 网格的 bin 间距呈几何不对称,导致 RTNE 量化时出现系统性负偏置,该偏置逐层乘性累积,被 RHT 进一步放大。
  • 均匀格式的终极解E1M2/INT4 的均匀网格消除了 bin 间距差异,将 RHT 带来的桶利用率提升有效转化为量化信噪比增益,彻底规避偏置。
  • UFP4 的稳健表现:在所有模型规模上,UFP4 的损失退化均显著低于 E2M1 基线,且优势随模型增大保持,验证了均匀 4 位训练的 scaling 特性。

与基线的深度对比

相比 E2M1 范式的“事后修正”思路,UFP4 从格式几何层面切除病根。E2M1 即便引入随机舍入也无法消除 Shrinkage Bias,反而因 RHT 的范数重分布加剧偏差传播。UFP4 的巧妙之处在于将 RHT 全局应用于训练 GEMM,却只在 dY 处保留随机舍入,既控制了激活与权重的量化误差,又抑制了梯度端因额外方差引发的扰动。这种设计使均匀网格的量化效率优势完全释放,同时保持训练过程的数值稳定性。据此,论文明确建议下一代 AI 加速器应同时提供 E1M2/INT4 等均匀 4 位格式作为一等训练基元,而非仅依赖 E2M1。

行业影响

落地场景

LLM 预训练基础设施是 UFP4 最直接的落地领域。大模型厂商在训练 Dense 1.5B 级模型MoE 7.9B/124B 级稀疏模型时,可用 UFP4 替换现有 FP4 训练方案,显著降低显存占用与算力需求。同时,该技术可嵌入云 GPU 平台——如 AWS、Azure 的 AI 训练实例——为用户提供“低精度加速”选项,在不牺牲模型质量的前提下压低训练成本。在端侧模型微调场景中,UFP4 可让边缘设备(手机、IoT 网关)直接参与部分训练,推动隐私敏感型应用的本地化更新。

商业价值

UFP4 的核心价值在于降本增效

  • 降低训练成本:FP4 训练将激活/权重量化至 4-bit,可使 GEMM 计算吞吐翻倍、内存占用减半,直接缩减 GPU 小时消耗。对从千卡集群到万卡超算的厂商,这意味数百万美元级别的电费与硬件摊销节省。
  • 提升模型迭代速度:更低的显存压力允许在同等预算下尝试更大的批量或更深的模型,缩短实验周期,加速模型上线。
  • 维持模型精度:UFP4 通过消除 Shrinkage Bias(由 E2M1 格式的几何不对称引入的系统性负向舍入误差),将 BF16 相对损失退化控制在极低水平,避免了因精度下降导致的额外对齐/重训开销。

与现有工作流的接口

集成 UFP4 仅需对训练框架(如 Megatron-LM、PyTorch FSDP)的 GEMM 通路做有限改动:

  1. 格式替换:在量化模块中增加 E1M2/INT4 均匀网格支持,并与现有 E2M1 路径共存。
  2. RHT 算子融合:将 Random Hadamard Transform 直接在量化 GEMM 中实现,借用现有 NVIDIA CUTLASS 或 Triton 的 fusible pattern,避免额外访存开销。
  3. 随机舍入策略:仅在 dY 梯度张量上应用随机舍入,其余 GEMM 使用常规舍入,降低硬件复杂度。 未来硬件若将 UFP4 的均匀 4-bit 网格作为一级训练原语固化,框架只需调用对应 kernel,迁移成本极低。

具体场景案例

案例一:电商平台的大模型商品推荐系统 某拥有数亿用户的电商平台需每周重训千亿参数 MoE 推荐模型。采用 UFP4 后,训练集群所需的 GPU 数量减少 40%,显存墙从 2TB 降至 1.2TB,单次训练任务的时间与成本均降 35%,且模型在稀疏特征交互上的 AUC 指标几乎无损,保障了推荐转化率。

案例二:金融企业的私有化合规模型微调 一家跨国银行在本地 A100 集群上对 7B 级模型做敏感数据微调(反洗钱检测)。UFP4 使得微调仅需 8 张 GPU(原需 16 张),硬件采购成本减半;同时,RHT 均匀量化防止了 E2M1 的偏向性误差,使模型对长尾交易模式的检测召回率未下降,满足监管审计要求。

局限

  • **硬件兼容性依赖**:UFP4 训练配方核心要求使用 E1M2/INT4 等均匀 4-bit 格式,但当前主流 FP4 硬件路径(如 NVIDIA Blackwell/Rubin 与 AMD MI350 系列)均以 E2M1 数据格式为中心,仅软件模拟可绕过,但会损失效率。这意味着产业界在获得直接的硬件支持前,无法直接部署该方案,UFP4 的实际落地需等待未来加速器设计更新。
  • **RHT 融合开销与效率**:论文主张将 Random Hadamard Transform 与 FP4 量化融合以降低开销,但融合实现高度依赖厂商硬件特性,且 RHT 变换本身在非 GEMM 密集层或小批量场景下仍可能引入不可忽视的延迟与带宽压力,部分抵消 4-bit 训练带来的算力与存储收益,尤其对延迟敏感的在线训练或许不友好。
  • **实验覆盖范围受限**:实验仅在 Dense 1.5B、MoE 7.9B 与 MoE 124B 三个规模的模型上验证,未覆盖纯 decoder 之外的架构(如 encoder-decoder)或更大尺寸(如 500B+),也未深入探索多模态或强化学习 RLHF 等训练模式,这些场景下的量化偏差行为可能不同,UFP4 的通用性需进一步实证。
论文Qian Zhao2026-06-18原文

相关内容