Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
混合 LLM 将 softmax 注意力与线性注意力层(如 Gated DeltaNet)配对,其循环状态以固定大小总结上下文。早期社区对 Qwen3.8-27B 的 4-bit 量化仅将 GDN 块保留为 8 或 16-bit 精度,尤其对其 decay 和 write-strength 门,直觉是循环中的误差会随长上下文累积。我们通过构建 Minima 检验了这一直觉:对所有 496 个线性层(含 GDN)应用 NVFP4 W4A4。在 4K/32K 的 perplexity、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench 及 RULER 检索(至 64K)中,Minima 在种子噪声内与 BF16 持平(5 任务均值 -0.52),同时是最小(17.5 GiB)且 prefill 最快(+14-19%) 的配方,其 32K perplexity 差距随位置收缩。四部分机制研究解释了原因:(i) NVFP4 的 16 元素块缩放定位残差流的极端离群值,均衡各层角色的激活误差;(ii) 看似脆弱的门投影最不敏感——softplus/exponential 与 sigmoid 参数化将 11% GEMM 误差压缩至 2% 输出误差;(iii) delta-rule 循环在 32K token 内将注入噪声维持在平坦平台,并在数百步内遗忘状态脉冲,因为每次写入沿当前键方向覆盖状态;(iv) per-token 量化成本随上下文消除而非复合。我们还修复了 per-module 校准的 NVFP4 checkpoint 由融合模块的 kernel 服务时出现的全局尺度错配,并展示校准的 FP8 KV-cache 尺度无性能损失。结果:一个实用配方——量化一切,携带 KV scales——以及对混合 LLM 循环半部为何是易量化半部的机制性解释。Checkpoint: https://huggingface.co/minima-ai/mnmaqwen3.827bnvfp4
论文精读
TL;DR 该论文证明混合LLM中的循环部分Gated DeltaNet可安全进行NVFP4 W4A4 4位量化,在多个长上下文与推理基准上匹配BF16且更小更快,并揭示了其鲁棒性机制。
问题
问题背景
混合 LLM 将 softmax attention 与线性注意力层(如 Gated DeltaNet,GDN)结合,用固定大小的循环状态压缩上下文,以兼顾长序列效率与表达力。当前业界关注点在于:能否将这类混合架构整体量化为 4-bit,从而在端侧或低成本推理场景中部署 27B 级模型。
现有方法局限
早期社区对 Qwen3.8-27B(48 层 GDN + 16 层 attention)做 4-bit 量化时,普遍把 GDN 块保留在 8-bit 或 16-bit 精度,尤其是 decay gate 与 write-strength gate 的投影层。背后的直觉是:循环状态的误差会随上下文长度累积,一旦低精度引入扰动,长序列生成可能逐步发散。但这种保护性策略导致两个直接问题:
- 模型体积无法真正降下来,27B 级别的显存占用仍远超 4-bit 全量化的理论下限;
- 混合计算路径高度依赖算子融合,部分模块保持高精度会破坏 kernel 的批处理与流水线效率,prefill 吞吐反而下降。
为什么这个问题难/重要
难点在于量化误差的传播机制并不直观:GDN 的状态更新是 delta-rule 递推,每个 step 的 write 会沿当前 key 方向覆盖状态,理论上可能自纠错,但缺乏系统性验证。此外,NVFP4 的 16-element block scaling 虽然能局部化残差流中的极端 outlier,但不同层角色(gate / key / value / output)对误差的敏感度差异极大,直接全量化可能触发某些 gate 的非线性区域饱和。业界关注度体现在:混合架构正成为长上下文推理的主流选择,若循环半区不能安全量化,则 4-bit 部署只能应用于纯 attention 模型,限制极大。
行业类比
就像视频流媒体中运动补偿帧(P-frame)的量化误差会被后续帧参考并可能累积,循环状态正是混合 LLM 的“P-frame”——只有证明其误差在时间轴上能被 wash out,才能放心采用全 4-bit 量化。
核心洞察
- 循环层(Gated DeltaNet)并非量化脆弱点,其 delta-rule 状态更新机制天然抑制累积误差。每次写入都沿当前 key 方向覆盖状态,使注入的量化噪声在数百步内被遗忘,而非像传统 RNN 那样线性累积。这与早期社区将 GDN 保留在 8/16 位精度的做法形成对比,说明对循环结构的直觉恐惧缺乏机制支撑。此外,门控投影的 softplus/exponential 与 sigmoid 非线性将约 11% 的 GEMM 误差压缩到约 2% 的输出误差,成为最不敏感的组件。
- NVFP4 的 16 元素块缩放是统一 4 比特量化的关键,它有效局部化了残差流中的极端异常值,使所有 496 个线性层(含循环层)都能用同一 W4A4 方案,而无需混合精度。这不同于常规的逐层敏感度分析或手动选择性量化。论文还揭示了一个部署陷阱:逐模块校准的检查点在融合 GEMM 的 kernel 中会产生全局缩放不匹配,必须进行端到端校准才能保持精度。该洞察对实际推广低比特混合 LLM 具有直接工程指导价值。
方法
方法概述
输入:Qwen3.8-27B 的 BF16 checkpoint,包含 48 个 Gated DeltaNet (GDN) 层和 16 个 softmax attention 层,共 496 个线性层。早期社区方案常将 GDN 的 decay / write-strength gate 投影保留 8/16 位,本文对全部线性层执行 NVFP4 W4A4 量化。
关键模块:
- NVFP4 格式与块缩放:权重与激活均量化为 4-bit,采用 16 元素块缩放,把残差流中的极端异常值限制在局部,从而均衡不同层角色的激活误差。
- 校准与部署修正:按模块逐层校准量化因子;服务端 kernel 可能将多模块融合成单个 GEMM,造成全局缩放不匹配,本文修复该 mismatch。另校准 FP8 KV-cache 的 scale,实现无性能损失的缓存压缩。
- GDN 鲁棒性机制:门控投影的 softplus/exponential 与 sigmoid 参数化将约 11% 的 GEMM 误差压缩至约 2% 输出误差;delta-rule 循环在 32K tokens 内把注入噪声保持平坦,并通过沿当前 key 方向的状态覆盖在数百步内遗忘脉冲。
输出:量化 checkpoint Minima(17.5 GiB),在 4K/32K 困惑度、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、RULER 64K 检索上匹配 BF16 种子噪声内,预填充速度提升 14–19%。
与同类方法的差异:不保留 recurrent half 高精度,而是将 GDN 全量化为 NVFP4 W4A4,并利用块缩放与门控非线性压缩误差,证明 recurrent 部分是混合模型中更易量化的部分。
实验
实验设计
研究对 Qwen3.8-27B 混合模型(48 层 Gated DeltaNet + 16 层 softmax attention)的全部 496 个线性层应用 NVFP4 W4A4,构建 Minima 量化版。对比基线包括 BF16 原模型及社区早期将 GDN 保留 8/16-bit 的量化配方。评估覆盖 4K/32K perplexity、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench 和 RULER 64K 检索。
关键发现
Minima 在 5 项任务上与 BF16 平均差距仅 -0.52,落在 seed noise 范围内,同时模型体积最小(17.5 GiB),prefill 速度最快(+14-19%)。32K 长上下文 perplexity gap 随位置增加而缩小,表明误差不累积。四部分机制分析:NVFP4 的 16 元素 block scaling 将残差流极端异常值局部化,使各层激活误差均衡;gate 投影将约 11% 的 GEMM 误差压缩至约 2% 输出误差;delta 规则递归对注入噪声呈现平坦上界,并能在数百步内遗忘脉冲;每 token 量化开销随上下文稀释。
深度解读
与早期社区保守做法(保留 GDN 高精度)相比,本工作证明对递归层全面量化是可行的,且 recurrent half 反而更易量化,颠覆了“递归误差累积”直觉。对工程实践的启示:混合 LLM 若需低比特部署,可放心量化所有线性层,获得显著显存与 prefill 收益;同时需修复 per-module calibration 与 fused-GEMM 的 scale 不匹配,并采用校准的 FP8 KV cache scale。
行业影响
落地场景
混合 LLM(softmax attention + Gated DeltaNet)在长上下文场景优势明显,4-bit 量化后可在较低显存设备上部署。具体场景包括:企业知识库问答与 RAG、实时 agent 与工具调用、内容平台长文处理(摘要/审核/抽取)。这些场景通常要求长上下文记忆与低延迟推理,4-bit 量化后的 27B 模型仅需约 17.5 GiB,可部署在单张 24GB 消费级 GPU 上,扩大潜在客户群体。
商业价值
- 降本:BF16 到 NVFP4 W4A4,显存占用下降约 4 倍,硬件门槛和运维成本显著降低。
- 增收/体验:prefill 快 14-19%,长输入吞吐提升,支持实时交互(客服、代码补全)。
- 风险可控:量化后 5-task average 仅 -0.52,在 seed noise 内,精度无损,可放心推广。
与现有产品/工作流接口
- 基于 vLLM / TensorRT-LLM 的推理栈需支持 NVFP4 内核,并注意 fused GEMM 缩放修正(论文已解决)。
- KV cache 采用 FP8 且附带 calibration scales,可无缝启用。
- 提供现成 checkpoint:
https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4,可直接加载替换 BF16 权重。 - 无需重新训练,只需 PTQ 校准,可与现有混合 LLM 模型(如 Qwen3.8-27B)兼容。
具体 Use Case
- 电商平台智能客服:多轮会话需记住用户历史订单与偏好,用 4-bit 混合 LLM 部署在边缘推理节点,在 24GB GPU 上低延迟响应长上下文对话,降低每次交互成本。
- 内容平台的文本审核流水线:处理长文评论或文章,用 4-bit 混合 LLM 批量摘要与违规检测,prefill 加速直接提高每日处理量,显存降低可增加并发实例。
局限
- 论文仅在一个模型(Qwen3.8-27B)和一种混合架构比例(48 GDN 层 / 16 attention 层)上验证了全面 NVFP4 W4A4 量化,未覆盖其他混合 LLM 或纯 GDN 模型,机制分析的普适性存疑。作者承认量化配方依赖 NVFP4 格式及其块缩放特性,其他 4-bit 格式(如 INT4/FP4 变体)可能表现不同。此外,研究未涉及更长上下文(如 128K 或 1M)下的误差累积行为,仅测试到 64K RULER。
- 实验评估主要基于静态基准(perplexity、MMLU-Pro、GSM8K、RULER 等),缺少端到端长文本生成任务(如摘要、对话)的人工或自动评估,因此无法完全反映实际生成质量。同时,KV-cache 仅校准到 FP8,未探索更低精度(如 INT4)或混合 KV 策略,可能错过进一步压缩机会。另外,论文中 serving-stack 修复(per-module 校准与 fused-GEMM 的全局尺度不匹配)针对特定内核实现,在其他硬件或部署栈上的适用性未知。
- 早期社区量化方案(如将 GDN 保留在 8/16-bit)作为对比基线,但本文未在同一硬件和推理栈上与这些混合精度方案进行严格的延迟-精度帕累托对比,只报告了 Minima 自身的速度和模型大小。此外,文章未与基于权重的量化方法(如 AWQ、GPTQ)在统一设置下比较,因此全面 NVFP4 的优势可能部分源于校准方法和硬件支持,而非量化格式本身。方法依赖 NVIDIA 硬件对 NVFP4 的原生支持,限制了跨平台部署的通用性。