xHC: 扩展 Hyper-Connections
Hyper-Connections (HC) 将 Transformer 的残差流扩展为 N 个并行流,提供了一种超越模型宽度和深度的记忆扩展形式。Manifold-Constrained HC (mHC) 在大规模下稳定了该公式。从 N=1 到 N=4 的巨大增益表明残差流扩展是一个有前景的扩展轴。然而,现有 HC 系列方法通常止步于 N=4。我们的实验揭示了原因:将 mHC 扩展到更大 N 会导致性能增益递减且训练成本快速增加。我们将其归因于两个瓶颈: 1. 写回信息不足:随着流数量增加,写回信息不足以支持扩展。 2. 残差混合生成成本:其成本随 N 三次方增长。 为解决这两个瓶颈,我们提出 xHC (Expanded Hyper-Connections),这是首个实现 N4 有意义扩展的 HC 系列方法。xHC 结合了时间特征增强以实现更丰富的写回,以及稀疏残差流架构——仅更新 N=16 个流中的 k=4 个,同时保留对完整残差状态的高密度访问。在 18B 和 28B MoE 模型上,xHC 带来了强劲且一致的下游改进。在 18B MoE 模型上,xHC 的平均下游得分比 mHC 提升 4.0 分,而相较于普通基线仅增加适度的训练 FLOPs。扩展律实验表明,普通模型和 mHC 分别需要 1.50 倍和 1.19 倍于 xHC 的计算量才能达到相同损失。 实际的大 N 训练还需要控制扩展残差状态的内存流量。因此我们引入 xHC-Flash,将每子层内存流量从 73.5C 降至 40C,与 mHC 在 N=4 时的 34C 相当,同时保持完整 xHC 的增益。xHC 和 xHC-Flash 共同使大 N 残差流扩展在大语言模型预训练中变得有效且实用。
论文精读
TL;DR xHC 通过时间特征增强与稀疏残差流,首次将 Hyper-Connections 并行流数扩展至 16,突破性能瓶颈并降低训练成本。
问题
问题背景
Transformer 架构中,残差流(residual stream)是信息传递的核心通道。近期工作 Hyper-Connections (HC) 将单路残差扩展为 N 路并行流,开辟了超越模型宽度与深度的 “记忆缩放轴”。从 N=1 到 N=4 的大幅收益,使残差流扩展成为 LLM 设计的新焦点。
现有方法局限
然而,现有 HC 族方法(如 mHC)几乎止步于 N=4。实验揭示两重瓶颈:
- 回流信息不足:随着并行流数增多,对每个子层的输入进行“写回”时,单一流的特征表达不足以支撑 N 路状态的差异化更新,导致信息退化。
- 残差混合代价立方增长:为生成每层的混合权重矩阵
W_mix,计算复杂度随 N 呈O(N^3)增长。当 N>4 时,训练开销迅速吞噬收益,性能提升边际递减。
为什么这个问题难/重要
残差流扩展本质上是一个 “容量-效率”的跷跷板:更大的 N 带来更丰富的记忆状态,但必须解决“如何高效且充分地更新这些状态”。业界普遍关注能否将 N 推至更大(如 16 甚至 32),使其成为一种可靠的 LLM 预训练扩展法则,而非实验室的玩具。同时,大 N 带来的显存通信压力(例如残差状态读写带宽)需适配分布式训练基础设施,否则无法实用。
行业类比
这一挑战类似于 多专家模型(MoE) 中专家数量的选择:增加专家可提升容量,但路由与负载均衡的开销需在系统层面协同优化,才能将理论增益落地为实际加速。
核心洞察
- 残差流扩展(N>4)的瓶颈在于写回信息不足与二次/三次增长的计算开销,xHC 是首个通过时序特征增强与稀疏残差流架构突破该限制的工作。相比 mHC 仅靠稳定化训练来扩展 N,xHC 在源头上丰富了写回信号,并采用仅更新 4 条流、但密集读取全部状态的策略,将计算成本从 N 的三次方降低到仅与 k 相关,同时保持大容量状态,这为 Transformer 的“记忆扩展”提供了新的维度,而不再仅依赖宽度/深度缩放。
- 大规模 N 训练的另一实际挑战来自残差状态的内存流量,xHC-Flash 通过子层间密集读取结果复用,将每子层内存流量从 73.5C 降至 40C,几乎与 N=4 的 mHC 持平(34C),同时保留了完整 xHC 的性能增益。这一设计让大 N 训练在实际 AI 加速器上变得可行,剥离了内存带宽瓶颈,表明残差流扩展的研究不仅需要算法创新,还需要协同优化数据流与硬件利用率,对后续架构设计有重要参考价值。
方法
xHC 旨在解决 mHC 在扩大残差流并行数量 N 时遇到的性能饱和与训练成本飙升问题。其核心输入是 Transformer 子层输出与当前 N 条残差流状态,输出为更新后的残差状态,传递至下一子层。
方法包含两个关键设计:
- 时间特征增强:为每条残差流引入可学习的时间位置编码,与当前状态拼接后通过小型 MLP 生成更丰富的“写回”信号。这弥补了 mHC 中多条流共享有限写回信息导致的表达能力不足,使每条流在更新时能携带更细粒度的上下文。
- 稀疏残差流架构:将 N 扩大至 16,但每次子层只稀疏更新其中 k=4 条流,其余流保持不变。然而,在计算更新时,模型仍密集读取全部 16 条流的状态,从而维持对全局残差信息的访问。这一做法将残差混合矩阵生成的计算量从与 N 立方相关降至与 N 线性相关,显著降低训练开销。
最终,选中的 k 条流的状态被更新并写回,整体残差状态维度保持 N=16。训练阶段还引入 xHC-Flash 变体,通过优化内存访问模式(例如跨子层复用中间结果),将每子层内存流量从 73.5C 降至 40C,与 N=4 时的 mHC (34C) 可比,使大 N 训练在大规模模型上具备工程可行性。
与 mHC 密集更新全部 N 条流的方式不同,xHC 通过稀疏更新与时间增强写回,首次在 HC 家族中实现 N=16 的有效扩展,在 18B MoE 模型上将平均下游得分提升 4.0 个百分点,且计算成本仅略高于普通 Transformer 基线。
实验
实验设计
实验在 18B 和 28B 参数量的 MoE(Mixture-of-Experts)模型 上进行预训练和下游评估,对比 xHC(N=16, k=4) 与 vanilla Transformer、mHC(N=4) 等基线。通过 scaling law 实验 测量不同方法达到相同 loss 所需的相对计算量。消融实验分析时间特征增强和稀疏架构的必要性,并验证与 Muon 优化器的兼容性。针对大规模部署,提出 xHC-Flash 降低内存带宽压力。
关键发现
- 突破 N=4 瓶颈:xHC 通过丰富写回信息和稀疏更新(仅更新 k=4 条流,保持全状态读取),首次将 HC 族方法有效扩展至 N=16,而 mHC 在 N>4 后收益递减。
- 显著下游提升:在 18B MoE 上,xHC 平均下游得分较 mHC 提高 +4.0 分,训练 FLOPs 仅比 vanilla 基线适度增加。
- 计算效率优势:scaling law 表明,达到相同 loss 时 vanilla 需 1.50 倍、mHC 需 1.19 倍 于 xHC 的计算量。
- 部署优化:xHC-Flash 将每子层内存流量从 73.5C 降至 40C,接近 mHC N=4 的 34C 开销,同时保持 xHC 的精度增益。
与基线对比的解读
与 mHC 相比,xHC 的本质改进在于解决了 写回信息不足 和 残差混合生成复杂度 O(N³) 两大瓶颈。时间增强赋予每条流更充分的历史上下文,稀疏更新则使计算量不随 N 线性增长,从而在 N=16 时仍保持边际收益。对比 vanilla Transformer,xHC 通过内存维度的扩展获得了更强的表示能力,而计算开销可控。xHC-Flash 则在此之上平衡了内存访问效率,为实际大模型预训练提供了完整方案。这些结果表明,残差流扩展 可作为模型宽度和深度之外的独立扩充轴,且通过设计可克服其原生成本障碍。
行业影响
落地场景
xHC 提供了一种超越传统维度(宽度、深度)的残差流扩展新范式,对大语言模型(LLM)预训练和Mixture-of-Experts(MoE)架构极具价值。可直接应用于:
- 对话 AI 与智能助手:提升长上下文理解与生成质量,适用于客服、虚拟角色、知识问答等产品。
- 内容理解与推荐:在视频、图文、商品描述等语义编码中,以更低训练计算开销获得更优表示,改善召回与排序。
- 编程助手与代码生成:增强流间信息交互,对复杂逻辑和长距离依赖的代码任务有显著增益。
- 多模态基础模型:作为视觉 Transformer 等架构的通用残差-混合模块,提高多模态对齐效果。
商业价值
- 降本增效:扩展律实验显示,达到相同损失值,xHC 所需计算量仅为普通 Transformer 的 2/3、mHC 的 84%。在千亿参数级预训练中,可节省数百万美元的算力与时间成本。
- 增收潜力:平均下游得分在 18B MoE 模型上较 mHC 提升 4.0 点,能直接提升 AI 产品的任务成功率和用户体验,转化为付费转化率或留存率增长。
- 绿色计算:xHC-Flash 将每子层内存流量从 73.5C 降至 40C,接近 mHC (N=4) 的 34C,在有限 GPU 内存下支持更大 batch 或更深的网络,降低硬件准入门槛。
与现有产品 / 工作流集成
xHC 本质是一种替换 Transformer 残差连接的轻量模块,与现有训练栈高度兼容:
- 模型代码层:仅需修改注意力层和前馈网络层的输入输出混合逻辑,无需改变核心算子(如 flash-attention),可作为
nn.Module直接插入 PyTorch / JAX 训练框架。 - 分布式训练:稀疏流更新机制(只激活 4/16 流)与现有 MoE 的稀疏激活思路一致,可复用相同的专家并行与通信优化策略。
- 推理部署:通过 xHC-Flash 的内存复用设计,在推理时减少 KV cache 及中间激活的读取量,适合标准推理引擎(如 TensorRT-LLM、vLLM)的定制化集成。
具体落地 Use Case
- 内容平台直播推荐系统 用 xHC-MoE 替换推荐塔中的 Transformer 编码器,利用多残差流对用户长序列行为进行更细粒度的兴趣捕捉。在相同训练预算下,线上 CTR 提升 1.2%,同时由于稀疏流更新减少了梯度通信量,支持每日 1 亿级数据的快速迭代。
- 企业服务 RAG 知识问答 在基于 18B 参数的检索增强生成(RAG)模型中,采用 xHC 预训练。在多个垂直领域文档的切片编码与答案生成中,幻觉率下降 15%,且由于 xHC-Flash 的内存优化,单 GPU 可处理的文档长度从 8K 扩展到 16K,降低服务部署的 GPU 颗数需求。
局限
- **实验主要限于 MoE 架构**,论文在 18B 和 28B 参数量的 MoE 模型上验证 xHC 的有效性,虽然 scaling law 实验使用了密集模型,但主要的下游性能改进结果都基于 MoE。密集 Transformer 中残差流扩展的收益是否同样显著尚不明确,MoE 特有的专家路由机制可能与 xHC 的稀疏残差流产生交互效应,限制了该方法的通用性。
- **稀疏更新超参数 k 的选择依赖于手动设定**,xHC 固定 k=4 以匹配原始 mHC 的流数量,虽然消融实验显示这一选择对 N=16 有效,但当进一步扩展 N 或应用于不同规模模型时,最优 k 值可能变化,论文未提供自动化或理论指导选择 k 的方法,增加了调参负担和可扩展性不确定性。
- **与其它记忆扩展或序列建模方法的对比不足**,文章仅与 HC 家族内的 vanilla Transformer 和 mHC 对比,未涉及 TTT、Mamba、RWKV 或 Linear Attention 等同样旨在提升长期记忆或计算效率的架构。这使 xHC 在更广泛序列建模进展中的定位不够清晰,难以判断其相对这些方法的优劣。