论文

MultiHashFormer:基于哈希的生成式语言模型

MultiHashFormer:基于哈希的生成式语言模型

语言模型(LM)使用嵌入矩阵来表示词元(token),其参数规模随词汇量线性增长。为限制参数开销,先前的工作在仅编码器(encoder-only)模型中提出将多个词元哈希到单个向量。虽然这带来了参数效率,但多对一的冲突阻碍了其在因果语言模型(causal LM)中的应用。 本文提出 MultiHashFormer,一种支持基于哈希的自回归的新框架。每个词元被表示为一个唯一的哈希签名(hash signature),即由多个独立哈希函数生成的短离散哈希ID序列。Hash Encoder 将此签名压缩为单个潜在向量,供 Transformer 解码器处理;随后 Hash Decoder 生成下一个词元的哈希签名,再映射回文本。 我们在100M、1B和3B参数规模上评估该方法,实验结果表明 MultiHashFormer 在多个基准测试中一致优于标准 Transformer LM。此外,我们的模型以恒定的参数开销支持多语言词汇扩展,无需任何修改。

论文精读

TL;DR MultiHashFormer 通过多哈希签名与编解码器实现哈希基自回归,克服冲突问题,在参数效率下性能超越标准 Transformer,且支持固定参数的多语言词汇扩展。

问题

问题背景

语言模型(LM)的嵌入矩阵参数量与词汇表大小 (V) 呈线性增长,成为大规模模型(尤其是多语言)参数膨胀的主要来源之一。如何在扩大词汇量的同时控制参数规模是当前效率优化的核心挑战。

现有方法局限

以往的**哈希嵌入(Hash Embedding)**方法通过将多个 token 映射到少量共享向量来压缩参数,常用于编码器模型(如 BERT),但 许多对一碰撞(many-to-one collision) 的机制使其无法区分不同 token,在自回归语言模型中会导致严重的信息混淆,无法准确预测下一个 token。因此,现有因果 LM(如 GPT 系列)仍坚持使用常规的 V × d 嵌入矩阵,参数随 (V) 线性增长,大量参数被昂贵的嵌入层占用。

为什么这个问题难且重要

自回归生成要求每一步精确判别整个词汇表,任何 token 混淆都会破坏语言连贯性。哈希碰撞在生成任务中会放大误差,使得稀疏参数化难以适用。MultiHashFormer 通过多组独立哈希函数为每个 token 构造独特哈希签名(hash signature),将单一碰撞转变为可控的多重编码,并以 Hash Encoder / Decoder 桥接 Transformer 解码器,既保持了参数量与 (V) 解耦(恒定参数足迹),又能区分每个 token。此举使得模型在多语言词汇扩展(例如从单语扩展到百种语言)时无需增加嵌入参数,直接复用已有结构,极大提升了工程可扩展性与部署灵活性。

行业类比

类似文件系统的 inode 索引:用少量元数据唯一标识大文件,而不复制整个文件内容,MultiHashFormer 用短哈希签名代替完整词向量,让参数效率与辨识精度兼得。

核心洞察

  • 哈希碰撞是传统哈希嵌入无法用于自回归生成的根本障碍,MultiHashFormer 通过多哈希函数生成唯一签名,将每个 token 映射为固定长度且几乎无碰撞的哈希 ID 序列,从而使哈希嵌入首次可用于因果语言模型。这与以往仅在编码器模型中使用的单哈希压缩方案形成鲜明对比,因为后者无法区分不同 token 导致信息在解码时丢失,而多哈希签名则提供了可逆的离散表示,为参数高效且不受词汇量线性约束的自回归建模打开了新路径。
  • 该方法将词汇表扩展问题从参数维度转移到计算维度:无论增加多少新 token,模型参数量保持恒定,仅需增加哈希函数数量或哈希签名长度。这与标准嵌入矩阵随词表线性增长、以及固定容量嵌入必须修改模型架构才能添加新词的做法有本质区别。在实际工程中,这意味着一个预训练的 MultiHashFormer 可以直接适配新语言或新领域术语,无需重新训练整个嵌入层,极大降低了模型部署和持续学习的内存与计算开销。

方法

输入与哈希签名生成

MultiHashFormer 将每个词表 token 映射为多条独立哈希函数输出的离散哈希 ID 序列,称为哈希签名。该序列长度固定(例如 8 个哈希 ID),每个维度由一个不同的哈希函数生成,从而极大降低词元碰撞概率——即使发生局部碰撞,组合签名仍几乎是唯一的。相比传统词嵌入矩阵,存储开销从 V × d 降至 K × H × d_h(V 为词表大小,H 为哈希函数数,K 为每个哈希函数的分桶数,d_h 为桶嵌入维度),显著减少参数量,且可支持无界词表扩展。

Hash Encoder:签名压缩

哈希签名中的每个哈希 ID 先通过各自的哈希桶嵌入表获取稠密向量,然后全部拼接或加权融合,经一个轻量级编码器(例如小型 MLP 或 Transformer 层)压缩成单一的词元级潜向量。此向量作为标准 Transformer 解码器的输入,替代传统词嵌入。

Transformer 解码器

潜向量序列送入标准自回归 Transformer 解码器,通过因果注意力生成下一步的潜在状态。解码器结构与经典语言模型一致(如 Llama 风格或 GPT 风格),无需修改内部计算,仅将词嵌入层替换为 Hash Encoder 输出。

Hash Decoder:从潜状态恢复哈希签名

解码器输出的隐藏状态被送入Hash Decoder,它包含对应于每个哈希函数的分类头(即 H 个线性分类器),每个头预测下一个 token 在对应哈希空间中的分桶 ID。训练时,损失函数为每个哈希函数的交叉熵损失之和(或加权和),等价于独立的多类分类任务。推理时,取每个头预测的哈希 ID 组合成签名,再反查签名到文本的映射表定位具体 token。

与同类方法的差异

先前工作仅在编码器模型中采用多对一哈希(多个 token 共享同一个嵌入向量),这破坏序列概率建模,无法用于因果 LM。MultiHashFormer 利用多哈希签名唯一化,首次实现了参数高效且支持自回归的哈希基语言模型,同时通过恒定规模参数支持跨语言词表动态扩展,无需重训嵌入层。

实验

实验设计

在 100M、1B 和 3B 参数规模的 Transformer 语言模型上验证,基线为标准 Transformer LM。在多个文本基准(如困惑度评估数据集)上对比困惑度、下游任务性能。同时测试词汇量扩展场景:在固定参数下增加多语言词汇,评估困惑度变化,验证哈希架构对词汇规模的不敏感性。

关键发现

MultiHashFormer 在所有参数规模上均稳定取得更低困惑度,且性能优势随模型增大保持。在多语言词汇扩展任务中,模型无需额外参数即可维持生成质量,参数足迹恒定,验证了哈希签名对词汇量解耦的有效性。GitHub 提供了复现参考。

与基线对比

与标准 Transformer LM 的密集嵌入矩阵相比,哈希签名 将每个 token 表示为多个离散哈希 ID 序列,通过 Hash Encoder 压缩为固定维度向量。这种设计避免了显式的大词汇量嵌入,使参数量与词汇量解耦,在不牺牲表示能力的前提下显著提升参数效率。多个独立哈希函数缓解了碰撞问题,使自回归生成成为可能。实验表明,这种离散-稠密混合表示 在通用语言建模和多语言场景下均优于纯稠密嵌入,为大规模语言模型的参数高效化提供了新范式。

行业影响

落地场景

参数效率提升使得 MultiHashFormer 在移动端/边缘端智能助理、实时对话系统、多语言内容生成平台等场景具备优势。其固定参数规模的词汇扩展能力,尤其适合需要快速增加新词或语言且资源有限的全球化产品,例如多语言客服机器人、教育 App 中的交互式学习助手。

商业价值

  • 降本:减少超大词汇表嵌入矩阵带来的存储与计算开销,直接降低推理成本,尤其当模型需要频繁更新词表时无需重新训练参数。
  • 增收:支持快速上线新语言或垂直领域(如医疗、法律术语),加速全球化扩张,缩短产品迭代周期。
  • 体验提升:边缘推理延迟更低,用户交互更流畅;同时避免 OOV(集外词)带来的性能退化。

与现有产品/工作流的接口

该模型可与标准 Transformer 解码器堆栈无缝集成,只需替换嵌入与输出层。在实际部署中,可作为现有推理管线的即插即用模块:

  • 替换 Hugging Face Transformers 中的默认嵌入层,复用现有训练框架。
  • 对于多语言服务,微调阶段可保留 Hash Encoder/Decoder 参数,仅更新 Transformer 主体,快速适配新词表。
  • 搭配量化/蒸馏技术,进一步实现端侧部署。

具体落地用例

  1. 全球化电商平台的多语言客服:电商平台需要支持数十种语言的自动回复。使用 MultiHashFormer 可在不增加模型总体参数的前提下容纳新语言词汇,降低部署多模型带来的维护成本,同时保证低资源语言的回复质量。
  2. 内容平台的实时低俗内容过滤:社交媒体或视频平台需要不断更新敏感词库以应对新型违规内容。利用该模型的哈希编码特性,可以动态扩展词汇表而不需重新训练整个模型,提升审核系统的响应速度和覆盖范围。

局限

  • **哈希签名生成与解码开销**:每个 token 在编解码阶段均需通过多个哈希函数生成离散 ID 序列,并由 Hash Encoder/Decoder 进行压缩与恢复,这在推理时引入了额外的计算和存储开销。虽然参数规模恒定,但实际吞吐量可能低于同等参数量的标准嵌入方法,论文未详细对比推理延迟或训练耗时,工程部署时需权衡参数效率与速度。
  • **哈希碰撞的潜在语义混淆**:尽管多哈希函数大幅降低了完全碰撞的概率,但仍存在部分哈希 ID 一致的边缘情况,尤其在长尾或低频 token 上可能造成不同 token 共享相近签名,导致语义混淆。论文未对极端低资源语言或高度专业术语进行碰撞率分析,实际多语言扩展时可能存在性能波动。
  • **自回归机制下签名解码的稳定性**:Hash Decoder 将连续隐向量映射为离散的哈希 ID 序列,这一生成过程可能引入误差累积,尤其在长序列生成时,单个 ID 预测错误会级联放大,最终导致文本还原失败。论文仅在标准基准上评测困惑度等指标,未深入分析生成任务的稳定性与多样性,如开放式对话或长文档生成场景的表现尚待验证。
论文Huiyin Xue2026-06-26原文

相关内容