论文

语言模型需要可训练的输入嵌入表吗?1.7B 级别的固定最小 token 编码

语言模型需要可训练的输入嵌入表吗?1.7B 级别的固定最小 token 编码

可训练的输入嵌入表为每个词表项分配一个可独立调整的向量。本文探究这种 token 特定的参数化是否是获得实质语言建模能力的必要条件,抑或共享 Transformer 也能从固定的 token 身份中学习。 我们比较三个从零训练的 decoder-only 语言模型,它们共享相同 tokenizer、上下文骨干、非绑定输出头架构与训练配方,每模型目标预算 1000 亿预测 token。输入接口分别为可学习嵌入表、规范的 16-bit token-ID 编码,以及一个 GF(2) 上的固定可逆重编码;固定编码直接重复到模型宽度,不额外添加可训练输入投影。 两个固定编码模型都具备可观能力:规范编码取得 52.40% HellaSwag 归一化准确率、70.51% PIQA 与 42.75% LAMBADA 准确率。可学习输入对照在多项评测(含 HellaSwag、LAMBADA)上更优,故结果证明的是可行性而非性能持平。固定接口移除 1.007 亿可训练参数,得到 1.711B 模型,但参数下降并非核心结论。 这些单次实验区分了架构必要性与经验效用:对上述能力而言,token 特定的可独立训练输入向量并非必需。固定身份接口也为研究不可变输入下游的表征学习提供了受控环境,但未指明具体能力位于何处。

论文精读

TL;DR 用固定 16 位 token 码替代可训练输入嵌入表,在 1.7B 模型、100B token 训练后仍取得 52.4% HellaSwag 等可观成绩,证明 token 特定可训练向量并非语言模型能力的必要条件。

问题

问题背景

当前主流 LLM 普遍使用可训练输入嵌入表,为每个 token 分配独立可调向量,参数量随词表线性增长。这一设计已成为默认真实,但其架构必要性缺乏严格对照验证。

现有方法局限

现有研究大多将 learned embedding 视为不可分割的组件,少数探索固定或共享输入的尝试存在明显局限:一是固定 one-hot 或随机编码维度高且稀疏,常需额外线性投影,混淆了“固定编码”与“可训练投影”的贡献;二是小规模或非 decoder-only 设置下结论难以迁移到 1B+ 级语言模型;三是缺少相同 tokenizer、上下文骨干、训练 recipe 下的控制变量实验,无法区分“架构必需”与“经验有效”。

为什么这个问题难/重要

挑战在于:完全移除 token-specific 可训练性后,所有词义区分必须由共享 Transformer 从固定二进制码中涌现,这考验模型归纳偏置与优化能力。同时,输入嵌入表在 100B token 训练规模下涉及巨大参数,若可被固定编码替代,将改变参数预算分配与模块化设计思路。业界对 scaling law 中的参数构成和表示学习边界高度关注。

行业类比

类似视觉 Transformer 中 patch embedding 可训练但固定正弦位置编码依然有效——固定接口可以成为可控实验仪器。

核心洞察

  • 固定最小 token 码将输入嵌入表从必需组件降级为可选选项:在 1.7B 参数、100B token 训练规模下,使用 16-bit 规范 ID 码或 GF(2) 可逆重编码作为输入,无需额外可训练投影,模型仍取得 HellaSwag 52.40% 等实质能力。独特之处在于这是首次在同架构、同训练配方下的大规模严格控制实验,明确区分了架构必要性与经验效用,而非仅报告参数减少。
  • 固定身份接口作为“不可变输入边界”提供了研究表示学习的新实验仪器:因为输入 token 身份在训练中完全固定,模型内部形成的任何 token 特异性表示都必然是 Transformer 自身计算的,而非从可训练表中读取。这区别于常见的冻结嵌入或嵌入共享方法,它不假设 token 语义需预存于输入侧,而是强制网络从零构建语义映射,为模块化系统和编码几何研究提供干净基线。

方法

输入接口设计

本文对比三类解码器模型的输入表示。基线模型 使用标准的 可训练输入嵌入表,为每个 token 分配独立可调向量。两种固定接口均不包含任何可训练输入参数:

  • Canonical 16-bit token-ID codes:将每个 token 的整数 ID 转为其 16 位二进制表示(最小定长编码),再把该二进制码重复填充到模型宽度 d_model,不经过额外的可训练投影。
  • Fixed invertible recoding over GF(2):在二元域上对 token ID 施加固定的可逆线性变换,生成新的等长二进制码;同样重复到 d_model 后直接输入 Transformer。该编码保持 token 间的唯一性,但改变原始 ID 的几何分布。

关键模块与控制变量

三种模型共享相同的 tokenizer、decoder-only Transformer 主干、untied 输出头 以及完整训练配方。总预算为每模型约 100B 预测 token。固定码模型的输入接口仅含一个确定性的 ID 到向量的映射函数,不引入任何可学习权重,因此移除约 1.007 亿参数。模型总参数量变为 1.711B,但参数减少并非实验核心目标,而是为了检验可训练 token 级参数是否是语言建模能力的必要条件。

训练与输出

所有模型采用标准下一 token 预测损失。固定码模型获得实质能力:Canonical codes 在 HellaSwag 归一化准确率达 52.40%、PIQA 70.51%、LAMBADA 42.75%;GF(2) 重编码接口同样保持可用。可训练嵌入对照在部分指标上更高,因此结果证明的是可行性而非性能等价。

跟同类方法的差异点:不同于随机冻结嵌入或共享嵌入等保留部分可训练参数的方案,本文提供完全固定且极简的 token 身份编码,在 1.7B 级模型上系统排除输入嵌入表的可训练性。

实验

实验设计

比较三个从零训练的 decoder-only LM,使用相同 tokenizer、backbone、untied output head 和训练 recipe,目标每模型 100B 预测 token。输入接口分别为 learned table、canonical 16-bit token-ID codes 和 GF(2) 固定可逆重编码。固定码重复到模型宽度,不引入额外可训练输入投影。

关键发现

两个固定码模型均获得实质语言能力:canonical codes 达到 HellaSwag 52.40%、PIQA 70.51%、LAMBADA 42.75%。固定接口移除 100.7M 可训练参数(模型约 1.711B),但参数减少非核心结论。作者强调:可独立训练的 token-specific 输入向量不是观察到能力的必要条件。

对比解读

learned table 在 HellaSwag 和 LAMBADA 上表现更好,体现可训练嵌入的经验效用;固定码尚不构成性能对等。固定接口的价值在于分离架构必要性与经验效用,并为下游表示学习提供 immutable input 的受控实验环境。该设计有助于研究固定输入下的表示形成,而非性能竞赛。

行业影响

落地场景

固定 token 身份接口(canonical 16-bit codes 或 GF(2) 可逆重编码)可应用于参数受限的端侧 LLM、多团队共享词表的模块化系统,以及需要冻结输入边界 的增量训练 / 联邦学习场景。例如:电商平台的多语言商品描述生成 中,固定码率词表能显著降低模型分发体积,适合在移动端 App 内运行轻量生成;内容平台的实时评论审核模型 可用同一套不可变 token code 接入不同领域语料,避免频繁重训练 embedding table。

商业价值

主要落在部署成本与迭代效率,而非通用精度提升。移除 100.7M trainable 参数(1.7B 规模下)可缩减显存占用与 checkpoint 体积,降低边缘设备门槛;同时固定输入接口允许不同团队并行开发下游 head,减少词表同步开销。不过 HellaSwag / LAMBADA 精度略低于 learned table,因此适合对成本敏感、对上限要求不极端的业务,或作为 research baseline。

与现有 stack 的集成

只需替换 Transformer 栈中的 input embedding 层为固定 code 重复构造,保持 tokenizer / backbone / untied output head 不变,即可接入现有预训练框架。类似 torch.nn.Embedding 的模块可换成无参数 FixedTokenCode,无需改动训练器。可作为 ablation / budget 超参 在配置中开关。

局限

  • 论文明确承认的局限包括:每个接口仅进行 **单次训练运行**,且未进行多种子重复,结果存在随机性风险;固定编码模型在多个评估上未达到与 learned input 的性能平行,尤其 **HellaSwag** 和 **LAMBADA** 指标落后;**输出头仍为可训练的 token-specific 参数**,并未完全去除词汇固有参数;此外没有展示系统效率优势,参数减少并非核心贡献。这些限制了证据强度,不能排除调优超参数或更长训练后差距缩小的可能。
  • 从实验设计可推断的局限:**固定编码的维度和赋值方式**(16-bit minimal binary 及 GF(2) 可逆变换)是人为设定的,缺乏对不同编码长度、不同二值化策略的系统扫描;固定输入接口无法灵活处理词汇表扩展或新 token 的插入,且输入表征的秩受限,可能影响模型对稀有 token 的表示能力;此外模型规模仅 1.7B 左右,无法推断更大规模或不同架构(如 encoder-only / MoE)下的表现。
论文A. Bochkov2026-10-02原文

相关内容