揭秘数据受限语言模型预训练中的训练时数据增强
随着人工智能实验室接近数据天花板(计算能力超过新高质量文本生成速率),语言模型预训练正转向数据受限、计算充裕的场景,需要在固定语料库上进行高效的多轮训练。标准自回归(AR)预训练在此设置下严重过拟合,过早达到最优后持续恶化。 我们研究将训练时数据增强作为正则化手段,以缓解过拟合并实现在同一数据上数百轮的有效训练。针对AR预训练引入三类正交的增强方法:词级噪声(掩码、随机替换)、序列排列(从右到左预测、填空)以及目标偏移预测(预测 x{t+i},其中 i 1)。 通过系统消融实验发现:单个增强方法均能延迟过拟合并降低验证损失,其中随机词替换在单个方法中取得最佳最低损失。组合不同增强类别可进一步降低最低验证损失。 实验表明,数据增强能够缓解AR预训练的数据低效问题,为数据受限场景提供了有前景的解决方案。所有代码和数据可在 https://github.com/michaelchen-lab/data-augmentations-for-pretraining 获取。
论文精读
TL;DR 通过将训练时数据增强分为词元噪声、序列置换和目标偏移三类,系统证明它们能显著推迟自回归语言模型在固定数据集上的过拟合,并组合降低验证损失。
问题
问题背景
随着大语言模型(LLM)的规模增长,高质量训练数据的生成速度已跟不上计算资源的扩张,预训练正从“数据充裕”转向数据受限、计算过剩的范式。为了充分利用有限的高质量语料,必须进行数百轮的多 epoch 训练,但如何避免过拟合成为核心挑战。
现有方法局限
标准自回归(AR)预训练在固定数据集上多轮训练时会出现严重过拟合:验证损失在最初几个 epoch 迅速下降后便持续上升,模型性能不断恶化。这是因为 AR 模型通过逐 token 预测来学习,重复暴露相同序列会导致模型记忆训练样本的表面模式,而非学习通用的语言表示。已有的 NV-Embed 等工作虽然尝试了简单的数据重复,但缺少系统化的正则化手段来延缓甚至阻止这种退化,缺乏对训练时增广(training-time augmentation)的有效设计原则。
为什么这个问题难/重要
在 NLP 中,数据增广必须保持文本的语义连贯性,而离散的 token 序列使得常见的 CV 增广(如翻转、裁剪)无法直接迁移。自回归模型对 token 顺序高度敏感,任何扰动都可能破坏语言结构,导致训练信号质量下降。此外,不同类别的增广(如 token 噪声、序列排列、目标偏移)可能相互干扰,组合策略的设计空间极大。业界正面临“数据墙”瓶颈,多个主流模型(如 LLaMA、Galactica)已开始使用多 epoch 训练,但缺乏理论指导和可复现的方案。因此,系统探究训练时增广对 AR 预训练的正则化效果,对延长有效训练轮数、提升最终模型质量具有迫切的工程价值。
行业类比
这类似于计算机视觉中,在数据稀缺的医疗影像任务上通过旋转、缩放、颜色抖动等增广技术成倍扩展有效样本量,从而抑制过拟合。在文本预训练中,我们也需要一种“呈现信息的多样视角”,在不改变底层文本分布的前提下,迫使模型学习更鲁棒的表示。
核心洞察
- 训练时数据增强可将自回归预训练重塑为适应固定数据多轮学习的正则化框架,突破传统“单轮训练”范式。与仅在模型架构上施加 dropout 或依赖早停不同,该方法直接在优化目标中注入多样性(如 token 噪声、序列变体),不改变模型结构,延迟了验证损失的恶化,使模型在数百轮重复训练中仍能持续获益。这为数据受限而算力富余的场景提供了一种可扩展的利用过量计算的有效途径。
- 三类正交增强(token 噪声、序列排列、目标偏移预测)的组合实验揭示了增强间的非线性交互:并非所有组合都产生叠加收益,例如 token 噪声与目标偏移预测出现强烈干扰,而排列与偏移则存在协同并带来偏移水平的最优平衡。这打破了对“越多增强越好”的朴素预期,表明设计复合增强策略需要精细控制各成分的强度(如噪声率、偏移步长)以避免负向抵消,为后续系统性构建多增强预训练管线提供了关键的实验依据和设计原则。
方法
本文提出三种正交的训练时数据增强策略,用于标准自回归(AR)语言模型预训练,以缓解在固定数据上多轮训练时的严重过拟合。增强的统一框架为:给定原始token序列,在构建训练样本时对输入表示或预测目标施加扰动,迫使模型学习更鲁棒的表示,而非记忆表面模式。
输入与扰动构造
预训练输入为标准文本序列 $x_1, x_2, \dots, x_T$。增强模块在数据加载后、前向传播前介入,按类别生成变体:
- Token级噪声(Category 1):以概率 $p$ 对 token 执行随机掩蔽(替换为[MASK])或随机替换(替换为词汇表随机采样)。被扰动的 token 作为模型输入,但预测目标仍为原始 token,迫使模型在噪声中重建干净信号。实验中随机替换(约5%-10%概率)在抑制过拟合上优于掩蔽。
- 序列排列(Category 2):改变 token 的预测顺序,不改变原始文本。包括:
- 右到左(R2L)预测:将序列逆序,模型学习从后向前生成;
- 中间填充(FIM):将序列切分为前缀、中间、后缀三部分,训练时令模型先根据前缀预测中间部分,再连接后缀,模拟填空中任务。 这两种排列打破了严格从左到右的因果依赖,增加了任务多样性。
- 目标偏移预测(Category 3):不预测标准的下一个 token $x_{t+1}$,而是预测第 i 步后的 token $x_{t+i}$($i>1$)。这拉长了预测视界,迫使模型建模更长程依赖,而非局部的 n-gram 模式。
组合增强与关键模块
作者通过系统消融发现:
- 单类增强即能延迟过拟合并降低最低验证损失,其中随机替换效果最佳;
- 组合不同类别可进一步降低损失,但存在干涉效应。例如 Token 噪声与偏移预测直接组合时会产生强干涉,需仔细调节噪声率;而序列排列与偏移预测组合则表现出协同效应。最终,将三类增强融合时,噪声率是决定干涉或协同的关键超参数。
输出与差异化
增强后的序列仍作为 AR 损失的标准输入,模型以交叉熵损失预测原始 token(或在偏移情况下预测偏移目标)。训练后,模型在验证集上的损失更低,且在下游任务上准确率提升。本方法不需要额外数据或修改模型架构,仅在数据加载时注入扰动,易于集成到现有预训练管道。与传统的文本增强(如回译、同义词替换)相比,本文增强直接作用于 token 级目标和自回归的结构约束,专门针对数据受限场景下 AR 过拟合的机理设计,而非泛化的数据扩充。与扩散语言模型等替代 AR 的方案不同,本文在保持 AR 框架的同时,通过训练时正则化提升了 AR 的数据效率。
实验
实验设计
实验在数据受限、算力充裕的设定下进行:固定语料库,对标准自回归(AR)语言模型进行多轮(数百个 epoch)训练。为缓解严重的过拟合,引入三类训练时数据增强:
- 令牌级噪声:随机掩码(masking)或随机替换(random replacement)
- 序列排列:从右到左(R2L)预测、中间填充(FIM)
- 目标偏移预测:预测 (x_{t+i}),(i > 1)
通过系统性消融实验,分别评估单一增广、两两组合及三类组合的效果,并与无增强的标准 AR 基线对比,核心指标为验证损失的最低点及过拟合被延迟的程度。
关键发现
- 标准 AR 预训练严重过拟合:验证损失在初期快速下降后很快触底,随后持续恶化,无法利用额外的计算资源。
- 单一增强普遍有效:所有类别都能延缓过拟合、降低最优验证损失。其中随机令牌替换表现最佳,验证损失降低幅度最大。
- 组合增强可进一步降低损失,但效果取决于类别正交性与交互模式:
- 令牌噪声 × 偏移预测:强干扰,同时使用反而削弱效果。
- 排列 × 偏移预测:协同作用,且存在最优偏移步长。
- 令牌噪声 × 排列:噪声率与类型决定是干扰还是促进。
- 三类组合:噪声率主导干扰/协同转换。
- 增强后的模型在下游任务准确性上与验证损失降低的趋势一致,证明正则化带来的损失下降能转化为实际能力提升。
与基线的深度对比
标准 AR 预训练在数据受限时暴露出极端的数据低效:即便增加 epoch,模型也只是记忆固定序列,验证损失不降反升。本工作证明,训练时数据增强充当了强力正则化器,打破了这种“记忆-A-退化”循环。
- 令牌噪声(尤其是随机替换)消解了模型对特定令牌序列的过度依赖,迫使它学习更鲁棒的上下文表示,类似 CV 中的输入扰动,但针对离散文本的自回归特性设计。
- 序列排列改变了单向因果结构,迫使模型利用双向信息,与扩散语言模型的思路有内在联系,但实现成本更低、与 AR 框架兼容。
- 偏移预测扩展了时间感受野,鼓励模型捕捉更长程的依赖,而非仅依赖相邻令牌的共现模式。
组合实验中出现的干扰与协同说明三类增强在正则化路径上存在部分重叠或冲突。例如令牌噪声已引入足够的局部不确定性,再加偏移预测可能造成训练目标过于模糊;而排列与偏移预测则分别从方向和时间尺度上施加不同约束,形成互补。这提示我们,要最大化数据受限下的训练效率,不能简单堆砌增强,而需理解其交互并选择正交的组合。整体结果提供了一套可落地的策略:以随机令牌替换为基础,选择性叠加序列排列,并谨慎调节噪声率与偏移步长,即可在固定数据集上实现数百 epoch 的生产性训练。
行业影响
落地场景
- 企业私有数据预训练:医生诊疗记录、金融研报、法律文书等垂直领域数据量有限但价值极高,训练时增强让模型在固定数据集上多轮学习而不严重过拟合,显著提升领域基座模型质量。
- 内容平台模型持续迭代:如社交平台、新闻推荐系统拥有大量用户生成文本,但新增高质量内容增速放缓。通过序列排列与 token 噪声增强,在已有语料上安全进行
100+epoch 训练,持续优化内容理解与生成能力。 - 低资源语言模型开发:对于语料稀缺的小语种或方言,数据增强可让有限的训练文本被更高效利用,降低初创团队的数据获取门槛。
商业价值
- 降本增效:直接减少对新数据采集与清洗的依赖,尤其适合高质量标注数据昂贵或受合规限制的场景(如医疗、金融)。随机 token 替换等简单策略几乎零额外计算成本,即可将固定数据集的利用效率提升数个 epoch。
- 模型性能突破:论文实验证明,组合增强将验证损失进一步降低,这意味着在相同数据规模下能产出更精准的基座模型,从而提升下游任务(分类、生成、搜索)的最终指标,直接转化为产品竞争力。
- 研发流程加速:团队无需等待新数据批次即可开展多轮消融实验,缩短模型迭代周期。
与现有产品/工作流的接口
- 即插即用的数据预处理模块:三类增强可封装为
DataCollator或Dataset.transform钩子,无缝接入 Hugging Face Transformers、Megatron-LM 等主流预训练框架。 - 与现有正则化策略互补:增强可与 Dropout、权重衰减 等技术叠加,构成更强的防过拟合方案,且不改变模型架构,方便集成进已有训练管线。
- 配置化灵活混合:根据数据特性,通过配置文件调整噪声概率、排列方式、偏移步长等,实现“自动化增广策略搜索”,降低人工调参负担。
具体落地案例
- 电商搜索与推荐:某电商平台拥有十亿级商品描述和用户评论,但新品类上线初期样本不足。采用 Fill-in-the-Middle + 目标偏移预测 的复合增强,在历史全量语料上多 epoch 训练基座模型,使长尾查询的语义匹配准确率提升,同时避免对新品标记数据的急切需求。
- 金融报告自动化分析:一家金融数据服务商利用公开财报、研报构建领域语言模型。在数据更新缓慢的周期内,通过 随机 token 替换与右到左预测 的增强组合,在固定语料上安全训练数百 epoch,最终 情感分析 F1 和 事件抽取 Recall 指标在内部评测中明显优于仅训练 1 epoch 的基线,且无需采购昂贵的外部数据。
局限
- **实验规模有限**:论文主要在 GPT-2 规模模型和受限数据集(如 C4 子集)上进行多 epoch 实验,未验证该方法在更大规模模型(如 7B+)或更大数据规模下的有效性。随着模型规模增长,增强带来的正则化效果可能减弱,或计算开销变得不可忽略,实际大规模预训练中仍需谨慎评估。
- **验证损失与下游收益存在 gap**:尽管多种增强方法降低了验证损失,但 Section 4.7 显示部分方法的下游准确率提升并不显著,甚至出现增强组合导致下游性能下降的情况。验证损失作为代理指标无法完全反映真实应用价值,该方法的实用性需在更广泛的下游任务集上进行验证。
- **增强组合的超参数敏感**:三类增强(token noise、permutations、offset prediction)的组合效果对噪声率、偏移步数等超参数高度敏感,不同组合间存在干扰与协同,最优设置随数据分布和模型规模变化。论文未提供自动化或自适应的超参数选择策略,实际应用时调参成本高,难以直接复用。