论文

LLM预训练中领域数据重复的缩放

LLM预训练中领域数据重复的缩放

随着大语言模型规模扩大,其训练 token 预算也必须相应增加,以维持合适的 tokens-per-parameter ratio(TPP)。然而,高质量领域数据远比通用网页数据难以扩展,导致其在训练混合数据中的占比随模型规模增大而下降。重复利用现有高质量数据是抵消这种稀释的有效手段,但过度重复会引发过拟合。本文研究在训练 token 预算随模型规模成比例增长这一实际扩展场景下的权衡取舍。 研究发现,在固定的 TPP 下,最优重复次数会随模型规模轻微增加;跨领域对比则表明,最优重复次数与领域最终验证损失呈强负相关——损失越低的领域通常可容纳更多重复。相比之下,唯一数据量与最优重复次数的关联较弱。 上述结论意味着,在相同 TPP 下,基于较小代理模型调优得到的重复次数,可为更大规模的模型提供实用估计,从而降低调参成本。

论文精读

TL;DR 研究 LLM 预训练中高质量领域数据重复的 scaling 规律:最优重复次数随模型规模略微增加,且与领域验证损失负相关、与数据量弱相关,可用同 TPP 的小模型预估大模型重复策略。

问题

问题背景

大语言模型(LLM)预训练中,tokens-per-parameter (TPP) 比例是维持模型性能的关键指标。随着模型规模扩大,需要同步增加训练 token 预算,但高质量领域数据(如代码、数学、科学文本)的扩展速度远低于通用网络数据,导致其在训练混合中的比例被不断稀释。

现有方法局限

当前常见做法是简单重复领域数据或凭经验调整混合比例,但缺少对最优重复次数的系统指导。多数研究仅考察固定数据规模或固定模型大小下的重复效果,没有在模型规模与 token 预算按比例增长的实用 scaling 条件下分析该问题。这使得大模型训练时只能依赖小规模实验外推,容易因重复不足导致领域能力稀释,或因过度重复引发过拟合,且不同领域的最佳策略差异显著。

为什么这个问题难且重要

最优重复次数需要在数据利用率与过拟合风险之间做精确权衡,且该权衡随模型规模和领域特性动态变化。业界关注大模型训练效率与领域能力保持,重复数据是最直接的调节杠杆之一,但缺乏可预测的规律时,大模型实验成本极高。本文通过实验发现,固定 TPP 下最优重复次数随模型规模仅轻微增加,且与领域最终验证损失强负相关,而与独特数据量弱相关。这一发现使小 proxy 模型上调优的重复次数可以外推到更大模型,为实际工程提供了低成本、可操作的估计方法。

行业类比

类似在指令微调中通过重复高质量指令样本提升特定任务能力,但预训练领域的重复策略需要更严格的外推验证,否则可能损害通用能力。

核心洞察

  • 在固定 tokens-per-parameter ratio (TPP) 下,最优重复次数随模型规模增大而温和增加,颠覆了“大模型需要更多数据多样性、重复更易过拟合”的直觉。以往关于数据重复的研究通常在小模型或固定训练预算下进行,结论往往强调重复有害或收益有限。本文在实用的 proportional scaling 设定下发现,由于领域数据质量高且稀缺,模型规模增大时更多重复反而能更好地利用这些数据,这为大规模训练中的数据重复策略提供了直接指导:重复次数应随模型规模微调,而不是保持不变。
  • 最优重复次数与领域最终验证损失强负相关,而与领域独特数据量弱相关,表明“该领域学得多好”比“有多少数据”更能决定重复的价值。这提供了一个更简单的启发式:可以通过评估模型在特定领域上的验证损失来估算该领域的最优重复次数,而不是依赖于数据量统计。与通常基于数据量或启发式分配重复的方法不同,这一发现将重复策略与模型的实际学习难度联系起来,为自动调整数据混合中重复比例提供了可操作的信号。

方法

方法

输入:多个高质量域数据集(例如代码、数学、多语言文本),记录每个域的唯一 token 数;同时指定模型规模序列与固定 TPP(tokens-per-parameter ratio,token 数 / 参数量)。

关键模块:

  1. 训练框架:对每个模型规模,保持 TPP 不变,即训练 token 总数随参数量线性增长。此时目标域在训练混合中的自然占比会因总 token 膨胀而下降。
  2. 重复控制:通过调整采样权重或数据加载顺序,对目标域施加不同的重复次数(例如 1x、2x、4x、8x),使该域在训练 token 中的实际占比恢复到期望水平。每个重复次数配置独立训练。
  3. 评估与最优选择:在固定验证集上计算目标域的最终验证损失,选择使验证损失最低的重复次数作为该模型规模下的最优值。

输出:得到最优重复次数与模型规模、域验证损失、唯一 token 数的关系。发现最优重复次数随模型规模轻度增加,且与域的最终验证损失强负相关(损失越低,可容忍更多重复),与唯一数据量弱相关。

原文论断:重复次数在固定 TPP 下可由小模型代理调优,为大规模模型提供实用估计。

与同类方法差异:以往工作多关注固定模型规模下的全局重复,或将重复视为静态超参;本文在 scaling 条件下研究域级重复,并建立以验证损失为导向的代理调参策略。

实验

实验设计

  • 在固定 tokens-per-parameter ratio (TPP) 下,对单一高质量领域数据执行不同重复次数,观察验证损失与过拟合。
  • 跨多个领域和多个模型规模,扫描最优重复次数。
  • 基线:无重复(仅使用唯一数据)以及固定重复策略。

关键发现

  • 最优重复次数 随模型规模温和增加,与直觉“更大模型更容易过拟合”相反。
  • 最优重复次数与 领域最终验证损失 强负相关:验证损失越低的领域可承受更高重复而不过拟合。
  • 与 唯一领域数据量 仅弱相关,说明数据规模不是决定重复上限的主要因素。
  • 小模型在同 TPP 下调优的重复次数可为大模型提供实用估计。

与基线对比

  • 相比“重复数据必然导致过拟合”的常规认知,本工作表明在 TPP 比例缩放约束下,适度重复是缓解高质量数据稀释的有效手段,但需按领域损失动态调整。
  • 相比固定重复或按数据量设定重复,按验证损失调优更贴合实际 scaling 行为。

行业影响

落地场景

在 LLM 预训练中混入高质量领域数据(如代码、医疗文本、金融报告、法律文书)时,该研究可直接指导重复策略。例如:

  • 代码模型:复用有限的高质量代码库(如 GitHub 私有仓库精选数据)进行多轮重复,提升代码生成性能,无需持续采购新数据。
  • 企业知识库 LLM:对内部文档、客服对话、交易记录等高价值数据,通过代理小模型搜索最优 repetition count,再应用到大规模预训练。

商业价值

核心降本路径是减少高质量数据采集与清洗开销。高质量领域数据通常比通用网络数据昂贵数倍,重复利用能显著降低每 token 数据成本。同时,根据最终验证损失(而非唯一数据量)决定重复数,可避免盲目堆数据或过度重复导致的过拟合,提升下游任务指标,间接改善产品竞争力。

与现有工作流接口

可直接嵌入现有 数据混合调优 流程:

  1. 在小模型(proxy model)上固定 TPP 扫描不同 repetition count,记录各 domain 的 validation loss。
  2. 依据 optimal repetition count ∝ 1 / domain validation loss 的经验规律,外推到目标大模型。
  3. 在训练框架(如 Megatron-LM、DeepSpeed)中配置数据重复采样器,无需改动架构。

该流程与当前 scaling law 驱动的数据配比实验 天然兼容,适合已搭建小模型快速迭代平台的团队直接落地。

局限

  • **实验范围有限**:作者仅在固定 `TPP` 比例下考察了少数领域(如代码、数学、科学文本)和模型规模序列,未覆盖更大模型或不同 `TPP` 策略下的行为。实际预训练中,`TPP` 常根据算力约束动态调整,重复次数的最优值可能对 `TPP` 的选择敏感;当前结论的普适性仍需在更广的规模与混合比例空间验证。
  • **重复策略简化**:论文假设对整个领域数据做均匀重复,未考虑选择性重复(如仅重复高价值样本或低熵样本)。真实系统常用课程学习或数据加权,均匀重复可能不是最优方案。此外,仅以验证损失为指标,未评估下游任务性能,而验证损失下降不一定转化为实际能力提升,尤其在高重复时可能产生过拟合迹象。
  • **未与数据混合比例优化联合考虑**:固定领域数据占比后研究重复次数,但实际预训练会同时调整混合比例与重复次数。论文指出最优重复与领域验证损失负相关,这暗示低损失领域值得更多重复,但如何在不同领域间分配重复预算仍是一个开放问题;缺少与现有数据选择/混合比例方法的直接对比,限制了结论的工程指导性。
论文Jingwei Li2026-08-14原文

相关内容