理解数据时间性对大型语言模型预训练的影响
大型语言模型(LLMs)通常在打乱顺序的语料上训练,导致模型知识在训练时冻结,其时间基础理解不足。本研究聚焦数据排序,探讨预训练动态对获取时间敏感事实知识的影响。主要贡献有两方面: 1. 基准与评估协议:引入包含7000多个时间相关问题的综合基准,以及评估模型是否准确关联事实与对应时间段的协议。 2. 实验与发现:在时间顺序排列的Common Crawl快照上预训练6B参数模型,并与标准打乱预训练对比。结果表明,顺序训练模型在通用语言理解和常识方面与打乱基线相当,但拥有更更新、更时间精确的知识。时间顺序预训练提高了事实新鲜度,而打乱预训练在旧数据上表现更佳(可能由于事实重复)。 这些发现,连同代码(https://github.com/kyutai-labs/kairos)、检查点和数据集(https://huggingface.co/collections/kyutai/kairos)的发布,为LLMs的持续学习研究奠定了基础。
论文精读
TL;DR 在时间排序的 Common Crawl 快照上预训练 6B 模型,相比混洗基线,知识更时新、时间定位更准,且通用能力持平。
问题
问题背景
大语言模型(LLM)的知识通常“冻结”在训练数据所覆盖的时间范围内,模型无法可靠地将事实与其发生的时间段关联,这限制了其在需要时间敏感信息的场景(如新闻分析、历史事件查询)中的应用。
现有方法局限
标准预训练流程采用随机打乱 (shuffled) 的语料顺序,导致模型在获取知识时缺乏明确的时间锚点,具体表现为:
- 时间混乱:网络语料(如 Common Crawl)本身混杂不同年份的文本,打乱后模型难以区分知识的时效性,常出现“某事实在旧数据中已存在却被错判为最新”的情况。
- 评估缺失:已有的知识评测基准(如MMLU、TriviaQA)大多不要求分辨事实的时间属性,无法衡量模型将知识正确对应到时间区间的能力。
- 更新困难:缺乏对预训练数据时序性 (data temporality) 的理解,使得后续持续学习(continual learning)策略如数据回放、正则化等,缺少关于知识时效衰减的定量指导。
为什么这个问题难/重要
- 技术挑战:按时间顺序预训练可能引入灾难性遗忘 (catastrophic forgetting)——当模型先后学习不同时间段的数据时,旧知识易被覆盖;同时,如何让模型在无明确时间戳标注的情况下内化时间关联,仍是开放问题。
- 业界关注度:随着LLM越来越多地用于事实核查、实时信息生成等场景,事实新鲜度 (factual freshness) 和时间精度 (temporal precision) 成为关键指标。先前工作已尝试通过检索增强或微调注入新知识,但预训练阶段的时序设计尚未被系统研究,本工作填补了这一空白。
行业类比
类似金融舆情分析 (financial sentiment analysis) 系统需要区分不同财报期的信息,LLM的时间感知能力直接决定其能否正确回答“某公司2023年 Q3 营收是多少”而非给出一个混杂多年的平均值。
核心洞察
- **数据顺序是预训练中被低估的超参数。** 该工作首次系统对比了按时间顺序排列与随机打乱的 Common Crawl 快照对 6B 模型的影响,发现顺序训练能显著提升事实新鲜度与时间精度,而通用性能持平。这与传统聚焦于数据规模、质量或配比的研究范式不同,揭示了数据排序本身对知识获取的动态影响——随机打乱可能通过重复传播导致模型过度优先旧事实,而时序训练更接近持续学习,使模型自然朝向更新信息收敛。这一发现为优化预训练数据管道提供了新维度。
- **KairosQA 基准和被构建为时间对齐的动态评测工具。** 不同于静态的事实性问答集,它包含 7000+ 带有时间锚定的问题,并配套评估协议,可以测量模型将事实正确关联到时间区间的能力。这为研究 LLM 的时间认知和持续遗忘现象提供了一个可控的测试床,使研究者能够观察模型在不同训练阶段对历史信息的保持与刷新。这种设计补充了现有基准只评估‘知道/不知道’的缺陷,直接服务于持续学习场景下知识保鲜的工程需求。
方法
方法核心在于探究预训练数据时序排序对 LLM 获取时间敏感事实知识的影响。主要包含两个部分:时序预训练策略 与 时序评估基准 KairosQA。
输入:按时间组织的 CommonCrawl 快照
原始预训练数据来自 CommonCrawl,但传统做法是跨月度抓取搅乱后训练。本文则保留快照的时间顺序,将每年或每月的 CommonCrawl 快照视为一个独立 epoch,按从旧到新的顺序依次训练。数据仅经过常规质量过滤,未改变分布。
关键模块 1:时序顺序预训练 (Sequential Pre-training)
采用 Helium 6B 模型架构作为基础。训练时,模型首先在最旧的快照上训练完整一轮,再加载下一年的快照继续训练,以此类推,直至覆盖最新数据。这与标准搅乱预训练 (shuffled baseline) 形成对比:搅乱预训练使用相同总量数据,但所有快照混合后随机排序。
- 学习率调度:每个快照训练周期内使用余弦衰减,切换到新快照时重置学习率,缓解灾难性遗忘。
- 优化器与超参:沿用标准 LLM 预训练配置 (AdamW, 批量大小、序列长度等)。
这种顺序训练迫使模型按照数据产生的时间先后积累知识,最新参数更贴合近期事实。
关键模块 2:时序评估基准 KairosQA
为衡量模型的时间对齐能力,构建了 KairosQA 基准:
- 事实提取:从 Wikidata 中筛选具有时间属性的关系事实(如 position held 有起止时间)。保留约 20 种关系,每个关系对应一段有效时间区间。
- 问题生成:基于模板将三元组转化为自然语言问题,涵盖“某人何时担任某职?”、“某队伍在某年获得冠军?”等。总共生成 7000+ 道问题。
- 评估协议:对每个问题,提供起始时间和终止时间作为候选答案的区间范围。模型生成的答案需落在正确时间区间内才算准确。评估指标包括时间精度(Temporal Precision)和事实新鲜度(Freshness)。
此外,论文还引入了 TAQA 基准 (Zhao et al., 2024) 作为外部参考,进一步验证时间感知能力。
输出与训练策略对比
实验表明,时序顺序预训练在通用语言理解任务(如 MMLU、HellaSwag)上持平搅乱基线,但在 KairosQA 上的时间精度和事实新鲜度显著更高。搅乱预训练对旧事实更友好,可能是由于旧事实在数据中重复更多;而顺序预训练使模型更倾向近期准确知识。
与同类方法的差异点
相比经典持续学习 (continual learning) 方法依赖重放或正则化缓解遗忘,本工作通过简单的数据顺序策略,在几乎不增加训练复杂度的情况下改善了知识时效性,且无需额外微调即可保持通用能力。
实验
实验设计
该工作预训练两个 6B 参数语言模型,数据均来自 Common Crawl 快照,总量相同。一个模型采用时序顺序预训练 (sequential pre-training):快照按年份从旧到新排列,模拟知识随时间演化的自然顺序;另一个模型为标准随机打乱预训练 (shuffled pre-training),混洗消除时序结构。评估使用作者构建的 KairosQA 基准(7000+ 时间相关问题,要求模型将事实关联到正确时间段),同时采用标准语言理解基准测试通用能力。
关键发现
顺序模型在一般语言理解与常识知识上持平随机打乱基线,但在事实新鲜度和时间精确度上表现更优。它更倾向给出最新时间点的答案,而随机打乱模型在较早时间点的数据上准确率更高。分析表明,随机打乱可能无意中放大旧事实重复频率,导致过度记忆过时信息。
与基线对比的深度解读
随机打乱预训练虽能避免灾难性遗忘并稳定训练,却抹除数据时间结构,使模型“时间盲视”——知识冻结在训练时刻且偏向高频旧事实。时序预训练显式注入时间信号,不牺牲通用能力,提升对知识更新的敏感性。这对持续学习有直接启示:利用数据时间结构或能以更自然方式实现知识新老交替,减轻重训成本。未来可探索混合策略,结合时序信号与回放机制,平衡新鲜度与旧知识保留。
行业影响
落地场景
时序敏感知识管理 是该工作的核心应用方向,适用场景包括:
- 金融合规与情报:解析公司公告、监管文件时,需严格区分事件发生的时间窗口,顺序预训练有助于模型正确匹配事实与对应年份,降低合规风险;
- 企业知识库与客服:内部政策、产品手册持续迭代,按时间排序训练可让模型在回答中自然优先引用最新版本,避免过时信息误导;
- 新闻事实核查与媒体监测:对历史事件与最新报道进行时间线对齐,提升摘要和问答的时效精准度;
- 教育科技:动态课程内容更新,使模型能够区分知识点的历史演变,提供更准确的学术解答。
商业价值
- 降低更新成本:传统方式需频繁全量重训或持续微调以注入新事实,时序顺序预训练 只需在数据构建阶段按时间流组织语料,即可在单次训练中获得“天然”的时间偏好,减少增量训练开销;
- 提升事实可信度:模型对最新信息的 recall 更优(实验表明 shuffled 基线在旧数据上过拟合),直接改善用户体验与品牌信任,尤其适用于对信息新鲜度敏感的付费服务;
- 差异化竞争优势:在通用模型基础上额外提供“时间感知”版本,可成为 toB 模型服务的新卖点,如“时效增强型知识引擎”。
与现有流程的接口
顺序预训练无需改动模型架构或优化器,仅需调整数据加载管道:
- 在清洗阶段为每条文档附加可靠的时间戳(如 Common Crawl 快照日期);
- 按时间窗口分桶,构建有序快照序列,替代全局 shuffle;
- 使用已有分布式训练框架(如 PyTorch FSDP、Deepspeed)按序读取快照,可复用官方开源的 Kairos 代码库 和 预处理脚本;
- 评估阶段集成 KairosQA 基准,监控模型的时间对齐能力退化。
具体用例
金融研报问答平台:某机构每日抓取数百份公司财报与宏观报告,按发布日期排序后预训练 6B 模型。原有 shuffle 模型常混淆“2023 年 Q3 毛利率”与“2024 年 Q1 毛利率”,顺序模型在 KairosQA 风格评测中时间一致性提升 8pp,支持分析师用自然语言查询“最新季度利润及上年度同期对比”,输出结果可直接用于内部 memo。
企业合规政策助手:某跨国企业将历年合规手册(每年多国更新)按生效日期排序训练。顺序模型在回答“当前数据跨境传输要求”时自动引用 2024 年已生效的法规,而非 2022 年旧版,将客服坐席平均核实时间减少 30%,避免因引用过期条款导致的法律风险。
局限
- **模型规模与数据来源单一**:论文仅在 6B 参数规模的模型上验证了时间排序预训练的效果,且实验数据完全来自 Common Crawl 快照,未涉及更大规模模型或其他类型语料(如学术文献、代码)。不同规模的模型可能对数据顺序的敏感性不同,这一结论的泛化性有待进一步验证。此外,论文未探索在更大规模(如数十亿 token)预训练中,时间排序策略是否会因计算成本或优化难度而失效。
- **遗忘问题未有效解决**:时间排序预训练天然存在灾难性遗忘风险,模型在按时间顺序学习后,可能遗忘早期年份的知识。论文在附录中尝试了模型融合(model soup)和历史事实回放两种策略,但效果有限,并未提出实质性的缓解方案。这一局限将限制该方法在持续学习场景中的直接应用,因为实际部署需要模型不断更新而不丢失既有知识。
- **评估基准的覆盖度与时间粒度**:KairosQA 基准包含超过 7000 个问题,但其事实来源于 Wikidata 中的结构化知识,且经关系过滤,可能偏向易于模板化的问题类型(如人物、组织的关系属性),对于更复杂、长尾的时间敏感知识覆盖不足。同时,基准以年为单位划分时间段,可能无法捕捉更细粒度(如月、日)的时间对齐能力,而现实世界中许多信息具有更短的有效期。