论文

表征网页规模 LLM 预训练数据中的叙事内容

表征网页规模 LLM 预训练数据中的叙事内容

尽管叙事是人类交流的基本模式,但网页规模 LLM 预训练语料库的叙事构成在很大程度上仍未得到探索。本文首次对 Dolma(一个 3 万亿 token 的开放预训练语料库)中的叙事特征进行了细粒度研究。基于叙事理论,我们设计了一个涵盖三个核心叙事元素(能动性、场景 和 事件)的框架,并将其操作化为 11 个可解释的维度。在采样并标注了 400 个多样化文本段落后,我们微调并验证了 NarraBERT(一个基于 RoBERTa 的细粒度叙事预测模型)。 我们将 NarraBERT 应用于 300 万个段落,生成了新数据集 NarraDolma。主要发现如下: - 在极端异构的数据中,叙事结构可在大规模下被测量。 - 我们揭示了网页文本中存在的连续、多维叙事结构。 - 叙事质量在不同预训练来源和主题间分布不均,而当前的语料整理实践既未测量也未解释这种差异。 我们的框架、数据集和分析为理解叙事质量在 LLM 预训练数据中的分布,以及研究数据组成如何影响叙事推理任务提供了基础。我们公开发布了 NarraDolma 和 NarraBERT。

论文精读

TL;DR 首次在 3 万亿 token 语料中大规模量化叙事结构,揭示 LLM 预训练数据的多维叙事分布不均,为数据配比与叙事推理任务建立桥梁。

问题

问题背景

大语言模型(LLM)的预训练数据体量已达数万亿 token,业界长期关注数据源、去重、毒性过滤等表层质量指标,但极少深入分析数据内部的叙事结构(narrative structure)。叙事是人类沟通的基础模式,直接影响模型的故事理解、逻辑推理和长期一致性等能力,然而它在 web-scale 语料中的分布一直是空白。

现有方法局限

当前预训练数据的策展流程主要依赖:

  • 文档级统计特征(如困惑度、长度、重复率)
  • 粗粒度分类标签(如 CommonCrawl 的域分类或安全标签)
  • 启发式规则(如关键字匹配)

这些方法无法刻画文本的叙事精细度。即便高级的数据配比方法(如 DoReMi、DSIR)也仅优化整体损失,未考虑叙事维度。叙事理论定义的能动性(agency)、场景(setting)、事件(events)等核心要素,缺乏可操作化的预测模型和标注数据,导致相关分析无法规模化。手动标注 400 份样本已属昂贵,面对 3 万亿 token 的 Dolma 语料更是杯水车薪。

为什么这个问题艰难且重要

技术挑战

  1. 叙事是高度上下文依赖的抽象概念,异构网页文本(从论坛帖子到新闻正文)的叙事信号极弱且噪声大。
  2. 需要构建一个可解释的维度体系,既要忠于叙事理论,又要适合弱监督/微调范式。
  3. 必须验证跨域泛化——在一个子集上训练的模型能否可靠推理整个预料库。

业界关注度 随着 LLM 被用于创意写作、游戏剧本、教育等叙事密集型任务,训练数据的叙事质量直接决定模型的表现上限。理解和控制叙事成分的分布,有望像“去偏”一样成为数据策展的新基准,推动数据组合的叙事自觉性

行业类比

就像训练自动驾驶模型时,不仅需要清洗图像,还要对场景中的物体、关系、运动做细粒度标注,叙事分析是在为文本数据构建“场景理解”层,让数据策展从“看标题”进化到“读故事”。

核心洞察

  • - **首次在 Web 规模预训练语料上实现细粒度叙事量化**:基于叙事理论设计 agency、setting、events 三类共 11 维可解释指标,并用 NarraBERT 对 Dolma 中 300 万段落进行自动标注,证明极端异构的 Web 文本中存在连续、多维的叙事结构。与此前仅关注来源、毒性或表面统计的工作相比,该方法深入内容语义层,为理解预训练数据的内在叙事属性提供了可复用的分析框架。
  • - **叙事特征分布不均揭示了数据策展的盲区**:研究发现不同来源(书籍、网页等)和主题的叙事维度分布差异显著,而当前数据混合策略完全忽略叙事属性,导致模型在故事理解、情节推理等任务上表现不可控。这一发现提示数据配比需引入叙事质量信号,借助 NarraDolma 数据集,后续工作可针对性地优化叙事相关能力,或通过叙事维度平衡提升下游任务鲁棒性。

方法

叙事分析框架构建

从叙事理论出发,作者定义了三大核心元素——agency(主体性)、setting(场景)和 events(事件),并进一步操作化为 11 个可解释的维度(如叙事视角、时间结构、因果关系等)。每个维度均被设计为可标注的分类或评分任务,确保叙事特征能被量化。

数据采样与标注

Dolma(3 万亿 token 的开放预训练语料)中分层采样 400 个段落,覆盖不同来源(网页、书籍、学术论文等)和主题。由人类标注者依据框架为每个段落的多维叙事特征打标签,形成高质量的小规模数据集。

模型微调:NarraBERT

基于 RoBERTa 架构,将每个叙事维度建模为独立的分类或回归头,共享底层 transformer 表示。使用标注数据对预训练语言模型进行端到端微调,训练时引入类别平衡采样与早停策略,使模型能捕捉跨维度的叙事线索。经过验证后,NarraBERT 在各项叙事维度上都达到可靠的人机一致性。

大规模预测与数据集生成

将 NarraBERT 部署在 300 万个 Dolma 段落上,逐段预测其叙事特征向量,得到 NarraDolma 数据集。该数据集保留了原文的元信息(来源、主题等),从而支持下游分析。

差异点

与以往仅关注粗粒度领域或体裁差异的工作不同,本研究首次在 web-scale 语料上实现了细粒度、多维叙事结构的可扩展测量,将叙事理论驱动的人工标注与现代 LM 微调结合,避免了单纯依赖无监督聚类带来的解释性瓶颈。

实验

实验设计

本研究提出一个基于叙事理论的细粒度分析框架,涵盖 代理(agency)场景(setting)事件(events) 三大核心要素,并细化为 11 个可解释维度。从 Dolma 语料库中分层采样 400 篇多样文本进行人工标注,据此微调 NarraBERT(基于 RoBERTa)实现自动预测。随后将 NarraBERT 扩展至 300 万篇文本,构建大规模叙事特征数据集 NarraDolma,用于揭示预训练数据中的叙事结构分布。

关键发现

  1. 叙事可度量性:即使面对极度异构的网页文本,叙事结构仍能被系统地量化和区分。
  2. 连续多维叙事空间:分析表明网页文本并不分裂为“叙事”与“非叙事”,而是落在一个连续的、多维的叙事特征谱系上。
  3. 分布不均衡:不同来源(如 Common Crawl、Wikipedia、书籍)和主题的叙事质量差异显著,例如书籍类文本在代理和事件维度上远高于通用爬取数据,而当前数据策展流程未对这些差异进行测量或调整。

与现有策展基线的对比

现有 LLM 预训练数据策展主要依赖困惑度过滤、主题分类或规则式清洗,完全忽略了深层的叙事属性。本文提出的框架相当于引入了一个全新的评估维度,直接对比揭示:基于浅层统计或主题的策展会无意中保留大量叙事碎片化或不连贯的文本,而这些文本可能对模型的叙事推理能力产生负面影响。通过 NarraBERTNarraDolma,研究者可以首次量化并可视化叙事特征的分布,为后续有意识的数据混合(如增加高叙事密度源)提供工程化把手,从而可能改善模型在故事生成、因果推理等任务上的表现。

行业影响

落地场景

  • 内容平台(如 Medium、Substack)可利用 NarraBERT 评估帖文的叙事质量,辅助推荐算法与人工精选,提升用户阅读时长与互动深度。
  • 对话式 AI(客服机器人、虚拟角色)通过叙事维度优化多轮对话的连贯性和吸引力,使交互更自然。
  • 教育科技:对课程材料(视频字幕、讲义)自动化叙事评分,筛选高叙事性片段用于预告或推荐,提高学习参与度和完课率。
  • 电商与营销自动化:商品描述、广告文案的叙事性评估与优化,帮助商家生成更具感染力的内容,提升转化率。

商业价值

  • 降本:自动化叙事特征标注,减少人工审核负担,降低内容运营和语料筛选成本。
  • 增收:高叙事性内容显著提升用户停留、点击及转化指标,直接拉动订阅或销售增长。
  • 体验提升:让对话系统回复更富故事感、内容推荐更贴合用户心理,增强品牌粘性与满意度。

与现有工作流集成

  • 数据管道:在 Hugging Face DatasetsApache Spark 预处理阶段嵌入 NarraBERT,对预训练语料进行叙事维度打分,作为数据配比或过滤的额外特征。
  • 内容管理系统 (CMS):封装为 API 服务,实时为编辑或创作者提供叙事性反馈,支持 A/B 测试衡量叙事对点击率的影响。
  • 训练框架:在微调叙事推理任务(故事生成、摘要)时,基于叙事分布有侧重地采样数据,提升模型表现。

具体场景

  1. 跨境电商(如 Shopify 后台插件):自动评估商品描述的叙事性,向卖家提供优化建议,帮助非母语写作者提升文案感染力,跨文化吸引买家。
  2. 全球在线教育(如 Coursera 课程优化):用 NarraBERT 分析讲义叙述风格,抽取高叙事片段生成宣传摘要或学习提示,提高免费用户向付费的转化与课程完成度。

局限

  • **语料库代表性有限**:分析仅基于 Dolma 一个开放预训练语料库,其构成(CommonCrawl、C4 等)未必能代表所有 web-scale 预训练数据的叙事分布。不同语料(如 RefinedWeb、Pile)的版权过滤、去重策略差异可能导致叙事结构偏移,结论的泛化性未经外部验证。
  • **标注规模与模型泛化**:NarraBERT 仅从 400 段人工标注样本微调而来,虽然涵盖多种来源,但叙事理论中 agency、setting、event 的 11 个细维度可能在长尾文体(如法律文书、代码注释)上表现不稳定。模型在未见领域(如多语言文本)的预测有效性也未验证,且人工标注一致性仅用 Cohen's κ 简略报告。
  • **叙事框架的简化**:研究将叙事核心仅限为 agency、setting、events 三维度,忽视了叙事理论中的其他关键要素(如叙事视角、情感弧线、时间结构)。这种简化适合大规模计算,但可能遗漏对语言模型叙事推理能力同样重要的特征,且未与现有叙事分析工具(如 BookNLP)进行基准对比,无法评估 NarraBERT 的相对优势。
论文Teagan Johnson2026-06-17原文

相关内容