Institutional Newspapers Pipeline: 从历史报纸中提取数十亿高质量 token
历史报纸是公共生活的丰富记录,但其密集、不规则且有时含噪的版面使得对这些材料的计算访问既具挑战性又受限。本文介绍 Institutional Newspapers Pipeline,这是一个与 Boston Public Library 联合设计的模块化系统,用于从历史报纸扫描件中提取高质量结构化数据集。其架构设计确保每一步都可解释且可定制,并且整个流程在计算上足够节俭,可在工作站级硬件上运行。 该流程对每个扫描件执行多步骤处理:将扫描件分割为独立的类型无关裁剪块,对每个生成的片段执行 OCR,随后对每个裁剪块进行文本分析、类型分类、阅读顺序检测、命名实体识别、主题分类、语言检测和预计算嵌入生成。我们针对 Boston Public Library 部分馆藏运行了该流程,并将结果作为开放数据集发布。光学字符识别(OCR)输出代表 16.3 billion o200kbase tokens,涵盖 83.1 million 个独立裁剪块,提取自 1795 至 1930 年间出版的 1,473,635 页公共领域报纸扫描件。 本报告描述了每个处理步骤的方法、我们训练的小型模型,以及评估结果和在此过程中收集的数据集规模测量指标。随附内容还包括流程、模型和数据集的发布。我们将这项工作定位为向解锁数千万报纸扫描件高质量数据迈出的重要一步。
论文精读
TL;DR 从 147 万份 1795–1930 年历史报纸扫描件中,模块化 pipeline 提取出 163 亿 o200k_base tokens 的结构化数据集,兼顾可解释性与低成本工作站运行。
问题
问题背景
历史报纸是跨越数个世纪的高密度公共记录,大规模数字化为 NLP / CV 提供了难得的长时段真实语料。但版面密集、不规则、噪声多,图像到结构化文本的转化仍是一个未充分解决的工程问题。
现有方法局限
- 传统 OCR 工具(如 Tesseract)对多栏、图文混排、旧字体适应差,输出行序混乱,漏词与误识率高。
- 版面分析模型 多为通用文档训练,迁移到历史报纸时边界框不准,且缺乏与类型分类(标题、正文、广告等)和阅读顺序检测的联合优化,后处理常靠人工规则。
- 已有公开数据集(如 Chronicling America)只提供整页 OCR 文本,缺少区域级元数据;像素级标注昂贵,人工扩展不可持续。
- 大型视觉语言模型虽能处理复杂版面,但推理成本高、不可复现,无法在 workstation 级别批量处理千万级扫描件。
为什么难/重要
核心挑战是多任务级联误差:分割、OCR、分类、排序、NER、主题、语言检测必须共享上下文,任一步骤的偏差都会向下游放大。报纸的视觉密度与时间跨度(1795–1930)导致字体、排版、用词持续漂移,单一模型难以泛化。业界对高质量、可解释、低成本的数据管线高度关注,因为 LLM 预训练对数据多样性与噪声控制 极其敏感,数十亿 token 的历史报纸数据可作为真实世界知识的重要补充。
行业类比
这类工作类似于从企业历史档案、医疗扫描件或政府公报中构建结构化语料,用于领域适配或 RAG 检索——核心都是“非结构化图像 → 可查询、可训练的结构化文本”,其模块化、小模型路线对同类场景具有直接参考价值。
核心洞察
- 将历史报纸转化为高质量训练语料的关键并非更强的OCR引擎,而是围绕可解释、可定制的小模型构建的模块化流水线。该工作与依赖单一大规模端到端模型的黑盒方案不同,每一步(分割、OCR、类型分类、阅读顺序、NER等)均独立且可替换,允许研究者针对特定版面或噪声类型进行局部优化而不牺牲整体效率。这为处理非标准文档布局提供了一种工程上更可控的路径,尤其适合资源受限但需要领域适配的团队。
- 16.3B o200k_base token的发布证明,在计算节俭约束下仍能从非结构化扫描件中提取出规模可观的预训练数据。与主流从网页或电子书挖掘文本的管线相比,该数据集覆盖1795-1930年间的公共生活记录,语言风格、实体分布和主题类别与现代语料形成互补。这种时间上的多样性可能对缓解模型在历史知识、旧式表达上的偏差具有独特价值,但使用时需注意OCR噪声和版面分割误差引入的潜在污染。
方法
输入与分割
输入为历史报纸扫描件(1795–1930),版面密集、不规则且含噪声。首先进行 版面分割,将每页扫描切分为 type-agnostic crops (不预判内容类型,如标题/正文/广告),以保留后续分析的灵活性。此步骤在 workstation 级硬件上运行,强调 计算节俭。
关键模块
- OCR 与文本分析:对每个 crop 执行 OCR 得到文本,并做基础文本分析。
- 分类与顺序:训练小型模型进行 类型分类 和 阅读顺序检测,恢复版面逻辑。
- 语义增强:对每个 crop 执行 命名实体识别、主题分类、语言检测,并生成 预计算嵌入,便于下游检索与训练。
- 模块化与可解释性:每步输出可独立检查、可定制;小模型保持低于工作站负载,避免大模型推理成本。
输出与规模
在 Boston Public Library 部分馆藏上运行,得到 83.1M crops、16.3B o200k_base tokens,覆盖 1,473,635 页公共领域扫描。输出包含结构化文本、元数据与嵌入,并发布 pipeline、模型与数据集。
与依赖大型视觉-语言模型或端到端黑盒系统的同类工作不同,本 pipeline 采用模块化、可解释的小模型序列,在低算力下即可扩展到数千万页报纸。
实验
实验设计
该流水线以波士顿公共图书馆 的历史报纸扫描为输入,共处理 1,473,635 份扫描(1795–1930),输出 83.1M 个独立 crops,OCR 文本量达 16.3B o200k_base tokens。每个扫描依次经过类型无关分割、OCR、文本分析、类型分类、阅读顺序检测、命名实体识别、主题分类、语言检测与嵌入生成。各步骤采用小模型 训练,保持可解释性与单机可运行性。
关键发现
- 流水线在工作站级硬件 上完成全量处理,计算成本远低于大规模端到端模型方案。
- 模块化设计允许每个步骤独立替换或定制,为不同机构适配自身数据提供了工程灵活性。
- 预计算嵌入生成使下游检索与语义分析无需重新推理全文,降低重复计算开销。
与同类工作差异
相比追求单一模型极致准确率的通用 OCR 或文档理解系统,该工作更强调架构可解释性、资源节约与开放数据集建设。虽然未直接提供与基线模型在准确率上的对比,但输出规模(16.3B tokens)与单机可行性本身构成对“大数据必须大算力”这一惯性的反驳。对于全球范围的文化遗产数字化与历史文本挖掘,这一设计提供了一条可复现、低门槛的技术路径。
行业影响
落地场景
该管道可将大规模历史报纸扫描件转化为结构化文本与元数据,适用于数字人文、档案管理、知识图谱构建等场景。在内容平台与电商领域,历史报纸中的广告、价格列表、地方新闻可补充商品历史价格数据、品牌演变信息,用于训练时间敏感的检索与推荐模型。教育科技产品可利用命名实体识别和主题分类结果构建历史事件时间线、人物关系网络,嵌入互动课程。金融行业可提取历史市场情绪、公司相关报道,为长周期回测提供非结构化文本源。
商业价值
管道设计强调计算节俭,可在工作站级硬件上运行,避免高昂的云端 OCR 与 NLP 成本。数据集包含 16.3 亿 o200k_base tokens,直接可用于预训练或微调领域模型,省去数据采集和清洗投入。对内容平台,高质量历史语料增强模型的时间泛化能力;对档案机构,自动化提取降低人工标注成本,提升材料可检索性与利用率。整体价值体现在降本(计算与数据获取)和增效(更丰富的训练数据、更快的结构化处理)。
与现有工作流的接口
管道采用模块化设计,每一步输出可独立消费。集成方式包括:
- 替换现有 OCR 阶段的
segment + OCR模块,利用其版面分割与阅读顺序检测改进扫描件文本提取质量。 - 将命名实体识别与主题分类结果直接写入 Elasticsearch 或向量数据库,供下游检索与推荐系统调用。
- 预计算的 embeddings 可对接 FAISS 或 Milvus,避免重复编码。
- 管道输出为 JSONL 格式,易于接入 Airflow 或 Luigi 等调度系统,作为批处理任务运行。
具体用例:某电商平台希望构建 1900-1930 年商品价格演变数据集,用于训练价格预测模型。通过该管道处理历史报纸中的广告版面,提取商品名、价格、时间戳,并利用语言检测过滤非目标语言,生成结构化训练样本。另一用例:一家教育科技公司开发历史事件时间线产品,使用管道的 NER 与主题分类结果自动生成事件卡片,嵌入互动课程,减少人工整理工作量。
局限
- - **OCR 误差传递与版面分割缺陷**: 该 pipeline 依赖将扫描件分割为与类型无关的 crop,即使步骤可解释,分割错误(如相邻栏合并、标题误切)也会传播至 OCR 和下游任务。作者也承认历史报纸版面噪声大;由此产生的 163 亿 token 可能包含系统性 OCR 错误,尤其是小字号、破损字体或非英文内容。文中未提及 OCR 后纠错机制,导致数据集 token 级质量可能低于 LLM 微调的需求。
- - **小模型泛化能力有限**: 训练的类型分类、阅读顺序、NER、主题分类、语言检测等模型可能过度拟合于波士顿公共图书馆馆藏(1795-1930 年英文报纸)。对于其他地区、时期、语言或不同数字化质量的报纸,性能可能显著下降。报告可能未提供跨语料评估或分布外鲁棒性分析,因此 pipeline 应用于更广泛历史档案的可靠性存疑。
- - **缺乏与主流 OCR 系统的充分对比**: 报告自定义 OCR 流程,但没有与 Tesseract、Google Cloud Vision、Azure OCR 等基线进行系统性比较。评估可能仅基于内部留出集,难以判断小模型是否优于现有工具。对于实际工程选型,缺少 CER/WER 等指标在代表性样本上的对比,其贡献更偏向工程整合而非方法学突破,说服力不足。