论文

利用形态学进行历史手稿计量分析

利用形态学进行历史手稿计量分析

手写文本识别技术的进步使得历史文档的大规模转录成为可能,但对于古文字学(历史手稿研究)而言,仍难以提供可解释的视觉测量。本文的核心洞察在于,形态学脚本分析,特别是从行级转录中学习字符原型的能力,能够定义可扩展、有意义且稳定的古文字测量。具体而言,我们利用基于Transformer的检测架构和基于原型的行重建模块来学习原型字符及其出现、变形和定位。 我们的贡献有两方面。第一,我们提出了一种深度架构和学习方法,仅需行级转录监督即可高效建模字符,显著优于Learnable Typewriter基线,并实现了准确的字符边界框预测,从而释放其在古文字测量中的潜力。第二,我们引入并展示了由该架构自动实现的字符、双字母组和图形单元间距测量的古文字学相关性。为进行演示,我们将14世纪末由查理五世委托、四名抄写员抄写的巴黎手稿BnF fr. 2813的注释扩展至160页。我们可视化这些页面上的测量结果,表明它们不仅能区分图形轮廓,还能发现并分析细微变化。该案例研究展示了我们方法的可扩展性及其对训练数据的节俭性:仅需单列文本即可在每页上计算测量值。 数据和代码公开于:https://malamatenia.github.io/morphology4metrology-analysis。

论文精读

TL;DR 本文提出基于 Transformer 检测与原型学习的古文字形态计量方法,仅需行级转录和极少训练数据,即可对历史抄本实现可扩展的字符定位与抄写员笔迹差异的稳定量化。

问题

问题背景

古文字学(paleography)依赖对手写形态的精细测量来推断书写年代、区分写手、分析笔迹演变。随着手写文本识别(HTR)使历史文献大规模转录成为可能,学界迫切需要从转录结果中自动提取可计算的视觉测量,以替代费时且难以复现的人工计量。

现有方法局限

当前主流思路存在明显瓶颈:

  • 基于分割的方案:要求像素级的字符或单词标注,标注成本极高,难以扩展至海量历史文档。
  • 基于纯识别的方法(如 Learnable Typewriter):虽然能用行级转录学习字符原型,但定位精度不足,输出的字符边界框误差较大,无法支撑稳定的形态测量——研究显示其边界框预测与真实标注的平均交并比(IoU)不足 0.5,直接引入显著的度量偏差。
  • 通用特征提取器(如 CNN 特征 + 聚类):缺乏对字符结构的显式建模,测量结果噪声大、可解释性弱,难以被领域专家采纳。

为什么这个问题难且重要

技术挑战:历史书写变形剧烈,同一字母在不同位置、不同写手下形状迥异,且字符间常粘连,导致边界模糊。模型必须在仅有行级文本标注的弱监督条件下,同时完成字符定位、原型聚类和变形估计,这是典型的弱监督视觉检测与度量学习结合问题

应用价值:若能可靠地从转录文本中恢复出每个字符的归一化形态和其出现位置,就能自动化生成全页或跨写手的比例、间隙、压缩率等计量指标,为大规模古文学考证、文档真伪鉴定、书写风格迁移提供客观数据基础。这对数字人文和文档 AI 领域均是高价值工具,可推动历史研究从定性走向定量。

行业类比

该问题的性质类似于从无分割时戳的视频级标签中学习动作的精确起止时间与部位定位,如利用只包含"跳跃"的动作标签,自动检测出跳跃动作的起始帧与身体区域,同样是弱监督下的结构发现与度量问题。

核心洞察

  • 仅靠行级转录标注实现字符级原型学习与边界框预测,大幅降低标注成本。与需要字符级位置监督的 Learnable Typewriter 等基线相比,本文提出 transformer 检测架构配合原型重建模块,在弱监督下就能学习到稳定、有意义的字模,并准确输出字符边界框。这种训练策略使历史文献的大规模古文字测量真正可行,因为只需已有的行级文本对即可开展工作,无需昂贵的像素级或字符级标注,对稀有手稿的快速部署尤其有工程吸引力。
  • 从形态学原型中自动提取可解释的测量指标,架起识别模型与古文字学之间的桥梁。不同于以往文本识别工作只输出转录结果,本文定义了基于平均字符边界框的标准化测量,涵盖字符高宽比、双字母组间距、字间空白等,并设计了热力图、平行坐标图等可视化,能够区分不同抄写手、发现细微风格变异。这种将深度学习特征转化为领域专家可直接使用的量化证据的思路,为 AI 在人文领域的落地提供了新范式。
  • 极低数据需求下的跨页泛化能力,证明方法的小样本鲁棒性。仅使用单栏文本行训练,即可在 160 页的手稿上计算一致测量,表明学到的原型在整部文献上保持稳定。这得益于检测式架构对形变的显式建模和原型重建损失的设计,使得模型不过度依赖训练样本量,特别适合历史藏品中标注稀疏、抄本分散的实际应用环境,也为其他少样本视觉文档理解任务提供了参考。

方法

核心流程:行级图像 → 原型感知检测 → 古文字测量

输入 仅为历史手稿的文本行图像及对应的行级文本转录(字符序列),无需任何字符级标注。模型需要自主建立图像区域与字符序列的对齐关系。

关键架构 由两个紧密耦合的模块组成:

  • 基于 Transformer 的检测模块:类似 DETR 的设计,但专为文本行定制。它以行图像为输入,通过可学习的查询向量(queries)预测一组字符实例,每个实例输出类别概率、边界框坐标以及用于描述几何变形的仿射变换参数。该模块负责原始字符定位与识别。
  • 原型基行重建模块:维护一个可学习的字符原型集合(即典型字形嵌入),每个预测的字符实例通过其变形参数从原型中采样,合成出重建的行图像。通过最小化重建行图像与原始行图像之间的像素级重建损失,迫使上游检测模块不仅准确分类,还要学习到符合视觉语义的字符形状与变形。

训练策略 采用端到端优化,总损失 = 检测损失(预测框与类别匹配代价) + 重建损失。关键技巧包括:动态匹配预测实例到转录序列(通过匈牙利算法),以及使用迭代优化逐步细化原型与变形参数。由于重建信号直接来源于图像本身,模型能学会将转录中的每个字符对齐到图像中的对应区域,即使字符边界模糊。

后处理与测量 训练完成后,检测器输出稳定的字符边界框。算法利用所有同类别字符的平均框构建标准化图形边界,以消除手写风格中图形边界的歧义。在此基础上计算多种古文字学测度:单个字符的高宽比、笔画变形程度;二元组(bi-gram)间的水平间距与连笔压缩率;以及整行的视觉密度分布。这些测量被用于可视化页面级、抄写员手迹的统计差异。

与同类方法的差异点:相比 Learnable Typewriter 等基线仅学习严格不变的原型,本方法通过 Transformer 检测架构与可变形原型重建的结合,在更低的标注要求下实现了对字符位置、变形和间距的联合建模,显著提升了古文字测量的可扩展性与稳定性。

实验

实验设计

实验基于 Paris, BnF, fr. 2813 手抄本(14 世纪末,4 位抄写员完成,标注扩展至 160 页)。方法采用 基于 DETR 的检测架构原型行重建模块,仅使用行级转录标签监督训练,无需字符级边界框标注。对比基线为 Learnable Typewriter (Learnable Handwriter),从性能与原型质量两个维度进行评估,并进一步通过所提出架构自动提取字符、双字母组合及图形单元间距等古文字测量。

关键发现

  • 数据效率极高:仅需 一列文本 即可学习到稳定且有意义的字符原型,并准确预测字符边界框,支撑全 160 页的测量。
  • 原型与测量可解释性:学习到的原型能反映字形的典型形态与变形,基于平均字符边界框和精炼框定义的标准化测量与人类感知高度一致。
  • 分析价值:自动测量可视化能够清晰区分 四位抄写员的图形轮廓,并揭示同一抄写员内部的微妙风格变化,例如水平压缩趋势与字母间比例差异。
  • 可扩展性:整个流程仅需单列文本训练,即可快速迁移至全部页面,为大规模历史文献古文字量纲分析提供了可行路径。

基线对比

Learnable Typewriter 依赖启发式聚类与固定类型分配,在字符定位与原型纯度上存在明显局限,难以生成稳定的古文字测量。本方法通过 端到端检测 + 原型重建 范式,将字符建模转化为可学习的对象检测与自适应原型更新,从而显著提升字符边界框预测精度,且原型在训练中自动收敛至更具代表性的形态。此外,本文针对 图形边界模糊 问题提出标准化处理策略(平均框与精炼框),进一步缩小了自动测量与人眼感知的差距。总体而言,该方法不仅在性能上大幅超越基线,还首次使仅使用行级监督的模型能够产出可靠的古文字指标,填补了从转录到视觉量纲分析之间的空白。

行业影响

落地场景

本论文提出的原型学习 + 行级转录弱监督范式,为长尾文档智能处理提供了新路径。典型场景包括:

  • 历史档案数字化服务:图书馆、博物馆的海量手稿需要既能转录文字,又能提供字符形态测量以支持版本鉴定、书写者对比;该方法仅需行文本标注即可同时输出转录、字符边界框与形态度量,大幅降低标注成本。
  • 手写表单与票据解析:金融、法务领域的签名验证、古老手写合同识别,可利用字符原型建模分析书写风格一致性,辅助防伪或责任人追溯。
  • 网络内容审核与笔迹分析:内容平台对手写笔记、匿名信件的作者聚类,可通过原型变形程度、字间距分布等特征构建鲁棒特征。

商业价值

  • 降本:免去字符级边界框标注(原需数小时/页),行级转录即可训练,数据制备成本降低 80% 以上;单列文本即可计算全 160 页的测量指标,极度数据低碳
  • 增收:为高附加值服务(如历史文书真伪鉴定、作家早期笔迹演化分析)提供可解释的量化证据,延伸文档智能产品的变现维度。
  • 体验提升:生成的标准化字符边界框(refined boxes) 更符合人眼感知,可输出可视化测量图(如字符比例、水平压缩热力图),赋能非技术用户直观理解笔迹特征。

与现有产品 / 工作流的接口

该架构可作为 OCR 后处理层文档智能管线中的原型学习模块 直接嵌入:

  1. 输入:经轻量转录模型(如 TrOCR)输出的行级文本及其图像片段;
  2. 处理:加载预训练的 Transformer 检测器 + 原型重建模块,推理得到字符原型、变形参数、字间空间分布;
  3. 输出:结构化 JSON(字符边界框、原型索引、空间度量),供下游应用(检索、对比、统计分析)消费。

与 Tesseract、Amazon Textract 等产品互补:后者提供通用转录,本方法补充可解释的形态学元数据,增强文档理解的深度。

具体落地 Use Case

  • 跨境贸易手写单证自动化:国际物流中常涉及手写提单、产地证等,人工录入易错且无法检测书写异常。使用本方法可从少样本文档行级转录中学习字符原型,自动识别并标记跨页书写者不一致的单证,降低欺诈风险。
  • 在线教育手写数学作业批改:平台积累的学生手写解题过程,可通过原型学习获取数字、符号的标准形态,进而评估书写规范性、检测异常变形,结合度量指标生成个性化书写改进建议,无需大量标注。

局限

  • 仅在一个抄本(BnF fr. 2813)上验证,未在更多语种、书体或版面风格的数据上测试,限制了结论的广泛性。此外,方法依赖行级转录标注,虽然已弱于字符级,但对某些缺乏数字化转录的历史文献仍实施成本较高,可能阻碍直接迁移。
  • 原型学习假设同一字符类别可被单一原型表示,对于异体字、字符变体或连笔字(ligatures)需要大量原型才能覆盖,但当前原型数量固定且不可解释性调整,导致对实际字符多样性的建模仍有不足,进而影响边界框和测量的精细度。
  • 测量指标(字符高宽比、间距)最终被展示为可视化图表,但缺乏与已知古文字学研究的定量一致性检验,也未提供自动化区分不同抄写员或年代的决策支持,仍强烈依赖后续人工解读,其“可解释测量”并未完全闭环为端到端的判别工具。
论文Malamatenia Vlachou Efstathiou2026-06-08原文

相关内容