MonkeyOCRv2: 面向文档AI的视觉-文本基础模型
主流视觉编码器在自然图像上预训练,由于密集文本和细粒度字符笔画需要字符级视觉感知,未经文档领域适配难以有效应用于文档图像。我们提出MonkeyOCRv2,一个视觉-文本预训练模型,专为文档AI设计。 首先,我们构建了MonkeyDoc v2,据我们所知最大的文档图像预训练语料库,包含1.13亿张图像,覆盖17种语言。其次,我们提出联合学习图像到文本生成和像素级文档重建的预训练策略:前者将视觉表示与文本内容对齐,后者保留字符笔画和布局细节。 在五个代表性文档分析任务上进行了大量实验,包括文本识别、公式识别、文本检测、文档篡改检测和重叠文本分割。将原始编码器替换为MonkeyOCRv2,所有五个任务性能持续提升。最后,我们在更具挑战性的文档解析和文档理解任务上验证其作为多模态大语言模型视觉编码器的有效性。在冻结状态下与轻量级语言模型配对,得到0.7B文档解析模型,在MDPBench(一个涵盖17种语言数字原生和拍摄文档的最新基准)上创下新的开源最优水平,比之前最优的3B mocr 模型绝对提升2.8%,而视觉编码器尺寸小约11倍。冻结编码器还驱动了一个文档理解模型,在相同训练设置下,在8个基准上优于基于CLIP、DINO和SAM的对应模型。这些结果表明,面向文档的视觉预训练可以独立成为文档智能的基础。
论文精读
TL;DR MonkeyOCRv2 利用 1.13 亿多语言文档图像预训练视觉编码器,联合像素重建与图文对齐,在五大文档分析任务和文档解析/理解上全面超越同类模型。
问题
问题背景
文档智能(Document AI)的核心挑战在于从包含密集文本、复杂布局与多语言字符的图像中准确提取和理解信息。随着大语言模型(LLM)和多模态模型的发展,业界对通用的文档图像基础模型需求日益迫切,这类模型需具备字符级别的细粒度视觉感知能力,而非仅处理自然图像的高层语义。
现有方法局限
- 通用视觉编码器(如 CLIP、DINO)基于自然图像预训练,其感受野和特征粒度无法有效捕捉文档中密集排列的小号文字和笔画细节,直接应用于文档任务时性能退化严重。
- 文档专用预训练方法 通常侧重单一范式:要么通过图像到文本的生成对齐语义(忽略像素级布局与笔画保真),要么仅做像素重建(缺乏对文本内容的深层理解)。二者割裂导致下游任务难以兼顾识别精度与视觉细节。
- 预训练数据集 规模与多样性不足:现有文档图像语料库往往局限于单语种或印刷体,缺乏覆盖多语言(如 17 种语言)、多场景(数字原生与拍照文档)的大规模高质量数据,限制了模型的泛化能力。
挑战与重要性
文档图像中文字密集、字号极小且可能重叠,要求模型具备接近 字符级的分辨力,而自然图像预训练模型对此类细粒度纹理的感知能力不足。同时,文档理解任务(如解析、篡改检测、公式识别)需要同时掌握文本语义与视觉布局,这对传统“单任务”微调方式构成根本困难。业界正寻求一个统一的文档视觉基础模型,它能快速适配各类下游任务,正如 CLIP 在通用视觉领域所扮演的角色。构建此类模型必须解决 大规模多语言数据获取、跨模态对齐与低层视觉保真之间的平衡,技术门槛较高。
行业类比
类似自动驾驶需要同时理解道路标线、交通标志和周围物体的细粒度特征,文档 AI 模型也需要在密集文本场景下“看清”每一个字符,并通过与文本语义的对齐实现真正的文档“阅读”,而非仅仅做图像分类。
核心洞察
- **MonkeyOCRv2 通过文档专用预训练弥补通用视觉编码器在文字密集场景的感知缺陷**,其大规模多语言语料和字符级视觉目标使模型对笔画、字体、布局等细粒度信息敏感,显著区别于基于自然图像预训练的 CLIP/DINO 等通用模型,后者缺乏对密集文本的结构化理解,导致在文档分析任务上性能受限。
- **联合图像到文本生成与像素级重建的双重预训练目标**,同时实现了语义对齐与视觉保真,既保留字符笔画的像素细节,又学习文本内容映射,相比单一自监督(如 MAE)或对比学习(如 CLIP)范式,在文档场景下提供了更完整的表征基础,直接提升下游任务迁移能力。
- **冻结编码器 + 轻量 LM 的范式以极高效率释放专用视觉预训练的潜力**,使得仅 0.7B 的解析模型即可超越 3B 的 dots.mocr,这表明对视觉基础模型的定向投资能在多模态大模型时代获得超额回报,且该经验可推广至其他专业领域,无需为每个任务重新训练巨大模型。
方法
输入与数据构建
MonkeyOCRv2 的预训练基于自研大规模文档图像语料 MonkeyDoc v2,涵盖 17 种语言、1.13 亿 张文档图像,包含印刷、手写、表格、公式、扫描件等多种版式。每张图像均配有像素级字符掩码与文本转录,构成视觉-文本对。输入为原始文档图像,无额外 OCR 引擎依赖。
关键模块:双目标预训练
模型采用 ViT-based 编码器,通过两个并行目标进行表征学习:
图像到文本生成 (Text Generation)
编码器输出视觉特征后,由轻量级 Transformer 解码器 自回归地预测文档中的文本序列。使用 交叉熵损失 监督,强制视觉表征与细粒度字符内容对齐,使模型具备隐式阅读能力。像素级文档重建 (Document Reconstruction)
解码器同时将视觉特征映射回像素空间,重建原始文档图像。采用 MSE 损失 约束,迫使编码器保留字符笔画、字体风格、空间布局等视觉细节。该目标可视为一种自监督掩码重建的变体,但作用于全图而非随机掩码区域。
两个目标共享编码器权重,联合优化 L_total = L_text + λ·L_recon。重建分支相当于一个文档感知的 autoencoder,防止文本生成目标过度偏向语义而丢失视觉保真度。
输出与下游适配
预训练后,视觉编码器被冻结,直接作为各种文档任务的通用骨干网络:
- 文本识别、公式识别:在编码器后接轻量序列解码器
- 文本检测、分割:接 FPN 或 Mask 头
- 文档篡改检测:接分类或定位头
- 文档解析与理解:作为 MLLM 的视觉编码器,与语言模型桥接
对于需要细粒度字符定位的任务,保留重建分支的输出特征图可提供更丰富的空间信息。
与同类方法的差异
不同于 CLIP 等自然图像预训练模型仅关注全局图文对齐,也不同于 Donut 等纯文本生成式预训练会忽略像素级细节,MonkeyOCRv2 通过生成-重建联合优化,在字符级视觉感知与语义理解间取得平衡,因而在文本密集、变形、多语言的文档场景中具备更普适的迁移能力。
实验
实验设计
MonkeyOCRv2 的评估分为两部分。第一部分在 五个经典文档分析任务 上进行,直接用 MonkeyOCRv2 替换原有编码器,验证其作为视觉骨架的通用性:
- 文本识别(CRNN 架构)
- 公式识别(UniMERNet)
- 文本检测(基于分割的方法)
- 文档篡改检测(像素级分类)
- 重叠文本分割(实例分割)
第二部分将 MonkeyOCRv2 作为冻结的视觉编码器,搭配轻量语言模型,评估其在 文档解析 与 文档理解 两种高层任务中的能力,解析任务使用 MDPBench(覆盖 17 种语言的数字和拍照文档),理解任务在 8 个常用文档 VQA 基准上测试。
关键发现
- 一致的性能提升:在所有五个分析任务上,替换编码器后性能均有明显提高。CRNN 的识别准确率从 58.7% 跃升至 67.3% (+8.6%);仅 110M 参数的 UniMERNet-T 甚至超过了之前 325M 的 UniMERNet-B,证明了模型在细粒度字符感知上的优势。
- 极高效的文档解析:0.7B 的解析模型(冻结 MonkeyOCRv2 + 轻量 LM)在 MDPBench 上以 +2.8% 绝对优势 超越开源 SOTA 的 3B dots.mocr,视觉编码器体积缩小约 11 倍,凸显文档导向预训练的高效性。
- 通用文档理解:同样的冻结编码器在 8 个文档理解基准上全面优于基于 CLIP、DINO 和 SAM 的对比模型,且均在相同训练设置下完成。
与基线的对比解读
通用视觉编码器(如 CLIP)侧重自然场景语义,对密集文本和字符笔画感知较弱;像素级模型(如 SAM)虽能分割区域,但缺乏对文本内部结构的理解。MonkeyOCRv2 通过联合图像到文本生成与像素级文档重建的双目标预训练,同时实现了视觉-文本语义对齐和细粒度笔画保留,使其在文字密集、布局复杂的文档场景中表现突出。冻结后即能达到甚至超越更大参数量模型的性能,表明文档导向的视觉预训练可以成为一种独立且通用的文档智能基础,对构建轻量、高效的文档 AI 系统有重要工程价值。
行业影响
落地场景
MonkeyOCRv2 作为文档导向的视觉-文本基础模型,可直接赋能文档数字化与智能理解产品线。典型场景包括:
- 企业知识管理:自动解析合同、财报、发票等扫描件,提取关键字段与表格,服务于RPA流程与合规审计。
- 在线教育:对教材、试卷、手写笔记进行OCR与公式识别,支持可搜索题库构建与自动批改。
- 内容平台:从出版物、广告设计稿中检测文本、识别字体和篡改,用于版权保护与内容审核。
- 金融保险:高精度识别多语言票据、保单,减少人工录入错误。
商业价值
- 降本:MonkeyOCRv2 在文本识别、公式识别等任务上显著超越原有视觉编码器,可减少下游模型对大规模标注数据的依赖;其冻结编码器+轻量语言模型的 0.7B 文档解析方案,在 MDPBench 上以约 1/11 的视觉编码器尺寸超越 3B 的 dots.mocr 2.8 个绝对百分点,推理成本大幅降低。
- 增收:提升文档处理的准确率直接转化为用户体验升级,如更精准的搜索、更流畅的自动化流程,增强客户留存与付费意愿。
- 体验提升:多语言(17种语言)的字符级感知能力,使产品可服务全球用户,避免对特定语言的二次训练。
与现有产品/工作流的接口
模型以视觉编码器形式提供,可无缝替换现有文档AI流水线中的视觉骨干:
- OCR 流水线:替换检测/识别模型的 backbone(如 DBNet、CRNN),直接提升文字检测和识别精度,尤其是密集文本、重叠文本场景。
- 多模态大模型:作为 VLM 的视觉编码器,通过特征投影层接入 LLM(如 Qwen2),无需微调编码器即可实现文档解析与理解。支持
transformers或vLLM等标准框架加载。 - 轻量化部署:提供 0.7B 解析模型,适合端侧或边缘设备,降低对云端的依赖。
具体用例:
- 跨境电商发票处理:平台每日接收大量多语言发票扫描件,MonkeyOCRv2 可一次识别发票中的供应商信息、金额、税率等字段,并检测是否有篡改痕迹,提升报关与财务效率。
- 学术论文检索:文献数据库可利用 MonkeyOCRv2 精准提取论文中的公式、表格、参考文献,将位图转为结构化可搜索内容,使学术搜索引擎支持公式语义查询。
局限
- - **多语言性能不均衡**:MonkeyDoc v2 涵盖 17 种语言,但不同语言的字符复杂度与样本量差异较大,论文未提供各语言拆分的性能对比。这可能导致模型对西里尔字母、阿拉伯语等非拉丁语系的字符级识别能力弱于英语等高频语言,实际部署在全球化文档场景时可能出现显著的精度落差。
- - **预训练双目标的潜在冲突**:联合学习图像到文本生成与像素级文档重建,虽然旨在同时对齐语义与保留视觉细节,但两个目标可能争夺模型容量。例如,像素重建强调对噪声、背景纹理的建模,而文本生成需要特征对内容不变性,这种张力在高压缩率的编码器中可能相互干扰,且论文未对两者的权重或冲突程度进行消融分析。
- - **作为视觉编码器的集成局限性**:MonkeyOCRv2 在文档理解和解析任务中虽显优势,但依赖冻结编码器与轻量级语言模型的组合,且仅验证至 0.7B 规模。若扩展到更大尺寸的 LLM 或需要微调编码器以应对更复杂推理的任务,这种集成方式的效果未知,且投影层的设计、训练数据配比等关键因素尚未探讨,限制了其作为通用文档视觉骨干的即插即用灵活性。