论文

NaviDC-OCR: 跨越数字与摄像头采集文档的解析导航

NaviDC-OCR: 跨越数字与摄像头采集文档的解析导航

文档解析旨在将非结构化文档转换为结构化、机器可读的表示。近期视觉语言模型(VLM)的进展显著推动了文档解析,但现有方法仍面临两大挑战:一是基于解耦 VLM 的方法严重依赖准确的版面分析,摄像头采集文档的几何畸变会引入级联错误;二是端到端 VLM 方法虽减轻了对显式版面检测的依赖,但在高分辨率场景下常出现冗余生成、幻觉和结构推理不足。 为此,我们提出 NaviDC-OCR,一个统一的文档解析框架。NaviDC-OCR 引入变形感知学习 将几何感知融入 VLM,并提出自适应采样机制 以处理复杂版面表示。此外,设计了内容-结构解耦学习 策略,显式建模公式语法和表格结构,实现更有效的结构化表示学习。 大量实验表明,NaviDC-OCR 在多个文档解析基准上取得最优性能:在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上分别获得 96.87、88.53 和 78.41 的总分,并在 ICDAR 2026 Sci-ImageMiner Challenge 中排名第一。这些结果验证了 NaviDC-OCR 在复杂文档解析场景中的有效性和泛化能力。

论文精读

TL;DR NaviDC-OCR 统一数字与相机拍摄文档解析,通过变形感知学习、自适应采样与内容-结构解耦训练,抑制级联误差与幻觉,在 OmniDocBench 等基准取得 SOTA。

问题

问题背景

文档解析旨在将非结构化文档转换为结构化、机器可读的表示。随着 Vision-Language Models (VLMs) 的成熟,端到端与解耦式 VLM 方法成为该领域的主流技术路线。

现有方法局限

  • 解耦式 VLM 方法:依赖独立的布局分析阶段,相机拍摄文档中常见的透视畸变、曲面弯曲会破坏布局检测的几何假设,造成区域定位错误,进而引发级联误差。
  • 端到端 VLM 方法:虽然绕开了显式布局检测,但在高分辨率输入下容易产生冗余 token 生成、幻觉内容,且对公式语法与表格结构的深层推理能力不足。

为什么这个问题难且重要

文档来源的异质性——数字生成文档与相机拍摄文档在几何形态、噪声分布上差异显著,要求模型同时具备几何感知与结构建模双重能力。工业界对文档智能、RAG 知识抽取、自动化报表解析的需求持续上升,但现有方案在相机拍摄场景下的鲁棒性仍不理想,难以直接部署到真实业务流程中。

行业类比

类似自动驾驶中的多传感器融合必须处理相机畸变与标定误差,文档解析也需要在多种采集条件下稳定输出结构化信息,否则下游任务会累积不可控的错误。

核心洞察

  • NaviDC-OCR 通过 deformation-aware learning 将几何感知直接融入 VLM 的视觉编码,使模型在特征层面理解文档扭曲,从而避免了 decoupled 方法中显式布局检测带来的级联错误。与依赖独立 rectification 模块或精确 layout detection 的同类工作不同,NaviDC-OCR 的几何感知训练让 VLM 对 camera-captured 文档的透视失真、弯曲等变换更鲁棒。该思路减少了前端几何校正和布局分析的负担,在 Wild-OmniDocBench 等真实场景数据上验证了对失真文档的泛化能力,为端到端文档解析提供了更简洁的管线。
  • content-structure decoupled learning 策略将文档内容生成与结构推理分离,显式建模公式语法和表格结构,从而缓解 end-to-end VLM 常见的冗余生成与幻觉问题。传统 end-to-end VLM 将内容与结构统一生成,模型容易混淆结构标记与文本语义,导致多余 token 或错误结构。NaviDC-OCR 通过解耦训练,让模型分别学习内容序列和结构约束(如公式语法树、表格行列关系),在保持端到端推理的同时增强了结构化输出的可靠性。这种设计在 PureDocBench 等需要精确结构解析的基准上取得大幅提升,体现了结构化先验对 VLM 文档理解的价值。

方法

NaviDC-OCR 以图像为输入,不依赖显式布局检测,直接输出结构化文档表示,可同时处理数字文档与相机拍摄文档。关键流程如下:

  1. 输入:原始文档图像,可能包含几何畸变(弯曲、透视)。
  2. 关键模块:
    • Deformation-aware Learning:将几何感知注入 VLM,通过区域级与点级的形变信息增强模型对相机文档的鲁棒性,避免级联误差。
    • Adaptive Sampling Mechanism:针对复杂布局,采用曲率引导的 Douglas–Peucker 采样,在保持关键结构的同时减少冗余 token,提升高分辨率场景的处理效率。
    • Content-Structure Decoupled Learning:显式建模公式语法与表格结构,将内容识别与结构推理分离训练,降低幻觉与冗余生成。
  3. 输出:结构化解析结果,包括文本、公式(LaTeX)、表格(HTML/Markdown)等。

训练策略采用四阶段渐进式:

  1. 文档解析预训练;
  2. 形变感知训练;
  3. 内容-结构解耦学习;
  4. 强化学习优化。

与同类端到端 VLM 方法相比,NaviDC-OCR 通过形变感知与自适应采样显式处理几何失真,并通过解耦训练针对公式与表格结构进行专门建模,从而在相机文档和复杂版式上取得更优的结构推理能力。

实验

实验设计

  • 评估覆盖三个公开 benchmark:OmniDocBench v1.6、Wild-OmniDocBench、PureDocBench,分别对应数字文档解析、相机拍摄文档解析、以及科学图表转表格。
  • 还在 ICDAR 2026 Sci-ImageMiner Challenge 竞赛中验证。
  • 训练流程分四阶段:①文档解析预训练、②变形感知训练、③内容-结构解耦学习、④强化学习。

关键发现

  • 在 OmniDocBench v1.6 上 overall score 达 96.87,Wild-OmniDocBench 达 88.53,PureDocBench 达 78.41,均达到 SOTA。
  • 在 ICDAR 2026 Sci-ImageMiner Challenge 中排名第一。
  • 结果表明 deformation-aware learning 有效融入几何感知,adaptive sampling 在复杂布局下保持高分辨率表征,content-structure decoupled learning 显式建模公式语法和表格结构,显著减少冗余生成与幻觉。

与基线对比解读

  • 相比依赖 layout analysis 的 decoupled VLM 方法,NaviDC-OCR 避免了相机文档几何畸变导致的级联错误。
  • 相比 end-to-end VLM 方法,它通过内容-结构解耦和强化学习抑制了冗余生成与高分辨率下结构推理不足的问题。
  • 整体上融合了两类范式的优势,在跨场景文档解析任务中展示更强泛化能力。

行业影响

落地场景

NaviDC-OCR 可嵌入 文档智能云服务(如 Document AI、Textract 类产品),处理手机拍摄的合同、票据、手写笔记等非扫描件,弥补现有 VLM 对透视畸变和曲面变形的不足。在 科学文献平台 中,自动将论文图表转为结构化表格,支撑学术搜索与知识图谱构建。企业财务/法务系统 可利用其表格和公式结构化能力,自动抽取财报、发票中的关键字段,减少人工复核。

商业价值

  • 降本:减少人工录入与校验成本,尤其相机文档的几何校正能显著降低重扫率和二次处理开销。
  • 增收:作为差异化功能提升 API 定价竞争力,吸引对复杂表格、公式、代码块有高精度需求的客户。
  • 体验提升:用户随手拍照即可获得高质量结构化 JSON,减少交互摩擦和错误重试。

跟现有产品/工作流的接口

模型可部署为独立推理服务,通过 OpenAI 兼容 API 或 gRPC 接入现有文档解析 pipeline。输出为多任务统一 JSON(文本、表格、公式、代码块),可直接写入数据库或触发下游 RAG、对账、合规检查。替换现有 VLM 组件时无需改动上游布局检测,只需切换模型权重并适配 prompt;若现有流程已有布局分析模块,可保留作为辅助信号,进一步抑制幻觉。

具体 use case:1)电商平台商品详情页解析,从商家上传的拍照资质或详情图中提取结构化规格参数,自动填充 SKU 信息;2)医疗影像报告数字化,将医生手写或打印的检查单转为可检索数据,接入电子病历系统,支持后续临床决策。

局限

  • - **多阶段训练与数据合成成本较高**:NaviDC-OCR 采用四阶段渐进训练(预训练、变形感知训练、内容-结构解耦学习、强化学习),并依赖多节点共识投票、自判断 VLM 等数据工程手段。相比一些端到端 VLM 方法,训练管线复杂,调参与数据准备成本显著更高。论文未明确给出各阶段对最终性能的消融贡献,工程团队复现时可能难以权衡投入产出。此外,强化学习阶段依赖奖励设计,奖励误设可能导致模型偏离正确文档结构,稳定性存疑。
  • - **极端场景与低资源文档泛化未充分验证**:实验主要覆盖 OmniDocBench、Wild-OmniDocBench 与 PureDocBench,这些基准以数字文档和常见相机拍摄文档为主,缺乏对手写体、严重光照不均、大幅扭曲、遮挡、多语言混合等极端条件的系统评估。变形感知学习基于合成或特定几何先验,对真实世界复杂畸变的适应性未知。此外,方法在科学图表任务上仅报告转换结果,未讨论在非常规版面(如海报、票据、信息图)上的潜在失效模式。
  • - **布局先验依赖与推理开销未讨论**:自适应采样机制(如曲率引导的 Douglas–Peucker 采样)可能隐含规则布局假设,对非流式、高度重叠或艺术化排版的文档可能采样不足或过采样。内容-结构解耦学习要求模型同时生成内容与显式结构标记,输出序列变长,推理解码步数增加,在实时场景或低算力设备上的延迟未报告。此外,方法依赖 VLM 底座,模型规模与推理成本高于专用 OCR 管线,实际部署需要进一步轻量化。
论文Peng Cai2026-08-13原文

相关内容