PaddleOCR-VL-1.6: 通过欠优化区域细化和渐进式后训练拓展文档解析前沿
我们介绍了 PaddleOCR-VL-1.6,一个基于 PaddleOCR-VL-1.5 升级的紧凑型文档解析模型。尽管 PaddleOCR-VL-1.5 建立了强大的 0.9B 基线,其剩余错误集中在欠优化区域,这些区域模型行为不稳定、数据覆盖稀疏或监督信号不可靠。 不同于无差别扩充训练语料,PaddleOCR-VL-1.6 引入了一种区域感知数据优化框架,从先前模型中识别薄弱区域,对这些区域进行定向增强,并提升监督信号的可靠性。它还采用了一种基于精选数据选择和强化学习的渐进式后训练配方,通过分阶段优化将模型性能推向更高水平。 PaddleOCR-VL-1.6 在 OmniDocBench v1.6 上取得了新的最优分数 96.33%,展现了对顶尖 VLM 的强大竞争力,并为 PaddleOCR-VL 系列提供了一种实用的后训练配方。
论文精读
TL;DR PaddleOCR-VL-1.6 通过定位上一版模型的欠优化区域进行靶向数据增强,并采用渐进式后训练与强化学习,在文档解析基准 OmniDocBench v1.6 上以 96.33% 刷新 SOTA。
问题
问题背景
文档解析已从单纯的 OCR 任务演变为视觉-语言问题,需可信地从 PDF、扫描件等非结构化文档中恢复布局、阅读顺序、表格、公式、图表、印章等结构信息,以支撑检索增强生成(RAG)等下游应用。
现有方法局限
以 PaddleOCR-VL-1.5 为代表的紧凑模型在 0.9B 参数下建立了强基线,但剩余错误高度集中在三类欠优化区域:
- 边界脆弱区域:模型预测不稳定,输出容易在相近边界间跳变;
- 覆盖稀疏区域:训练数据中罕见的长尾元素(如复杂内嵌表格、特殊图表);
- 不可靠监督区域:标注噪声高,伪标签干扰学习。
传统策略通过均匀扩增训练语料来提升表现,但忽略了错误分布的不均匀性,导致计算资源浪费且对薄弱区域提升有限,模型在硬表格识别、图表解析和精确文本定位等子任务上依然存在明显短板。
为什么这个问题难/重要
文档元素的高度异构性要求模型同时具备视觉定位、结构重建和语义对齐多维度能力,而真实文档中的长尾模式很难被单一模型均匀覆盖。标注成本极高,部分区域(如密集表格线、印章遮挡)人工标注也难以保证一致性,使得监督信号本身就不可靠。此外,下游 RAG 系统对文档解析精度极为敏感,一个残缺的表格或错位的段落可能导致检索失败或推理错误,因此业界对高精度解析有刚性需求。
行业类比
如同自动驾驶系统通过角落场景(corner case)挖掘与定向增强来提升安全边界,文档解析也需要从模型错误分布中识别薄弱区域,进行靶向数据增强与训练,而非盲目堆数据。
核心洞察
- 从均匀数据扩展转向欠优化区域靶向优化:PaddleOCR-VL-1.6 不再盲目扩大训练语料,而是系统识别前一版本模型表现不稳的“边界脆弱区”、“覆盖稀疏区”和“监督不可靠区”,并针对性增强数据与监督信号。这种做法比主流 VLM 的通用数据扩充更高效,直接针对模型能力短板,将资源聚焦在边际收益最高的环节,为文档解析模型的迭代提供了可复用的 data-centric 方法论。
- 文档解析后训练中引入强化学习与阶段式优化:该工作首次将 GRPO 类强化学习融入文档理解的后训练流程,通过“持续预训练→监督微调→基于高潜力样本挖掘的 RL”三阶段课程,突破传统 SFT 的上限。这种渐进式配方揭示了 RL 在结构化输出任务中的收益,尤其是在规则明确但标注困难的长尾场景(如表格识别、印章提取)中,可利用奖励设计驱动精细优化,比仅靠更大基座模型更具工程可行性。
- 多专长共识与渲染引导的自动标注降低弱区域监督成本:针对欠优化区域中标注噪声大的问题,该方法利用多专家模型协作投票和渲染验证,自动生成高质量伪标签,减少人工标注依赖。该思路与当前依赖昂贵人工标注或单一模型蒸馏的主流方案不同,通过跨模型置信度对齐和几何渲染自检,在提升标签可靠性的同时保持了低成本迭代优势。
方法
输入与任务定义
PaddleOCR-VL-1.6 接收文档图像,输出结构化解析结果(Markdown/JSON),涵盖布局区域、表格、公式、印章、图表及阅读顺序。
关键模块 1:区域感知数据优化引擎
上一版本 PaddleOCR-VL-1.5 的错误集中在三类欠优化区域,本工作不再盲目扩增语料,而是针对性治理:
- 边界脆区 (
Boundary-Fragile Regions):模型预测不稳定的边界案例,通过生成边界样本并增强对应训练信号来稳定行为。 - 覆盖稀疏区 (
Coverage-Sparse Regions):训练数据覆盖不足的类别(如特殊版式),利用合成与增强手段填补空白。 - 监督不可靠区 (
Unreliable-Supervision Regions):人工标注噪声多的区域,采用多专家共识 + 渲染引导精化自动生成高可靠标注,替代原始弱监督标签。
关键模块 2:渐进式后训练
数据优化后,模型分三阶段升级:
- 继续预训练 (
Continued Pre-Training):在扩充后的多分布数据上进一步预训练,提升基础视觉语言理解能力。 - 困难样本监督微调 (
Supervised Fine-Tuning for Hard-Case Refinement):聚焦之前表现差的 case,用高质量标注进行微调,强化关键模态(如表结构推理)。 - 强化学习高潜力优化 (
Reinforcement Learning for High-Potential Optimization):- 基于 GRPO 策略挖掘模型仍存在提升空间的高潜力样本;
- 设计复合奖励函数,综合考虑文本识别准确率、结构保真度与格式合规性;
- 用 RMSProp 优化策略模型,使解析结果更贴近人类偏好。
输出与效果
最终模型在 OmniDocBench v1.6 达到 96.33% 的 SOTA,在紧凑参数量级(0.9B)下匹敌大模型。
差异点:与传统“均匀扩数据 + 单阶段微调”不同,PaddleOCR-VL-1.6 的递进式弱区诊断与分阶段训练,能更高效地消除瓶颈,避免算力浪费在模型已擅长的区域。
实验
实验设计
PaddleOCR-VL-1.6 的评估围绕文档解析主任务与四项核心子能力展开。主基准采用 OmniDocBench v1.6(综合性文档解析评测)和 Real5-OmniDocBench(真实场景变体),另在四个内部数据集上测试硬表格识别(In-house-Table)、图表解析(In-house-Chart)、文本定位(In-house-Text-Spotting)和印章识别(In-house-Seal)。消融实验验证区域感知数据引擎与渐进式后训练方案的有效性。
关键发现
模型在 OmniDocBench v1.6 上取得 96.33% 的新最优分数,显著超越前代 PaddleOCR-VL-1.5 及主流视觉语言模型。性能提升并非来自盲目扩增语料,而是通过识别并针对前代模型的欠优化区域(边界脆弱、覆盖稀疏、监督不可靠)进行定向数据增强。渐进式后训练策略——包含持续预训练扩展分布、有监督微调细化困难样本、强化学习在高潜力样本上优化——进一步提升模型鲁棒性。
基线对比深度解读
相比 PaddleOCR-VL-1.5,1.6 版本的改进聚焦于错误集中区域:利用多专家共识和渲染引导精炼生成高质量伪标签,并配合 GRPO 导向的高潜力样本挖掘,使模型在表格、图表等复杂元素上表现更稳定。作为 0.9B 紧凑模型,其成绩与更大规模的 VLMs 相匹敌,证明了数据优化驱动的后训练路线在文档解析领域的实用价值,为后续迭代提供了可复用的训练范式。
行业影响
落地场景
PaddleOCR-VL-1.6 是一款紧凑型文档解析模型,可直接嵌入以下产品线:
- 智能文档处理(IDP)平台:发票、合同、报关单等复杂版式理解,输出结构化 JSON/Markdown。
- RAG 系统的文档摄入层:在检索增强生成管道中,将 PDF、扫描件转化为高质量纯文本和表格,提升检索精度。
- 移动端/边缘端文档扫描应用:0.9B 参数规模适合在手机、IoT 设备上离线识别名片、表单、菜单等。
商业价值
模型通过 区域感知数据优化 与 渐进式后训练,在 OmniDocBench v1.6 达到 96.33% 精度,且推理成本低于大型 VLMs,带来三方面价值:
- 降本:自动标注引擎代替人工,减少 80% 以上数据清洗和校对人力;紧凑模型降低 GPU 服务成本。
- 增收:为 SaaS 文档解析服务提供更高准确率,减少因识别错误导致的客户退单或额外支持。
- 体验提升:端侧实时解析让用户上传文档即可秒级获得结构化结果,无需网络等待。
集成接口
模型可平滑接入现有工作流:
- 标准化 API:封装为 gRPC/HTTP 服务,与现有微服务架构(如 Kubernetes)无缝对接。
- 数据管道插件:作为 LangChain 的
DocumentLoader或 Airflow 的 Operator,将文件转化步骤嵌入 ETL。 - ONNX/TensorRT 导出:便于在边缘设备上深度学习推理,与 C++/Python 主程序集成。
具体场景
- 电商发票自动核验:某跨境电商平台每天处理数十万张供应商发票,使用 PaddleOCR-VL-1.6 解析发票抬头、税号、金额、商品明细,并与 ERP 系统自动对账,将人工审核量减少 90%。
- 金融研报知识库:一家投资机构将数千份 PDF 研报通过该模型转换为结构化 Markdown,支持跨报告全文搜索和关键指标提取,分析师检索同业数据的时间从小时级缩短至分钟级。
局限
- **模型改进受限于初始错误分布与伪标签质量**:PaddleOCR-VL-1.6 的数据优化框架依赖 PaddleOCR-VL-1.5 在验证集上检测出的 under-optimized regions,若前序模型在某些文档类型或区域根本没有足够的错误暴露,则后续针对性增强可能覆盖不全。多专家共识和渲染引导的自动标注虽然提升了标签一致性,但本质仍是伪标签,对复杂元素(如嵌套表格、密集公式区域)仍可能引入噪声,进而影响模型上限。
- **0.9B 参数量的结构能力边界**:虽然通过精细数据策略和强化学习大幅提升了紧凑模型的表现,但在极端复杂的多页文档、严重失真扫描或手写体占比高的场景中,模型的空间推理和长上下文理解仍可能弱于更大规模的 VLM。评测仅集中在 OmniDocBench v1.6 和少量内部数据集,未在更多样化的文档解析基准(如 DocLayNet、PubTabNet 变体)上报告性能,泛化稳健性有待进一步验证。
- **强化学习的奖励函数存在覆盖盲区**:GRPO 训练使用的奖励设计主要关注格式正确性和关键字段匹配,对阅读顺序、图表数据语义保真度等软性指标缺乏直接反馈,可能导致模型在追求表面奖励时牺牲更深层的结构一致性。此外,训练仅采用有限的负样本构造策略,未系统探索更丰富的对比数据,存在过拟合到特定奖励模式的风险。