HPD-Parsing: 分层并行文档解析
高效的团队协作通常结合全局协调与并行执行,这一原则尚未充分体现在基于统一视觉语言模型(VLM)的文档解析器中。现有统一解析器将整个页面联合处理,但通过单令牌逐令牌自回归轨迹生成输出,形成了随文档长度增长的顺序瓶颈。这种全页顺序生成忽略了文档解析的关键属性:布局必须全局分析,而块内容可以并行解析。 基于此观察,我们提出 HPD-Parsing,以分层并行解码范式替代全页自回归生成。一个主布局分支组织整体文档结构,并动态地将块级内容解码分配给并发分支,同时渐进式多令牌预测(P-MTP)进一步减少每个分支内的解码步骤。 在公开基准上的实验表明,HPD-Parsing 达到每秒 4,752 个令牌,吞吐量是现有最快文档解析模型的 2.62 倍,是普通自回归基线的 3.06 倍,同时保持具有竞争力的解析精度。这些结果确立了分层并行解码作为全页自回归生成的有效替代方案,为高效统一文档解析开辟了新方向。
论文精读
TL;DR HPD-Parsing 用层级并行解码替代全页自回归生成,以全局布局组织并行块内容解码,吞吐提速 3 倍且精度不减。
问题
问题背景
统一视觉语言模型(VLM)的文档解析器在准确性上已超越传统流水线系统,能够联合建模标题、表格、段落等多种元素,成为信息提取、检索增强生成(RAG)等应用的基础。然而,随着文档处理量急剧增长,推理效率已成为瓶颈,如何在保持解析质量的同时大幅提升吞吐是当前核心关切。
现有方法的局限
当前统一解析器虽在视觉编码阶段可并行处理整页图像,但文本生成阶段仍采用逐令牌自回归解码,整页输出被迫沿单一序列轨迹顺序产生。这种全页顺序生成存在两个结构性局限:
- 线性增长的序列瓶颈:输出长度随文档密度线性增加,导致延迟与计算开销成倍放大,无法利用现代硬件的并行能力。
- 忽视文档内在的层次化并行特性:文档布局需要全局协调(如阅读顺序、分栏关系),而各文本块的内容生成天然相互独立。但现有方法强制将二者耦合在同一个自回归循环中,造成不必要的顺序依赖。
技术挑战与重要性
文档页常包含密集图文,输出令牌数可达数千,纯自回归解码导致吞吐量极低(普通的 VLM 基线仅约 1500 tokens/s)。若强行引入并行解码,又难以保证布局结构的全局一致性与跨块内容的阅读顺序正确性。业界普遍关注高效大型模型推理,但在文档解析领域,此前尚无有效的层次化并行解码方案,使得加速尝试往往牺牲解析准确度或通用性。
行业类比
如同多模态大模型在视频理解中通过时空分离(全局时间建模 + 局部空间并行)提升效率,文档解析的全局布局分析与局部内容识别也天然适配“先全局调度、后并行执行”的模式,HPD-Parsing 正是将这一思想首次体系化地引入统一 VLM 解析器。
核心洞察
- 文档解析具有天然的分层可解耦性:全局布局分析必须顺序处理,但各区块内容可独立并行生成。HPD-Parsing 正是利用这一属性,将单轨自回归解码重构为“布局主干+并行内容分支”的架构,从任务结构而非单纯工程优化角度打破了长文档的顺序瓶颈。这与通用的投机解码或流水线并行思路截然不同,后者仍受限于单一序列的前后依赖,而该方法通过动态分支分配实现了解码轨迹的真正并行化。
- 多令牌预测(MTP)与分支级并行的协同是吞吐量突破的关键。HPD-Parsing 不仅在宏观上让多个 block 同时解码,还在每个分支内引入渐进式 MTP(P-MTP),一次预测多个 token,进一步压缩解码步数。这种“层次化并行 + 分支内密集预测”的组合,使得在统一 VLM 框架下,吞吐量达到最快现有模型的 2.62 倍,且准确率保持竞争水平,证明了端到端文档解析可以在不牺牲质量的前提下获得近乎线性的效率提升。
方法
输入到输出流程
HPD-Parsing 的输入为文档图像,经视觉编码器提取特征后,进入分层并行解码阶段,最终输出结构化的解析结果(如 Markdown 或 JSON 树)。
关键模块
主布局分支:负责全局理解,生成文档的整体布局结构(如阅读顺序、区块划分),并动态将各区块(文本块、表格、图片等)的内容解码任务分配给并行内容分支。这一分支仍保留全局上下文建模能力,确保跨块关系的一致性。
并行内容分支:接收主分支分配的区块,各自独立生成该区块的详细内容(如文本、表格 LaTeX、图注)。多个分支可同时解码,打破传统单一自回归轨迹的串行瓶颈。
动态调度机制:主分支在生成过程中实时预测区块边界与类型,并将对应区块的隐状态传递给空闲的内容分支,实现布局引导的并行任务分配。
渐进式多 token 预测 (P-MTP):在每个内容分支内部,采用多步并行预测,一次前向传播生成多个连续 token,进一步压缩单分支的解码步数。
训练策略
采用分阶段适配:先用标准自回归预训练基础解析能力,再逐步引入并行分支和 P-MTP,辅以自动化难度感知的数据精选管线,确保模型从简单到复杂样本的稳定迁移。
与同类方法的差异
相比现有 VLM 解析器对整个页面进行单一自回归流生成,HPD-Parsing 通过“全局布局串行 + 局部分块并行”的层次化解码,从根本上将吞吐量提升至同类最快模型的 2.62 倍,而不牺牲解析精度。
实验
实验设计
HPD-Parsing 在多个公开文档解析基准上进行评估,对比对象包括 当前最快的统一 VLM 解析器 以及 普通自回归基线模型 。实验旨在验证层次并行解码范式能否在保持解析精度的同时显著提升推理效率,覆盖不同文档布局与内容密度场景。
关键发现
- 吞吐量大幅提升:HPD-Parsing 达到 4,752 tokens/s ,是现有最快模型的 2.62 倍 ,是自回归基线的 3.06 倍 。
- 精度保持竞争力:在加速的同时,解析质量与基线基本持平,验证了并行解码不会损害文档结构理解与内容提取的准确性。
- 层次设计有效:主布局分支负责全局结构分析,并行分支独立处理各文本块内容,配合渐进式多 token 预测(P-MTP)进一步压缩每分支解码步数,充分贴合“布局全局、内容局部”的文档特性。
与基线对比的深度解读
与 全页自回归生成 相比,HPD-Parsing 通过 层次并行解码 打破了 token 级串行依赖,将原本受文档长度制约的序列瓶颈转化为可并发执行的块级子任务。与 通用加速策略(如推测解码) 不同,该方法利用了文档解析领域特有的结构先验——全局布局与局部内容可解耦,因此能够以更确定性的方式分配计算,避免因错误推测导致的重解码开销。P-MTP 的引入进一步减少了每个并行分支内部的解码步数,实现了层次化与多 token 预测的协同加速。这一设计思路为统一文档解析的高效推理提供了全新范式,有望推动大规模文档处理系统的实时化部署。
行业影响
落地场景
HPD-Parsing 适用于所有依赖文档结构化的平台,包括:
- 企业服务 / 金融:合同审查、财报解析、合规文档自动化,可将百页 PDF 的提取延迟从分钟级降至秒级。
- 电商 / 内容平台:商品详情页 SKU 规格提取、用户手册结构化,支撑搜索推荐与比价;RAG 系统的预处理环节可直接受益。
- 医疗 / 法律:电子病历去隐私化结构提取、法律文书要素抽取,在高吞吐需求下保持解析精度。
商业价值
- 降本:并行解码大幅提升吞吐(
4752 tokens/s,是现有最快模型的2.62倍),相同硬件可承载更高负载,降低推理算力成本。 - 增效:延迟的降低使实时交互式文档处理成为可能,如在线审阅、即时问答等场景,端到端体验改善直接提高用户留存与转化。
- 竞争力:在解析精度不降的前提下实现了生成速度的跨越,为统一 VLM 解析器的工程化部署扫清效率瓶颈。
与现有产品 / 工作流的接口
HPD-Parsing 作为 VLM 解析器的解码范式,可无缝嵌入现有文档管道:
- 替换现有 VLM 解析模块中的自回归头,复用已有的视觉编码器和预训练权重,只需微调少量并行解码分支与**渐进多 token 预测(P-MTP)**辅助损失。
- 可与 OCR 引擎、信息抽取 NER 等模块级联:布局分支输出全局结构后,各块内容由并行分支独立解析,形成结构化的 JSON/XML 输出,供下游检索、图谱构建等任务消费。
- 适合以微服务形式集成,提供 RESTful API 或 gRPC 端点,对调用方屏蔽解码细节。
具体用例
- 电商 SKU 信息批量抽取:某电商平台每日入库数百万新商品,需从商品详情页中提取规格参数、价格、描述等结构化字段。HPD-Parsing 将单页解析耗时压缩到商用可接受范围,支撑高频率全量更新,直接改善搜索结果准确率和推荐相关性。
- 智能合同审查系统:一家法律科技公司构建自动化合同风险识别产品,需并行处理上传的多份 PDF 合同。采用 HPD-Parsing 后,审查引擎能实时返回条款标签与风险提示,提升律所和公司法务部门的工作效率,使 SLA 从“小时级”缩短至“分钟级”。
局限
- **布局分析瓶颈与鲁棒性不足**:HPD-Parsing 将全局布局分析作为并行分支的调度依赖,一旦布局分支错误地划分区域(例如,对多栏广告、表格密集页或图文混排非典型版面),就会导致内容分支分配错乱或遗漏,最终损害解析精度。论文未讨论布局分支的容错设计,也未在包含复杂、非规范或跨文化版式的文档上进行压力测试,因此实际应用中的鲁棒性存疑。
- **训练与部署复杂性较高**:模型需要分阶段适配(staged adaptation)和自动化难度感知的数据筛选,这增加了训练管线的维护成本;并行分支数量与显存占用的权衡需要精细调参,且推理时动态分派分支会引入额外的前缀处理和调度开销,可能部分抵消高吞吐量优势。对于追求极致低延迟或资源受限的边缘设备,这些工程复杂度会成为落地障碍。
- **精度-速度权衡验证不充分**:论文虽报告了显著的吞吐量提升,并与全页自回归基线对比,但未提供在长尾语言、退化扫描件、手写文档等挑战性场景下的精度分析;同时,所选基线可能未进行充分的工程优化,导致对比基数偏低。此外,与其它加速策略(如投机解码、MoE、量化等)的公平横向对比缺失,使得该方法的相对优势不够清晰。