HunyuanOCR-1.5: 使轻量级OCR VLMs更快更好
我们提出 HunyuanOCR-1.5,一个轻量级端到端 OCR 专用视觉语言模型。HunyuanOCR 将文档解析、文本定位、信息抽取、图文翻译和多图像文档理解统一到单个端到端 VLM 中。基于 HunyuanOCR-1.0 的轻量架构,HunyuanOCR-1.5 未重新设计骨干,而是系统性地提升了效率与能力。 在效率方面,我们将 DFlash 适配到 OCR 解码,显著降低了密集文档、表格和公式等长结构化输出的延迟,同时保持输出分布。借助 DFlash,HunyuanOCR-1.5 实现了 6.37 倍的 Transformer 推理加速和 2.14 倍的 vLLM 加速,成为轻量级 OCR VLM 中推理最快的模型。 在能力方面,我们提出 Agentic Data Flow,一个智能体驱动的数据构建系统,它能将模型弱点转化为可执行的数据需求,并自主完成材料搜索、质量验证和流程开发。该系统大幅提升了古文字 OCR、细粒度图表与表格解析、多图像文本中心问答、低资源多语言解析和文档幻觉评估等长尾能力。 HunyuanOCR-1.5 在 OmniDocBench v1.6 上跻身顶级端到端 OCR 方案之列,并在这些长尾任务上取得了新的性能里程碑。结合升级的预训练和后训练策略,HunyuanOCR-1.5 进一步扩展了在高分辨率、长上下文和多任务场景下的能力。实验证明了更快的推理、更广的 OCR 能力覆盖以及轻量端到端模型的部署优势。我们将发布模型权重和训练代码,以支持未来研究和实际 OCR 应用。
论文精读
TL;DR HunyuanOCR-1.5 是轻量端到端 OCR VLM,通过 DFlash 实现 6.37 倍 Transformer 推理加速,并借助 Agentic Data Flow 自主构建长尾数据,在速度与任务覆盖上均达新里程碑。
问题
问题背景
端到端的视觉-语言模型 (VLM) 正在重塑 OCR 技术栈,将文字检测、识别、信息抽取等传统多级流水线统一为单一模型,降低部署复杂度并提升多任务协同能力。然而,轻量级 OCR VLM 在实际部署中仍面临推理速度慢与长尾能力不足两大瓶颈,限制其在高吞吐文档处理与多样化场景中的落地。
现有方法局限
当前轻量级 OCR VLM 主要存在两方面的技术局限:
- 解码效率:对密集文档、表格、公式等长结构化内容进行自回归解码时,标准 Transformer 注意力机制导致每步生成的计算成本与序列长度呈平方关系,延迟显著,难以满足实时或大规模处理需求。
- 能力覆盖:模型在古文字、低资源语言、细粒度图表解析等长尾任务上的性能薄弱,原因在于传统数据构造流程依赖人工定义模板或规则,无法系统化地将模型弱点转化为高质量训练数据,导致能力边界拓展缓慢。
为什么这个问题难且重要
推理加速的挑战在于:既要减少解码步数或计算量,又不能破坏输出分布(如 Markdown 结构、公式精度),否则会引入生成错误。长尾能力提升的难点在于:长尾场景的素材稀少且标注门槛高,需要自动化流程进行材料搜索、质量验证与流水线构建,同时避免引入噪声或过拟合。业界对 OCR 模型的期待已从“能用”转向“又快又准又广”,这对文档智能、多模态搜索、信息无障碍等应用至关重要。
类比:类似自动驾驶系统需要既保证低延迟的实时感知,又要覆盖罕见的极端天气和路况,OCR VLM 也必须在推理速度与长尾鲁棒性之间取得工程平衡。
核心洞察
- **DFlash 解码加速专为长结构输出优化,在保持分布不变的前提下大幅降低延迟**。与常见的投机解码或 KV 缓存压缩不同,DFlash 直接针对 OCR 任务中长文本、表格、公式等密集序列的特性进行加速,实现了 Transformer 推理 6.37 倍提速,vLLM 下 2.14 倍提速,且不牺牲输出质量。这种面向特定输出模式的工程化加速,为轻量 OCR VLM 的实际部署提供了最直接的效率提升路径。
- **Agentic Data Flow 将模型能力短板自动转化为可执行的数据构造流水线**。传统数据增强依赖人工经验或固定规则,而该方法让 Agent 自主完成需求分析、素材检索、质量验证与流水线开发,系统性补强了古代文字识别、细粒度图表解析、多图文档问答等长尾场景。这种闭环的数据生产机制,使得模型迭代不再受限于数据瓶颈,为持续扩展 OCR VLM 能力边界提供了可复用的框架。
方法
输入与任务统一
HunyuanOCR-1.5 接收单张或多张文档图像,以及自然语言任务指令,统一处理文档解析、文本定位、信息抽取、文图翻译、多图文档理解等多种 OCR 相关任务。
关键模块
- 轻量 VLM 架构:延续 HunyuanOCR-1.0 的设计,不改变骨干网络,visison encoder + language decoder 结合 多 token 预测 头,在不修改模型规模的前提下加速序列生成。
- DFlash 推断加速:将 DFlash 适配到 OCR 解码,专门针对长结构化输出(如密集文档、表格、公式)降低延迟,同时保持输出分布一致。在 Transformer 原生推断下提速 6.37 倍,vLLM 下提速 2.14 倍,使该模型成为同类轻量 OCR VLM 中推断最快的方案。
- Agentic Data Flow:代理驱动的数据构建系统将模型弱点转化为可执行数据需求,自动完成素材搜索、质量验证和管道开发。重点提升长尾能力:古文字 OCR、细粒度图表/表格解析、多图像文本问答、低资源多语言解析,并缓解文档幻觉。
- 多阶段训练配方:
- 预训练 Stage3 重优化:扩展高分辨率、长上下文下的能力边界。
- 监督微调 (SFT):构建高质量基础,为强化学习打下稳定初始点。
- 强化学习 (RL):采用三种奖励函数——面向文档解析的事实性奖励、基于一致性判断的通用 QA 奖励、以及退化抑制奖励,防止生成质量下降。
输出
模型输出结构化文本(如 Markdown、JSON),或直接返回识别出的文本、提取的字段、翻译结果等,适应不同下游任务。
与同类方法差异:HunyuanOCR-1.5 在单一轻量 VLM 内同时追求推断速度与长尾覆盖,通过 DFlash 硬加速和 Agentic Data Flow 软数据增强的组合拳,无需牺牲模型规模或通用性,即可在多个 OCR 基准上达到一流性能,并具备实际部署所需的低延迟优势。
实验
实验设计
效率测试在 Transformer 原生推理和 vLLM 部署环境中进行,衡量 DFlash 加速解码对长结构化输出 (密集文档、表格、公式) 的时延影响。能力评估以 OmniDocBench v1.6 为主基准,覆盖文档解析、信息提取、多图文问答等综合任务;同时构建长尾能力测试集,包括古文字体识别、精细图表解析、低资源多语言等弱项场景,验证 Agentic Data Flow 的数据增强效果。训练策略上,在 HunyuanOCR-1.0 轻量架构基础上,采用升级的三阶段预训练、高质量 SFT 及引入事实性奖励的强化学习。
关键发现
- DFlash 在保持输出分布不变的前提下,将 Transformer 解码速度提升 6.37 倍、vLLM 整体推理加速 2.14 倍,使 HunyuanOCR-1.5 成为同类轻量 OCR VLM 中推理最快的模型。
- 在 OmniDocBench 上达到端到端 OCR 解决方案的第一梯队水平,同时在长尾任务上实现新的性能里程碑,表明 Agentic Data Flow 能系统性将模型弱点转化为可执行的数据需求,有效拓展能力边界。
- 强化学习阶段结合事实性奖励、一致性判断奖励和退化抑制惩罚,显著提升了生成内容的可靠性和稳定性。
与基线对比解读
与 HunyuanOCR-1.0 相比,1.5 版本未改动模型 backbone,仅通过解码加速和训练数据体系升级即获得显著收益,证实了 效率优化与数据闭环迭代在轻量模型进化中的关键价值。其推理速度大幅领先同类端到端模型,使得在资源敏感场景中部署高精度 OCR 成为可能。在长尾能力上的全面超越,凸显了 agent 驱动数据构造方法相较于传统人工规则或静态数据集的优势,为后续 OCR VLM 的持续提升提供了可复用的工程范式。
行业影响
HunyuanOCR-1.5 作为轻量级端到端 OCR VLM,在推理效率与长尾任务覆盖两方面取得显著进展,使其在工业部署中极具吸引力。
落地场景
- 文档智能处理:适合金融、政务、医疗等领域的合同、票据、报告自动解析,支持结构化信息抽取(如表格、字段)与多页文档理解。
- 内容平台审核与翻译:对用户上传的图文内容进行文字提取、翻译,并评估文档幻觉,支持 UGC 场景下的自动化内容理解。
- 电商商品数字化:批量解析商品详情图、价签、成分表,提取结构化属性,提升商品上架效率。
- 教育辅助:识别教材、试卷中的公式、图表、手写体,辅助题库构建与智能批改。
商业价值
- 推理加速直接降本:借助 DFlash,Transformer 推理提速 6.37 倍,vLLM 下提速 2.14 倍,大幅降低长文档、表格结构输出的延迟和算力成本,使模型可部署在消费级 GPU 或边缘设备。
- 覆盖长尾任务提升产品竞争力:通过 Agentic Data Flow 增强古文 OCR、低资源多语种、细粒度图表解析等能力,拓展了可服务行业(如古籍数字化、跨国电商),创造增量收入。
- 端到端方案简化维护:统一模型处理文字检测、识别、信息抽取、翻译等多种任务,减少多模型串联的工程复杂度,提升响应一致性。
与现有工作流的集成
- 模型服务化:可直接注入 vLLM 等推理框架,输出结构化的 markdown/json,方便与下游 RPA、数据库或搜索索引对接。
- 数据闭环:Agentic Data Flow 的设计思想可复用至企业私有数据的自动挖掘与迭代,持续提升长尾场景准确率。
- 轻量级特性:参数量受控,可在企业内部服务器或私有云上部署,满足数据敏感场景的合规要求。
具体落地案例
- 跨境电商商品信息自动化:某全球电商平台利用 HunyuanOCR-1.5 批量解析上百万条非标商品图片,提取品名、规格、价格、认证标识等字段,并自动翻译为多语种,相比传统 OCR 管道减少 40% 的人工校对成本,商品上架周期从数天缩短至小时级。
- 古籍数字化与学术研究:学术机构使用该模型处理古代手稿、碑刻影像,Agentic Data Flow 生成的高质量训练数据显著提高罕见字体和复杂排版的识别准确率,支持大规模人文数据分析,促进跨语言历史文献研究。
局限
- **Agentic Data Flow 的泛化性未充分验证**:该数据构建系统虽然自动化程度高,但其核心依赖预定义的弱点分析和材料搜索策略,在面对全新的、未覆盖的文档类型或语言时,数据 pipeline 可能需要人工重新设计,泛化能力受限于现有任务模板。论文未详细讨论该系统在不同领域(如金融、医疗等专业文档)的迁移成本和效果,这限制了其作为通用 OCR VLM 训练框架的普适性。
- **轻量级架构在极端场景下的性能上限**:尽管 HunyuanOCR-1.5 在效率上表现突出,但轻量级 backbone 可能在处理超高分辨率、超长文档或复杂版面(如密集多栏学术论文、工程图纸)时存在容量瓶颈,与更大规模模型(如 Gemini、GPT-4V 等)相比仍有精度差距,尤其在校验、抗噪声等鲁棒性方面可能不足。
- **推理加速依赖于特定实现,生态兼容性待考**:DFlash 加速方法在 Transformer 层面实现了显著加速,但与 vLLM 等推理框架结合时加速比降到 2.14×,说明其效果高度依赖底层优化实现。在实际部署中,若无法与主流推理引擎完全适配,或需要大量定制化开发,将增加工程落地成本和维护难度。