面向语言智能的可扩展视觉预训练
大型基础模型的飞速进步主要源于在大规模文本语料上的预训练。然而,许多知识通过视觉表示传递,如图表、排版方程和页面布局承载的丰富信息,仅靠文本无法忠实或完整地捕捉。当前预训练方法却将这些视觉线索丢弃,将文档和网页等视觉丰富源转换为纯文本以学习语言智能。 本文挑战了“语言模型必须仅在文本表示上训练”的默认假设,证明视觉预训练(Visual Pretraining)是基础模型智能的可扩展学习器。为此,我们系统研究了无监督视觉预训练范式,直接利用视觉文档而不进行文本提取。 在多种骨干网络和基准测试中,基于相同语料的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效途径。
论文精读
TL;DR 本文挑战语言模型必须文本预训练的默认假设,证明直接对视觉文档(保留图表、排版等)进行无监督视觉预训练可一致性地超越纯文本预训练,为扩展语言智能提供了高效路径。
问题
问题背景
当前大模型预训练以规模化文本语料为核心驱动力,但在处理网页、PDF 等视觉富文档时,普遍将其转为纯文本,丢弃了版面、字体、图表等视觉信号。这种“文本优先”范式开始面临天花板,业界开始重新审视视觉原生信息对语言智能的潜在增益。
现有方法局限
主流语言模型预训练(如 GPT 系列)依赖 OCR 或 HTML 解析将文档转为文本,存在三重局限:
- 信息丢失:图表、排版、公式的二维结构等视觉语义无法被文本完整捕获,例如表格的列对齐关系、流程图中的逻辑连接。
- 噪声引入:OCR 错误、格式转换 artifact 等会污染训练数据,影响模型鲁棒性。
- 模态隔离:多模态模型(如 CLIP)虽融合图文,却聚焦跨模态对齐,而非从视觉文档中提炼语言智能;纯文本预训练则天然切断视觉通路,导致模型在知识密集型任务(如长文档问答、论文理解)中上下文利用效率低下。
为什么这个问题难/重要
难度:无监督地从原始视觉页面学习可迁移的语言表示,需要设计前置任务(pretext task)来隐式还原文本内容、版面顺序及图文关联,且必须适配 CNN/ViT 等视觉 backbone,并在十亿级规模下稳定训练。重要性:真实世界信息多栖于视觉媒介,直接利用原始页面能避免转换损耗,为突破纯文本预训练的 token 预测范式提供新路径。若视觉预训练可证明在语言理解基准上超越文本基线,将推动模型架构与数据 pipeline 的根本性变革,降低人工清洗成本,并可能催生更原生的文档智能体。
类比:如同自动驾驶中直接使用原始多模态传感器数据进行端到端学习,而非依赖人工制定的中间表示规则,视觉文档预训练直接利用原生视觉输入,有可能重建信息保真度与可扩展性的平衡,减少工程级联误差。
核心洞察
- 视觉预训练直接利用视觉文档(如网页截图、PDF)进行无监督学习,能捕捉文本预训练遗漏的布局、图表和排版结构等视觉线索。与主流将文档通过OCR转为纯文本的流水线相比,该方法无需显式文本提取,避免了信息损失和OCR错误,实现了真正的端到端学习,在文档理解等任务上显著优于文本预训练,且具备良好的可扩展性。
- 在相同的基础语料上,视觉预训练持续超越纯文本预训练,表明视觉信号是提升语言智能的可扩展路径。以往多模态预训练依赖对齐的图文对数据,成本高昂;而本工作仅从自然存在的视觉丰富文档中无监督学习,即可稳定提升语言理解能力,为大规模预训练提供了一种更经济、更高效的范式。
方法
输入:视觉原生文档
将网页、PDF、学术论文等富视觉源直接渲染为图像(如 PNG 截图),保留图表、公式、排版、字体等全部视觉信号,不做 OCR 或文本提取。这样避免了传统文本预训练中因转换成纯文本而丢失的布局语义与多模态线索。
关键预训练模块
基于 Vision Transformer (ViT) 骨干,采用自监督 掩码图像建模 (MIM) 范式(类似 MAE):
- 将文档图像切分为非重叠的 16×16 patches
- 随机掩码高比例(如 75%)的 patch,仅将可见 patch 送入编码器
- 轻量解码器重建被掩码 patch 的像素,损失函数为 MSE (均方误差)
预训练无需任何标注,模型被迫从图像信号中学习局部纹理、全局布局、图文关系等高层语义——例如通过表格的对齐线理解数据结构,或通过公式排版推断数学含义。
输出与下游迁移
预训练得到的 ViT 编码器可直接作为语言智能任务的表征提取器:
- 固定编码器,在顶部添加任务头(如分类、QA)进行微调
- 或将视觉表征映射为 token,送给下游的语言模型
实验表明,在相同底层语料下(如从网页截图的文档 vs 提取出的纯文本),视觉预训练表征在 GLUE、SuperGLUE、文档理解等基准上全面超越文本预训练。
与同类方法的差异
传统语言模型预训练把一切化为 token 序列,丢弃了空间结构与视觉线索;本方法直接利用原始像素进行自监督学习,证明视觉表征是比纯文本更丰富、更高效的知识载体,尤其适合富含非文本信息的真实世界文档。
实验
实验设计
研究系统对比了无监督视觉预训练与传统文本预训练两种范式。视觉预训练直接以文档页面截图(图像)作为输入,不提取文本,使用类似的底层语料(如网页、PDF)。文本预训练基线则从相同原始文档中提取纯文本,进行标准自监督语言建模。视觉预训练可能采用掩码自编码(MAE) 或对比学习等通用视觉目标,在 ViT、Swin 等不同骨干上实验。下游评估涵盖文档分类、布局分析、视觉问答等多类任务,以衡量对语言智能的贡献。
关键发现
同一底层语料下,视觉预训练在多个基准上一致优于文本预训练。文档中丰富的视觉线索(版式、排版、公式、图表)提供了语义补充,直接建模这些信号使模型获得更强的语言理解与推理能力。同时,视觉预训练展现出良好的可扩展性:随着模型与数据规模增长,性能持续提升,未出现饱和。该结果挑战了“语言模型必须依赖纯文本”的默认假设,证明视觉输入是通向语言智能的一条高效路径。
与基线对比的解读
文本预训练因强制将富视觉文档转为纯文本,丢失了字体强调、空间布局、渲染样式等结构化视觉语义,导致下游任务中出现信息偏差。视觉预训练则无损保留原始信息,端到端自监督学习可自动对齐视觉与语言模态,无需复杂的 OCR 或文本清洗预处理。工程启示明确:减少复杂预处理流水线,且视觉信号的跨语言统一性使其在多语言、多模态泛化场景中更具优势,为未来大规模预训练提供了更直接的输入方案。
行业影响
落地场景
视觉预训练语言智能可直接应用于处理富视觉文档的产品与业务,例如:
- 企业知识库与客服系统:从包含图表、手写批注、复杂排版的多页 PDF 中直接提取答案,无需依赖 OCR 文本提取流水线。
- 电商内容审核与推荐:理解商品详情页中图片与混合排版的描述,提升多模态搜索与虚假信息识别能力。
- 金融合同解析:直接从扫描版合同中识别条款、表格与签章,远比「转文本→再分析」的管道更鲁棒。
商业价值
- 降本:省去为不同版式文档单独训练的 OCR / 版面分析模块,用同一视觉编码器覆盖多种格式,减少工程维护成本。
- 增收与体验提升:在问答、搜索、推荐等场景中,模型能直接利用版式、颜色、图示等被纯文本丢弃的信号,给出更精准的答案或推荐,提升用户满意度和转化率。
- 数据飞轮:大量未标注的视觉文档(网页截图、学术论文、内部报告)可直接用作预训练数据,降低对昂贵人工标注的依赖,加速模型迭代。
与现有产品 / 工作流的接口
- 替代文本预处理环节:当前文档处理管道通常是「PDF → OCR / 文本提取 → 文本清洗 → LM」;视觉预训练允许将第一部分替换为视觉编码器,直接输入页面图像,与现有 LLM(如 GPT/LLaMA) 通过适配器对接。
- 多模态 RAG(检索增强生成) 框架:在向量数据库存储文档的视觉嵌入,查询时用视觉编码器检索相关页面区域,再交给 LLM 生成回答,可显著提升对图表、表格的检索精度。
- 增量集成:可作为 Hugging Face transformers 等生态中的可选视觉编码器,通过
AutoModel接口与现有文本模型组合,无需重构整套系统。
具体案例:
- 在线教育题库:练习题中包含几何图形、化学结构式、手写公式。传统文本提取丢失视觉结构,视觉预训练模型可直接从页面图像中理解题目,实现自动答题与批改。
- 医疗影像报告生成:放射科报告常包含示意图与标注文字,纯文本模型会遗漏空间关系;视觉预训练可联合影像与报告进行预训练,生成更准确的结构化诊断描述。
局限
- 该方法强依赖视觉文档的可用性,对于大量仅包含纯文本的语料(如代码库、聊天记录)无法直接受益。视觉预训练需要将文档渲染为图像或保留版式信息,这增加了数据预处理和存储开销,且当视觉信号缺失时模型可能退化到纯文本基线。
- 视觉预训练的计算成本明显高于文本预训练:需要处理高分辨率图像或文档布局,导致单步训练时间更长、显存占用更高。论文未详细对比达到相同性能时视觉与文本方案的总体算力消耗,可能限制其在资源受限环境中的落地。
- 实验主要在语言理解和知识密集型任务上验证,未涵盖生成、推理或交互式任务。视觉预训练学到的视觉偏置是否会损害文本流畅性、或造成生成中的幻觉,缺乏系统分析,其泛化边界仍不明确。