无坐标或区域标签的 Visual Document Understanding 中的 Evidence Attribution
可靠的视觉文档理解要求模型将每个答案归因于支持它的证据区域。最近的基准和系统通过坐标接口实现这一步骤:模型输出标记证据区域的边界框坐标。在这种接口下,视觉语言模型即使答案正确也常无法识别正确区域,这种失败称为Attribution Hallucination。我们研究这种失败是否部分受限于模型通过坐标表达的能力。 在验证的双语CiteVQA子集上,我们比较了坐标接口与语言接口:后者中模型仅输出文本,逐字引用其证据,然后多模态检索器返回每个引用的位置作为布局解析器提出的页面区域(表格和图表通过其标题或注释引用);比较在六个开源视觉语言模型上重复。与坐标接口相比,证据召回率从最多8点上升到26至47之间,幻觉率大致减半,而答案质量变化不大。 基于此比较,我们将相同的引用-检索流水线用作训练支架:由于长文档的区域级证据标签收集成本高,我们引入一种GRPO方法,其奖励是法官对黄金答案和检索区域裁剪的阅读,训练模型在没有任何区域标签的情况下引用更好的证据,将8B骨干模型的严格归因准确率从22.4提高到33.8。这些发现表明了一条实用的改进路径:无需坐标接口,也无需昂贵的区域级监督。
论文精读
TL;DR 用自然语言引用替代坐标框选,让模型通过引用原文并由检索器定位证据区域,大幅提升证据召回并降低幻觉;进一步提出无需区域标注的 GRPO 强化学习训练,提升归因准确性。
问题
问题背景
视觉文档理解(Visual Document Understanding, VDU)在构建可信问答系统中面临关键挑战:模型不仅要给出正确答案,还必须准确指出支持该答案的证据区域(如文档中的段落、表格、图片)。当前的评测基准(如 CiteVQA)和多数系统采用坐标接口(coordinate interface),要求模型直接输出证据区域的边界框坐标。
现有方法的局限
坐标接口存在两个根本性问题:
- 归因幻觉(Attribution Hallucination):即使答案正确,模型也经常预测出错误的边界框,表现为“答对指错”。这种幻觉严重损害了系统可靠性,却难以通过常规的监督学习消除。
- 表达瓶颈:模型需要通过自回归生成数值坐标,这是一种对视觉定位不直接的形式,可能导致性能被“怎么表达”而非“知不知道”所限制。已有研究表明,**视觉-语言模型(VLM)**在坐标提取上的能力普遍弱于其文本理解能力。
- 标注成本高昂:细粒度的区域级证据标签(每个答案对应哪些页面区块)需要密集的人工标注,尤其对于多页长文档,成本极高,导致监督信号稀缺。
问题的重要性与技术挑战
该问题直接关系到文档 AI 系统的部署价值:金融、医疗、法律等场景中,错误的归因可能引发合规风险。核心挑战在于:
- 跨模态对齐:文本答案和视觉区域之间存在非平凡的匹配关系,简单的空间映射无法处理表格、图片等非纯文本元素(其证据常隐含在标题或脚注中)。
- 接口设计:坐标作为中间表示,可能不是模型最自然的输出形式;但纯文本引用又需要可靠的后端来定位,增加系统复杂度。
- 训练数据依赖:摆脱区域级标签的训练方法,目前仍处于早期探索,REINFORCE 类算法在视觉定位中的稳定性与泛化性尚未被充分验证。
行业类比
类似于检索增强生成(RAG) 中需要将生成内容溯源到检索到的文档段落,视觉文档问答的证据归因本质是“多模态溯源”——当模型说出答案时,必须能回指到页面上的具体可视证据,否则再高的准确率也无法在实际业务中落地。
核心洞察
- 坐标界面是视觉文档理解中归因幻觉的重要瓶颈,而非模型能力的根本缺陷。本文通过在同一批模型上对比坐标输出与纯语言引用两种证据表达方式,发现语言界面能将证据召回率从不足8个百分点提升至26-47个百分点,同时幻觉率减半。这表明模型已在语义层面理解了证据位置,只是无法通过坐标准确表达,而直接引用原文绕开了这一局限,对实际系统设计有直接启示:用检索代替回归坐标更鲁棒。
- 将引用-检索流程作为训练支架,配合GRPO与无区域标注的奖励设计,可以在不依赖昂贵区域标签的情况下提升模型引用证据的质量。该方法让模型在无需人工标注边界框的条件下学会更好的证据引用,将8B基座模型的严格归回答正确率从22.4提升至33.8。这为长文档、多语种场景下的大规模证据归因训练提供了一条低成本、可扩展的路径,与依赖精细坐标监督的现有方案形成鲜明互补。
方法
本文提出一种无坐标接口的视觉文档问答证据归因方法,核心流程为:输入文档图像与问题 → VLM 纯文本输出(答案 + 逐字引用) → 多模态检索定位引用区域 → 可选 GRPO 训练优化引用质量。
关键模块
- 自然语言证据接口:模型仅输出文本,每个答案附带一段可直接映射回原文的逐字引用(verbatim quote)。表格与图表通过其标题或注释被引用,完全避免坐标预测,从而绕开坐标表达瓶颈。
- 全文档语义块检索:先将页面通过布局解析器分割为段落、表格、图表等语义块,然后用多模态检索器(如 CLIP 双塔)将每条引用文本与最匹配的块对齐,自动输出该块在页面中的边界框。该步骤不需要任何额外的区域标注。
- GRPO 无区域标签训练:当引用质量不够理想时,引入 GRPO(Group Relative Policy Optimization)微调。奖励由裁判模型给出:裁判同时阅读“黄金答案”和“检索到的区域裁剪图”,判断二者的一致性。该奖励信号完全不需要人工标注的区域级证据,仅依赖答案正确性和检索区域的视觉相关性。训练数据来自模型自身在未标注文档上的生成结果,通过奖励筛选出更优的引用,使 8B 模型严格归因准确率从 22.4 提升至 33.8。
输入 → 输出流
[文档图像, 问题] → VLM 生成 → [答案, 引用文本列表] → 块检索 → [每个引用对应的页面区域坐标] → (训练时)GRPO 奖励优化引用策略。
与同类方法的差异:现有方法大多依赖坐标回归或需要昂贵的区域级监督信号;本工作完全摒弃坐标输出,用语言接口 + 检索实现证据定位,并通过无区域标签的强化学习提升归因能力,为长文档理解提供了一种低成本、高可扩展的归因范式。
实验
实验设计
在经人工验证的双语 CiteVQA 子集上, 比较两种证据归因接口:
- 坐标接口: 模型直接输出边界框坐标, 定位文档中的证据区域。
- 语言接口: 模型仅输出原文引用文本(
quote), 再由多模态检索器在布局解析器输出的页面块中匹配位置(表格/图表通过标题引用)。 评估覆盖 6 个开放视觉语言模型, 并用语言接口管道作为训练脚手架, 设计了无区域标签的 GRPO 训练: 奖励信号由金标准答案与检索区域裁切的评判阅读给出, 训练模型生成更优引用, 无需昂贵的人工区域标注。
关键发现
- 证据召回大幅提升: 语言接口下最高召回达 26–47(坐标接口最多 8), 归因幻觉率约减半, 且答案质量几乎不变。
- 训练增益显著: 对 8B 骨干模型使用 GRPO 后, 严格归因准确率从 22.4 升至 33.8, 全程无需区域级监督。
- 实验表明, 坐标接口的失败部分源于表达瓶颈而非模型能力不足: 模型已能在文本中描述位置, 只是难以精确映射到数值坐标。
与基线对比的深度解读
与遵循坐标预测的常规方法(如直接将目标检测范式用于证据定位)相比, 语言+检索方案将归因问题拆解为更符合 VLM 能力的任务——引用文本, 而后交由专用检索器完成空间定位。这一分离有效规避了坐标回归/生成的高错误率, 同时保留了证据的可追溯性。GRPO 训练进一步证明, 通过奖励设计可以驱动模型生成更高质量的引用, 而无需依赖稀缺的区域标注, 这对长文档、多语言场景下的低成本归因部署具有实际参考价值。
行业影响
落地场景
该工作提出的 无坐标、无区域标注的证据归因 方案,可直接应用于需要可靠答案溯源的视觉文档理解产品,例如:
- 智能合同审查:对关键条款的回答自动高亮来源段落,提升法务效率。
- 财报/研报问答:金融分析师提问后,系统同步给出原文引用及页面位置,避免模型胡编。
- 医疗/保险文档审核:回答基于检查报告哪些字段,降低误判风险。
- 教育试题解答:给出答案并精准定位教材插图或表格中的依据。
商业价值
- 降本:直接用语言引用 + 多模态检索替代标注坐标,省去大量人工标注区域成本(尤其长文档)。GRPO 训练奖励机制 进一步无需任何区域监督,可将模型 严格归因准确率(strict attributed accuracy)从 22.4 提升至 33.8,而答案质量几乎不降。
- 信任提升:证据回溯能力是 RAG 系统合规的关键,归因幻觉率减半(约从 16% 降至 8%)意味着企业级应用可满足审计要求,降低法律风险。
- 体验优化:用户可一键跳转原文高亮区域,交互感更强,差旅报销、发票审核等场景效率显著提高。
与现有产品/工作流的接口
现有方案依赖模型输出 [x1,y1,x2,y2] 边框,常因坐标预测不准导致高幻觉率。本工作提出 语言接口 + 布局解析器 + 多模态检索 的替代栈:
- 模型仅输出原文引用文本(quote),无需任何坐标。
- 布局解析器(如 TableBank、PubLayNet 预训练模型)预先将文档切割为语义块(段落、表格、图注等)。
- 多模态检索器(如 ColPali)将引用文本与语义块匹配,返回对应区域。
该流水线可零改动集成到现有 VLM API 之上(如 GPT-4V、Qwen-VL),只需在输出解析层增加检索步骤。训练阶段的 GRPO 奖励 使用 答案准确性 + 裁剪区域相关性 作为信号,无需区域标注,可低成本复用于各垂直领域文档。
具体落地 Use Case
电商合规审核:平台需自动校验商品详情页宣传语是否与资质证书一致。传统做法需人工逐条核对;使用本方案,审核模型回答“该产品是否具有FDA认证”时,可直接引用证书截图中的编号字段,并高亮对应区域,审核效率提升且可追溯。
企业知识库问答:内部技术文档(含大量架构图、数据表)的问答系统常因无法指回原文而缺乏说服力。通过语言引用 + 布局检索,用户提问“服务 SLA 指标是多少”时,答案带引用文字的页面区域高亮,技术 leader 可直接确认来源,降低沟通成本。
局限
- 当前方法高度依赖外部布局解析器的 region 提案质量,解析错误会直接回流到证据定位精度。论文仅在少数解析器配置上验证,未系统分析不同解析器失败模式对召回率的影响,实用性在非标准版式文档上受限。
- 引文忠实度仍存隐忧:模型生成的 quote 可能与原文存在细微出入,尤其长段落或复杂表格的截断引用。奖励模型训练依赖检索到的 crop 区域,未单独校准文本匹配精度,可能导致优化信号偏差。
- 实验集中于 CiteVQA 子集(学术论文页面),在真实场景中常见的发票、报告、多栏扫描件等异构文档上的泛化性未经验证,且未探索 8B 以下轻量模型的可行性,工业落地时成本与延迟待评估。