论文

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

多模态大语言模型(MLLMs)显著推进了文档理解,但当前的 Doc-VQA 评估仅评分最终答案,而不检查支撑证据。这种仅答案的方法掩盖了一个关键失败模式:模型可能得到正确答案,却将其归因于错误的段落——这在法律、金融和医学等高风险领域是严重风险,因为每个结论都必须可追溯到特定源区域。 为了解决这一问题,我们提出了 CiteVQA 基准,要求模型在回答每个问题的同时返回元素级的边界框引用,并对两者进行联合评估。CiteVQA 包含 1,897 个问题,覆盖 711 个 PDF(平均 40.6 页),横跨七个领域和两种语言。为保证真实性和可扩展性,真值引用通过自动化管道生成(该管道通过掩码消融识别关键证据),随后经专家审查验证。核心评估指标是 严格归因准确率(SAA),只有当答案和引用区域都正确时才给予分数。 审计 20 个 MLLMs 揭示了普遍的 归因幻觉:模型频繁产生正确答案却引用错误区域。最强的系统(Gemini-3.1-Pro-Preview)SAA 仅为 76.0,而最强的开源 MLLM 仅达到 22.5。 最终,面向可信文档智能,CiteVQA 暴露了仅答案评估所忽略的可靠性差距,提供了弥补该差距所需的工具。我们的仓库位于 https://github.com/opendatalab/CiteVQA。

论文精读

TL;DR CiteVQA 是一个要求模型同时输出答案和元素级引用边界的文档 VQA 基准,揭露了现有 MLLM 普遍存在的“归因幻觉”——答案正确但证据引用错误,暴露了纯答案评测所忽视的关键可靠性缺陷。

问题

问题背景

Doc-VQA 评估旨在衡量多模态大模型 (MLLM) 从复杂文档中提取信息并回答问题的能力,但当前主流基准(如 DocVQA、MP-DocVQA)仅关注答案正确性,忽略了对证据引用的验证。

现有方法的局限

  • 答案-唯一评估 (answer-only evaluation) 掩盖了关键的归因幻觉:模型可能给出正确答案,却基于错误的文档区域,即 Attribution Hallucination
  • 现有基准不提供元素级的 evidence annotation,无法自动检查引用精度;模型训练也通常未要求精确定位证明片段,导致在实际部署中不可信。
  • 高风险场景(法律、金融、医疗)要求每一条结论可溯源至特定页面区域,仅凭答案正确无法满足合规与审计需求。

为什么这个问题重要且困难

  • 技术挑战:在平均 40+ 页的 PDF 中细粒度定位证据,需要跨模态空间对齐与多步推理,且必须联合优化答案正确性和引用准确性,避免模型依赖统计捷径。
  • 业界关注:可解释的文档 AI 已成为落地刚需,自动报告生成、合同审查等系统必须附带引用。CiteVQA 提出的 Strict Attributed Accuracy (SAA) 揭示严峻差距:最强闭源模型仅 76.0,最强开源模型仅 22.5,表明归因能力是当前 MLLM 的普遍盲区。
  • 该 benchmark 通过 masking ablation 自动化生成 ground-truth citation 并经专家审核,为评估和提升证据归因能力提供了可扩展的测试手段。

行业类比

类似知识库问答需要返回原文片段以审计回答正确性,在医疗咨询与金融合规场景中,错误引用可能直接导致违规决策或严重误判。

核心洞察

  • **CiteVQA** 首次系统揭示当前多模态大模型 (MLLM) 在文档 VQA 中普遍存在 **归因幻觉 (Attribution Hallucination)**——模型能答对问题,却常将支撑证据错误地归因到无关文本区域。这一现象在仅评估答案的传统基准中完全不可见,但在法律、金融、医学等需追溯原文的高风险场景下致命。CiteVQA 要求模型同时输出边界框级引用,并联合考察答案与证据的正确性,从而暴露了从闭源到开源模型的广泛可靠性缺口,为构建可审计的文档智能提供了关键检测工具。
  • **Strict Attributed Accuracy (SAA)** 作为联合评估答案正确性与证据引用准确性的核心指标,重新校准了文档 VQA 的性能标尺。传统准确率只关心最终答案,SAA 则要求 **答案和引用区域同时正确** 才算分,直接度量模型是否真“读懂了”文档。实验显示,最强模型 Gemini-3.1-Pro-Preview 的 SAA 仅 76.0,最强开源模型仅 22.5,答案准确率与证据忠实度之间出现巨大落差。这一指标推动社区关注证据级可靠性,而非仅追求表面答案匹配,为模型改进提供了更精准的优化方向。

方法

输入与数据构建流水线

输入为来自法律、金融、医学等七个领域及两种语言的 711 份 PDF 文档(平均 40.6 页)。构建过程分为三个核心阶段:

  1. 多文档链接 (Multi-Document Linking)
    通过语义分析与稠密检索,对长文档进行分块并建立跨页面的关联关系,利用大语言模型 (LLM) 进行细粒度对齐,将散落的信息凝聚为结构化知识片段。

  2. 证据包提取 (Evidence Package Extraction)
    从原始 PDF 中精准提取文本块和对应的边界框坐标,形成“证据包”(text + bbox),保证每一条证据都可追溯到页面上的具体视觉区域,为元素级引用提供定位基础。

  3. 问答构建与关键证据识别
    自动生成问答对,并通过 掩码消融 (masking ablation) 技术定位关键证据:依次遮蔽文本的不同部分,测试模型答案是否发生变化,从而确定哪些 token 或区域对得出正确答案是真正不可或缺的。此步骤自动产生高质量的证据引用,再经专家审核确保保真度。

输出与评估

最终构建的 CiteVQA 数据集包含 1,897 个问题,每个问题配有答案以及一份或多份元素级边界框引用,用于指示文档中支撑答案的具体视觉区域。评估时采用严格归因准确率 (Strict Attributed Accuracy, SAA),只有当模型给出的答案与引用的证据区域同时正确时,才判定为一次有效预测。通过该指标,可系统性地诊断模型的归因幻觉 (Attribution Hallucination)——即答案正确却引用了错误来源的失效模式。

与传统 Doc-VQA 评测仅关注最终答案不同,CiteVQA 首次强制要求模型输出具备可溯源的元素级证据引用,并通过 SAA 将答案正确性与证据可靠性绑定,为可信文档智能提供了缺失的评估维度。

实验

实验设计

CiteVQA 对 20 个多模态大语言模型(MLLMs)进行系统性审计,涵盖闭源与开源系统,测试集包含 711 份 PDF 文档、1,897 个问题,平均页数 40.6 页。评估核心指标为 Strict Attributed Accuracy (SAA),要求模型同时输出正确答案与元素级边界框引用,二者均正确才计分。真值引用通过自动掩码消融(masking ablation)定位关键证据并经由专家验证构建,确保标注忠实可靠。实验覆盖法律、金融、医学等 7 个高风险领域与 2 种语言。

关键发现

  • Attribution Hallucination 现象严重:所有被测模型均出现“答对但引错”的归因幻觉。表现最强的闭源模型 Gemini-3.1-Pro-Preview 仅获 SAA 76.0,最强开源模型 SAA 仅 22.5
  • 答案准确率与归因准确率严重脱节:多数模型在答案正确时,证据引用正确率不足 50%,证明纯答案评测会显著高估模型可信度。
  • 领域差异显著:法律、金融、医学等长文档、多证据场景下,归因错误率飙升,暴露当前 MLLMs 在复杂文档推理中的证据定位短板。

基线对比与工程启示

传统 Doc-VQA 评测仅依赖 Exact MatchANLS,完全忽略答案的证据来源,而 CiteVQA 首次将联合评估标准化,揭示了巨大的可靠性鸿沟。例如,Gemini 的答案准确率可能远超 76%(论文未直接报告),但 SAA 断崖式下降,说明“蒙对答案”无法支撑可解释决策系统。工程上,构建可信文档智能系统必须将归因验证作为内置模块,以 SAA 为核心指标,并利用自动掩码测试探测模型是否依赖虚假相关性。开源模型 SAA 极低的现状为社区提供了明确的攻坚方向:强归因能力需要架构与训练范式的针对性改进,而非单纯扩大规模。

行业影响

落地场景:高合规性文档智能的刚需

CiteVQA 揭示的 Attribution Hallucination 问题,直接指向法律、金融、医疗等领域的文档处理痛点。在这些场景中,仅给出答案而无法正确指明证据来源,可能导致决策风险。该基准可直接用于下列产品与业务:

  • 智能合同审查:模型回答“是否存在竞业限制条款”时,必须高亮具体条款区域,否则不可信。
  • 金融研报与财报分析:提取营收数据时必须指向具体表格或段落,支持分析师快速验证。
  • 医学文献自动化综述:引用具体试验结果表格或语句,确保循证结论可追溯。

商业价值:信任红利与自动化门槛降低

目前最强的闭源模型 Strict Attributed Accuracy (SAA) 仅 76.0%,开源模型仅 22.5%,显示归因能力严重不足,改进空间巨大。引入 CiteVQA 作为评估标尺或训练目标,可带来:

  • 降本:减少人工复核证据的成本。例如,律师无需逐页重读合同,仅需抽检模型标注的引用区域是否匹配。
  • 增收:提升文档自动化产品的置信度,使其能进入合规更严格的付费市场(如监管报告生成)。
  • 体验提升:为用户提供 可解释的答案,直接展示证据来源,显著增强对 AI 系统的信任。

与现有工作流的集成方式

CiteVQA 的设计与现有文档 AI 栈高度兼容:

  1. 评估环节集成:将 SAA 指标嵌入模型评测流水线,作为除准确率外的强制性质量门禁。对 20 个 MLLM 的审计结果可直接作为基线(GitHub 提供代码)。
  2. 微调数据增强:利用 CiteVQA 的 1897 个带引用框的问答对,对开源 MLLM(如 LLaVA、Qwen-VL)进行监督微调,或通过拒绝采样生成更多引用轨迹。
  3. 后处理与验证模块:在现有 Doc-VQA 系统输出答案后,增加一个 证据定位校验模块,复用 CiteVQA 的 masking ablation 思路判断引用是否可靠,若不匹配则触发人工介入。

具体落地用例

  • 金融合规:某投行使用 MLLM 读取招股书,回答“本次发行后股权稀释比例”。通过 CiteVQA 风格的训练,模型不仅输出 15.3%,还框选出“发行后总股本”与“原股东持股数”所在的表格行,分析师可一键跳转校验,审核时间从 10 分钟压缩到 20 秒。
  • 医疗事务:药企医学团队利用 CiteVQA 微调模型,分析临床试验报告(PDF)中的不良事件数据。要求回答“严重不良反应发生率”时,模型高亮相关统计表的具体单元格,确保提交给监管机构的材料来源准确,减少因引用错误导致的发补风险。

局限

  • ### 自动化证据生成管线的潜在偏差 基准采用 **masking ablation** 自动化识别关键证据区域,虽经专家验证,但该流程依赖 **MLLMs** 自身判断,可能引入与待测模型同源的偏差,导致某些类型的证据被系统性遗漏或误标。此外,掩码消融对多模态交互的模拟较为粗粒度,无法捕获复杂推理中多证据片段的协同作用,专家审查成本也限制了规模扩展,长期可能影响评估的客观性与全面性。
  • ### 引用格式的单一性 评估仅支持 **元素级边界框引用**,未涵盖更细粒度的**文本片段引用**或更抽象的**逻辑推理链**。在许多高可信场景(如法律、医疗)中,用户期望模型指出具体的句子或推理步骤,而非仅标注页面区域。这种格式限制使基准难以适配多样化的归因需求,也未能评估模型在生成自然语言解释方面的可靠性,削弱了其在实际部署中的参考价值。
  • ### 数据集规模与训练支持不足 **CiteVQA** 仅包含 **1897 个问答对**,覆盖 7 个领域和两种语言,但部分子集样本量极小,可能无法提供稳健的领域级评估。同时,该基准未提供训练数据或微调范式,仅支持零样本/上下文学习评估,无法直接作为模型优化的目标。这限制了其在模型开发流程中的实用性,研究者无法利用该基准进行监督微调或 RLHF,难以系统性地缓解归因幻觉问题。
论文Dongsheng Ma2026-05-13原文

相关内容