当LLMs粗心读表:测量与减少数据引用错误
尽管大型语言模型(LLMs)在表格任务上表现良好,但它们仍然会出现数据引用错误(DREs),即错误地引用或遗漏表格值,尽管它们理解了表格结构。除了最终答案的准确性,DREs会直接损害中间推理步骤的正确性和可靠性。然而,先前的研究仅提供了有限的小规模分析。 在本工作中,我们首次系统评估了不同模型和任务中的表格数据引用错误。结果显示,DREs在所有测试模型(1.7B至20B参数)中均出现。此外,我们证明通过基于批评者的过滤和拒绝采样,将数据引用作为批评者可以显著提高答案准确性,最高提升12.0%。 最后,我们训练了一个轻量级的4B参数批评者模型,在检测分布内和分布外DREs时平均F1分数达到78.2%,并能有效协助更大模型的推理。
论文精读
TL;DR 首次系统评估大模型在表格任务中的数据引用错误,提出基于critic的过滤与拒绝采样,将答案准确率提升最高12.0%,并用4B轻量critic模型高效检测DREs。
问题
问题背景
表格是金融、医疗、科学等领域的通用知识载体,LLM 在表问答、事实核查等任务中展示出不错的理解能力,但近期发现模型会犯 数据引用错误 (Data Referencing Errors, DREs),即错误引用或完全漏掉表格中的具体数值,即便它已正确解析了表结构。这类错误直接污染中间推理链,影响最终答案的可信度。
现有方法局限
此前对表格 LLM 的评估多停留在最终答案准确率,极少深入分析中间步骤的数据引用行为。个别关于 DREs 的研究只进行了小规模、碎片化的现象描述,缺乏以下关键支撑:
- 系统性测评:没有跨模型(不同参数规模)、跨任务(如表格事实验证、数值推理)的全面基准,无法揭示 DREs 的普遍性和分布模式。
- 干预手段缺失:即便观察到 DREs,也缺少能与模型推理管道直接结合的检测与纠正方法,导致错误发现后无法有效拦截或修正。
- 可解释性断层:仅凭最终答案正确与否,无法区分模型是“真正理解了表格”还是“靠表层模式蒙对”,工程上难以定位数据引用缺陷的根源。
为什么这个问题难且重要
DREs 的隐蔽性极强:一次推理可能涉及多次查表操作,错误往往发生在长链推导的某个中间步骤,且自回归生成过程难以回溯修正。此外,业界对 LLM 的表格应用需求激增——从自动财报摘要到临床试验数据抽取——任何数据引用错误都可能导致高风险误判。因此,构建一套 可量化的 DREs 定义与检测体系,并设计低侵入式的 推理阶段自纠机制,已成为提升表格 AI 可靠性的核心挑战。
行业场景类比
这类似 检索增强生成 (RAG) 中,模型可能错引或编造检索到的文档片段,导致幻觉(hallucination);表格任务中的 DREs 本质上是一种“结构化数据引用幻觉”,它对决策分析的危害与 RAG 上下文错乱同等严重。
核心洞察
- DREs 是 LLM 在表格任务中普遍存在的失误模式,不仅影响最终答案,更直接损害中间推理步骤的可靠性。此前研究仅在小规模上零散分析,本文首次系统地在 1.7B 到 20B 参数模型上量化 DREs,揭示其并非偶发错误,而是跨模型、跨任务的系统性问题。这一发现将评估从输出结果拓展到推理过程,为表格 LLM 的可靠性改进指明了更精细的优化目标。
- 将数据引用正确性作为 critic 进行过滤和拒绝采样,显著提升答案准确率(最高 12.0%),并训练出仅 4B 参数的轻量 critic 模型(F1 78.2%)检测分布内外 DREs。该方法不同于仅优化最终答案的传统思路,而是通过显式批评推理过程的引证准确性来提升整体质量。小模型检测的高效性使得在实际部署中,可以用低成本 critic 辅助大模型推理,实现可落地的准确性与可靠性提升。
方法
整体流程:表格推理中的 DRE 检测与消除
输入为结构化表格与自然语言查询,模型需基于表格内容生成答案或推理步骤。核心挑战在于 LLM 虽然理解表格结构,但仍会犯 数据引用错误 (Data Referencing Errors, DREs),即错误地引用或遗漏表格中的具体数值。
关键模块
DRE 定义与分类体系
作者首先将 DRE 系统化定义为两类:- 遗漏 (Omission):答案中缺少必要的表格值引用。
- 错误引用 (Misreference):引用了一个不存在或错误的表格值。
这一分类为后续自动评估与改进提供了清晰的标签体系。
自动化评估:LLM-as-a-Judge
为大规模分析 DRE,采用 LLM 作为评判器自动检测生成文本中的 DRE,并计算 Precision / Recall / F1 等指标。评估覆盖 1.7B 到 20B 参数量的多个模型,证实 DRE 普遍存在,且与模型规模无强关联。Critic 模型训练
- 基于上述评估结果构造训练数据,训练一个轻量级 4B 参数 Critic 模型,专门判断给定答案片段是否包含 DRE。
- 训练分两阶段:
- 监督微调 (SFT):使用人工标注或 LLM 自动标注的正负样本。
- 基于强化学习的拒绝采样 (RLVR):利用 DRE 检测的 reward 信号进一步优化 Critic 的判别能力。
最终 Critic 在分布内与分布外 DRE 检测上平均 F1 达到 78.2%。
推理阶段优化策略
- Critic-Based Filtering:对同一问题生成多个候选答案,用 Critic 剔除含 DRE 的答案,仅保留无错误候选,平均提升准确率 最高 12.0%。
- Rejection Sampling:若采样答案被 Critic 判定为含 DRE,则重新采样生成,直至得到无错误答案,进一步提高可靠性。
输出为更准确的最终答案,同时 Critic 模型可作为即插即用组件辅助更大模型的推理。
与同类方法的差异:以往工作多聚焦于表格任务最终答案的准确性,且缺乏大规模的 DRE 专项评估。本工作首次系统量化 DRE 的普遍性,并设计专用 Critic 模型在中途推理步骤上直接拦截错误,而非仅依赖最终输出矫正。
实验
实验设计
研究对 1.7B 至 20B 参数 的多种 LLM 在表格任务中的 数据引用错误 (DREs) 进行了首次系统性评测。实验覆盖多类表格理解任务 (如事实核查、问答等),提出一套基于 LLM-as-a-Judge 的 DREs 分类体系与自动化评估指标。为减少 DREs,设计了 基于批评的过滤 (critic-based filtering) 与 拒绝采样 (rejection sampling) 两种策略;随后通过 监督微调 (SFT) 与 RLVR 训练了一个 4B 参数的小型批评模型,用于检测 DREs 并辅助大模型推理。
关键发现
- DREs 普遍性:所有被测模型均出现不同程度的 DREs,即便模型能理解表格结构。
- critic 机制有效:引入 critic 后,答案准确率最高提升 12.0%,表明过滤错误引用可直接改善最终输出质量。
- 轻量 critic 性能强:4B 参数的批评模型在检测分布内和分布外 DREs 时达到 平均 F1 78.2%,并能有效辅助更大模型的推理过程。
与基线对比的深度解读
传统评估多关注最终答案正确性,而 DREs 暴露了推理链可靠性。与直接生成答案的基线相比,critic 机制显著降低了错误引用:
- 过滤方法 通过拒绝对表格值的错误引用,避免了虚假信息传递;
- 拒绝采样 则更灵活地在推理时进行多轮修正,提升了鲁棒性。
该轻量 critic 可即插即用,为工程落地提供了低成本提高表格任务可信度的路径。
行业影响
落地场景
LLM 处理表格时出现的 数据引用错误(Data Referencing Errors, DREs)——例如错误引用、遗漏数值——直接影响金融报表分析、医疗记录问答、电商商品规格对比、科研数据提取等依赖结构化数据推理的场景。本文提出的 critic-based filtering 与 rejection sampling 方法,以及可部署的 4B 参数轻量 critic 模型,可嵌入任何需要表格问答、报告生成或数据核验的产品管线,如智能客服自动核对订单、BI 工具的自然语言查询、合同条款审查等。
商业价值
- 降本:用轻量 critic 模型过滤或重采样 LLM 输出,无需依赖人工复核即可减少事实错误,降低错误决策带来的返工与合规风险。
- 增收/体验提升:在金融、法律等高价值场景中,减少引用错误可提升用户信任,直接提高付费转化;在电商搜索推荐中,准确的规格对比能提升成交率。
- 关键指标:作者报告 critic-based filtering 提升答案准确率最高 12.0%,4B critic 模型在分布内/外 DRE 检测上平均 F1 达到 78.2%,证明小模型可辅助大模型推理。
与现有产品/工作流的接口
该方案可作为 后处理微服务 插入现有 LLM 应用架构:
- 表格理解管道:输入表格与用户问题 → 大模型生成思维链及答案 → critic 模型并行检测引用错误 → 根据置信度过滤或触发重采样。
- 集成方式:通过标准 API 调用,支持 HuggingFace Transformers 或 ONNX Runtime 部署,与 LangChain 等编排框架无缝对接。
- 训练管线:作者提供合成数据构建方法(SFT + RLVR),企业可利用自身领域表格数据微调 critic,快速适配垂直场景。
具体落地 Use Case
- 电商商品对比助手:用户询问“这款手机与竞品在摄像头、电池上有何差异?”时,LLM 需从多张规格表中提取数值。引入 critic 后,可显著降低错误引用像素值、容量等参数的概率,避免误导购买决策,提升客服机器人事实准确率。
- 金融研报自动生成:分析师上传公司财报表格,LLM 自动总结关键财务指标。用 critic 模型检测“营收 YOY 增速”“毛利率”等数值引用错误,确保报告专业性,减少发布前人工校验成本,实现合规自动化。
局限
- 评测的 LLM 参数规模集中在 1.7B 至 20B,未包含更大体量(如 70B+ 或 GPT‑4 级)的模型,结论能否泛化到更强的 LLM 尚未验证。此外,表格任务多取自现有标准 benchmark,对真实场景中常见的多页表格、合并单元格或半结构化报表等复杂情况未做系统测试,方法的鲁棒性存疑。
- 所训练的 4B 参数 critic 模型 F1 为 78.2%,仍存在误判,这意味着 critic‑based filtering 可能丢弃正确回答,或漏检引用错误。训练数据依赖 LLM‑as‑a‑Judge 生成,自身带有偏差,而人工评估规模有限,可能未全面覆盖数据引用错误的细粒度类型,影响评估体系的完备性。
- critic‑based filtering 和 rejection sampling 在推理阶段引入了额外计算(调用 critic 或多次采样),增加了延迟与成本。论文缺乏与简单方案的充分对比,例如精心设计的 prompt 或 few‑shot 示例是否也能减少引用错误,因此无法明确展示增加计算开销的必要性。