相同问题,不同来源,不同答案:审计医疗多源RAG中的源依赖性
检索增强生成(RAG)系统在多作者机构语料库中,对同一问题可能因检索来源不同而给出不同答案。这种源依赖性,是传统单一标准答案评估范式无法诊断的失败模式。我们认为,NLP评估应增加源依赖性这一维度,将评估单位从答案正确性转向源间关系。 我们以移植患者教育为具体场景,发布三个工件: 1. TransplantQA:基于真实患者问题的基准,每个问题通过多个机构手册作为候选来源生成答案; 2. HERO-QA:分层检索策略,用于定位和审计每个答案; 3. 结构化输出判别器:基于验证的五标签分类法对源间关系评分。 实验表明,更好的检索揭示的分歧远多于先前估计——低估了其普遍性而非强度。该框架是领域无关的,可迁移至法律和教育RAG:测量源依赖性应是部署多源NLP系统的一般责任。
论文精读
TL;DR 多源 RAG 中,同一问题因检索到不同机构文档而产生矛盾答案,本文提出**源依赖性审计**,将评价从答案正确性转向来源间关系,并发布基准和裁判工具。
问题
多源检索增强生成(RAG)系统在医疗、法律等高风险场景快速落地,但其答案一致性与可问责性成为关键质量指标。现行评估范式以单一标准答案(single gold answer)为基准,无法诊断同一问题因检索到不同机构文档而产生的答案分歧——即源依赖(source-dependence)失败模式。
现有方法的盲区
- 评估维度缺失:传统 QA 指标(EM / F1 / 事实一致性)假设存在唯一正确答案,忽视了多源语料中普遍存在的 跨文档观点差异。
- 检索质量与分歧的割裂:现有基准通常固定检索源,未暴露 检索策略 与 答案分歧程度 之间的动态关系,导致低估了问题的影响范围。
- 判断粒度粗糙:LLM-as-judge 仅输出二元 / 序数分数,无法揭示分歧的临床显著性(如安全建议相悖 vs. 表述偏好不同),限制了审计和干预的有效性。
技术挑战与业界关注度
源依赖审计要求从“答案是否正确”转向 “来源间关系如何”,带来三重挑战:
- 构造多源锚定场景:需为同一问题生成多个 来源锚定 的答案,并保证检索可控——论文为此设计了 HERO-QA 分层检索架构。
- 结构化关系分类:需区分“完全一致”“互补”“无关”“矛盾”等细粒度标签,且需附带证据依据,论文通过结构化输出评判器(5-label taxonomy)实现,人工验证 F1 达 0.82。
- 规模化审计:在真实大型语料(如移植患者教育手册)上发现,更强的检索(32B 模型)比弱检索(14B)暴露的 分歧占比增加 14%,说明系统能力越强,越需主动监控源依赖——这对所有依赖多源 RAG 的行业(医疗、法律、教育)形成硬性合规压力。
类比来说,这就像搜索引擎的“答案多样性”管理:当多个来源对同一查询给出不同解释时,引擎必须披露信号冲突而非隐藏它——审计源依赖正是 RAG 系统从“生成答案”升级到“生成可靠答案”的必经之路。
核心洞察
- 源依赖性(source-dependence)是多源 RAG 系统被长期忽视的评估维度:现有 NLP 评估以单一参考答案为中心,默认不同来源可以聚合为一致答案,而该工作指出同一问题因检索到的源不同而产生不同答案是一种系统性故障,审计应转向源间关系而非答案正确性。这直接挑战了当前 RAG 评估中“融合多文档生成单一答案”的范式,把跨文档一致性问题从隐式假设变为显式监控对象。
- 更好的检索会放大而非消弭分歧:论文的大规模实验表明,当检索质量提升时,源间不一致的曝光率显著增加,此前小规模人工估计严重低估了分歧的普遍性。这意味着简单优化检索命中率可能掩盖系统在实际部署中给出矛盾信息的风险,要求任何面向机构知识库的 RAG 系统必须内置源依赖性审计,否则“更准的检索”可能转化为“更危险的不一致”。
- 结构化输出法官(5-label taxonomy)将源间比较从粗粒度正确/错误深化为可操作的关系分类:该工作不仅判断答案分歧,还区分信息补充、细化、矛盾等关系,并提供解释和临床意义标注,形成结构化审计矩阵。这为审计自动化提供了可扩展的工具,超越了 LLM-as-judge 的单一打分,使评估能直接驱动产品侧的源冲突告警与人工介入决策。
方法
整体范式
本文提出一种面向多源 RAG 系统的审计框架,将评估单元从传统的「答案正确性」转向「源间关系」,用于量化同一问题在不同来源下产生答案的分歧程度。整个流程输入为多机构患者教育手册语料与真实患者问题,输出为源依赖性审计矩阵及分析。
Stage 1: 结构化提取
对手册语料进行解析,提取结构化信息(如章节、关键知识点),形成可供后续检索的标准化知识库,确保源材料的可锚定性。
Stage 2: HERO-QA 层级检索与生成
- 检索策略:采用分层检索(HERO-QA),先定位相关源(如某机构手册的特定章节),再在该源范围内提取支持证据,保障答案的源归属透明性。
- 答案生成:将检索到的上下文注入 LLM,生成依源答案;对同一问题分别使用不同手册作为候选源,得到多个版本的回答。
Stage 3: 结构化成对判断
设计了一个结构化输出 judge,对任意两个源生成的答案进行关系评估:
- 缺失预筛选:判断答案是否为「因源中无信息而无法回答」,避免无效比较。
- 五标签分类体系:覆盖「一致」「矛盾」「互补」「细化」「无关」等源间关系,已通过人工标注验证。
- 结构化输出:除关系标签外,还输出解释文本、证据跨度等字段,构建出完整的 对比矩阵(每对源一个关系评分)。
工程启示
该流水线将源头分歧从隐性故障变为显性审计对象。与依赖单一标准答案的常规 RAG 评测不同,本方法不假设存在唯一正确回答,而是通过结构化比对暴露多源间的系统差异,使部署方能够掌握源依赖性的全局分布并警示高风险问题,适用于法律、教育等任何多源 NLP 系统。
关键差异
区别于传统 NLP 评估聚焦答案级正确性,本工作首次将审计重点转移到源间关系,利用结构化 judge 和层级检索实现可解释的源依赖性量化,而非简单检测不一致。
实验
实验设计
研究者构建 TransplantQA 基准:收集真实患者问题,每个问题在不同移植机构手册上通过 HERO-QA 分层检索生成多个答案,形成多源 RAG 的输出对。随后用结构化输出评委对每对答案的关系进行五标签分类(一致、补充、部分冲突、严重冲突、无关),评委输出包含结构化原因字段。人类评估验证了评委与专家判断的高度一致,并作为消融实验对比仅输出标签的版本。最终在 14B 与 32B 参数规模的系统上运行全量基准,分析标签分布及跨器官异质性。
关键发现
相同问题在不同源上检索生成,答案出现实质性分歧,且更优的检索(32B 系统)反而揭示出更普遍的分歧——并非分歧强度增加,而是先前估计低估了其 prevalence。结构化评委不但判别标签,还提供冲突类型(如数值差异、禁忌冲突),这对下游安全审计至关重要。答案正确性评估在该场景下失效:没有单一标准答案能定义“对”或“错”,评估单元必须转向 源间关系 本身。
与基线对比
传统 NLP 评估以单一黄金答案为基准,无法反映多源 RAG 的一致性风险。本工作直接挑战此范式,提出 source-dependence 作为评估新维度。与仅输出标签的 judge 相比,结构化输出在临床可操作性上大幅提高——它能定位冲突的字段(如药物剂量、适应症),使得不同机构的回答差异不再是“错误”,而是可追溯、可解释的系统行为。该框架不依赖医学领域特化,可迁移至法律、教育等多源 RAG 场景,为部署系统提供了一致性审计方法。
行业影响
落地场景
论文提出的源依赖性审计框架可直接嵌入 多源文档 RAG 产品,典型场景包括:
- 企业知识库助手:聚合内部 Wiki、工单记录、产品手册的多版本信息,同一问题(如“数据分析流程”)可能因部门或版本差异给出不同步骤,审计源间关系可避免误导员工。
- 医疗多中心指南问答:移植患者教育已示范,类似问题在肿瘤、心脏病等多学科指南中普遍存在,系统必须展示分歧而非强拟合单一答案。
- 法律科技产品:法规查询、合同分析工具需应对不同司法辖区或判例的冲突,源依赖性标签让律师快速评估信息可靠性。
- 教育内容平台:多版本教材比对、历史观点梳理等场景,标注“完全一致”“部分冲突”等关系提升学习透明度。
商业价值
- 风险控制与合规降本:在医疗、法律等强监管领域,源依赖性审计直接降低错误引用导致的责任事故,减少诉讼和赔偿支出,体现 安全价值。
- 用户体验与决策效率提升:用户面对冲突信息时,结构化标签和对比矩阵能快速定位差异,缩短决策时间,增强对系统可信度的感知,支撑 产品溢价 或付费订阅。
- 系统迭代优化:通过大规模审计发现检索策略的盲区(例如更优检索反而暴露更多隐藏分歧),指导 检索器优化与数据源治理,降低长期维护成本。
与现有产品/工作流的集成
- 作为评估管道插件:在现有 RAG 回答生成后,调用结构化输出 judge(如论文中的 5 标签分类器),输出 JSON 格式的源间关系标签、解释和置信度,无缝接入 LangChain、LlamaIndex 等框架的后处理步骤。
- 结合检索器元数据:利用向量数据库的 metadata 字段记录检索到的来源,在用户界面通过折叠面板或标签提示“该回答基于 N 个来源,存在 3 处关键分歧”,并允许穿透查看对比矩阵。
- 与 LLM-as-Judge 范式融合:已有工程使用 GPT-4 做答案质量评估,可复用其推理能力,按论文提供的 prompt 模板生成结构化判断,避免额外微调成本。
具体落地 use case
电商平台卖家政策助手
平台不同品类或地区的退货政策常相互矛盾。用户提问“某类商品退货期限”,RAG 检索到 3 个内部文档:30 天普通规则、15 天数码产品特例、7 天生鲜条款。审计框架输出 “部分一致 : 关键细节冲突”,并在 UI 中并排显示:“[来源 A] 30 天(一般商品);[来源 B] 15 天(数码产品)”,避免客服误用错误条款,降低纠纷率。自动驾驶安全文档查询引擎
汽车企业需遵守 ISO 26262、内部功能安全规范、供应商指南等多源标准。工程师查询“传感器冗余要求”,系统检索到 ISO 建议双重冗余,内部规范要求三重冗余,供应商文档仅提基本冗余。结构化 judge 输出 “存在矛盾”,并生成对比矩阵,帮助合规团队识别标准缺口,推动规范统一,节省跨部门对齐时间。
局限
- **结构化判断器依赖人工标注的分类法**,5 标签类别(如矛盾、互补等)虽经过验证,但在其他领域或更复杂的不一致类型下可能不充分,需要领域专家重新校准。此外,判断器本身是一个 LLM-as-a-judge 实现,其评估可靠性受底层模型能力限制,可能继承偏见或无法捕捉细粒度临床意义,论文中的人机一致率并未达到完美,且未分析跨领域迁移时的性能衰减。
- **基准领域单一**,TransplantQA 仅聚焦于移植患者教育手册,尽管框架声称领域无关,但缺乏在法律、教育等其他多源场景下的实证验证。不同领域的手册在撰写风格、冲突性质、安全敏感度上差异极大,直接迁移 HERO-QA 和判断器可能面临显著的分布偏移,需要额外的适配工作和重新标注成本。
- **HERO-QA 的分层检索策略可能引入新的偏差**,其性能高度依赖于底层检索器的质量与手册的预处理(结构化提取)。如果提取的段落粒度过粗或过细,可能导致检索到的上下文不足以反映源间完整立场,从而低估或高估分歧程度。论文未系统消融检索配置对最终 source-dependence 审计结果的影响,这使得实践者难以调参以保证审计保真度。