论文

重新思考大型视觉语言模型中的胸部X光推理视觉归因

重新思考大型视觉语言模型中的胸部X光推理视觉归因

大型视觉语言模型(LVLMs) 在医学应用中展现出潜力,但其无法将回答忠实基于视觉证据的问题引发临床信任担忧。现有视觉归因方法虽用于解释模型预测,但未经验证其是否反映模型实际使用的证据,因为缺乏模型内部推理的真值标注。 为解决此问题,我们针对胸部X光(CXR)推理开发了因果评估框架,通过反事实编辑筛选出专家标注区域与模型预测因果相关的样本。基于该框架,我们评估了11种归因方法、6个开源LVLMs及两种输出模式(直接回答与逐步推理),发现现有方法常无法识别LVLMs使用的证据。为此提出MedFocus,一种基于不平衡最优传输的概念归因方法:1) 定位临床意义的解剖区域;2) 通过目标干预测量其对模型输出的因果效应。MedFocus生成空间、概念及token级归因,显著优于先前方法,推动了医疗LVLMs可信归因的发展。 数据和代码已开源:https://github.com/gzxiong/medfocus/。

论文精读

TL;DR 现有视觉归因方法无法忠实反映 LVLM 的 CXR 推理依据,本文通过因果评估框架证实该缺陷,并提出了基于概念级解剖定位的 MedFocus 方法,大幅提升了归因可信度。

问题

LVLM 在医疗影像问答(CXR-VQA)中展现出潜力,但临床落地要求模型预测必须忠实于视觉证据,即模型给出的解释应该反映其内部推理真正依赖的图像区域。然而,现有视觉归因方法(如注意力图、梯度类、扰动类)仅提供像素级热力图,却无法验证这些高亮区域是否与模型决策存在因果关系——因为缺乏模型“真实参考”的标注。

现有方法的局限

  • 缺乏因果验证:现有归因方法大多基于相关性而非干预主义因果推断,无法证明高亮区域移除后模型预测会改变。
  • 无法处理多模态推理链:LVLM 在生成答案时可能经历多步逻辑,传统单步归因无法捕捉中间 token 与视觉区域的对应关系,尤其在引入思维链后,解释错位现象严重。
  • 医学概念粒度缺失:医生关心的是解剖结构或病灶区的关联,但现有方法只能输出细粒度像素热图,无法将归因提升到“左肺尖斑片影”这样的临床可读概念。

为什么这个问题既难又重要

技术挑战在于:a) 如何在没有像素级真值的情况下构造可信的评估基准;b) 如何将高层次医学本体(lung zone, mediastinum 等)与模型内部 token 激活建立可干预的因果连接。业界关注度源于监管与伦理压力——若解释不可信,医疗 AI 就难以通过审批或在真实场景被采纳。类似自动驾驶中传感器失效归因,错误解释可能导致灾难性误判。

类比:这就像要求自动驾驶系统解释其紧急制动原因,必须能指出“是因为前方 3 米处突然出现的行人”,而不是笼统地说“因为视觉特征向量值高”;医疗 LVLM 的解释同样需要概念级别的因果精准度

核心洞察

  • **因果评估框架** 通过反事实编辑构造可靠的真值,解决了视觉归因评估缺少模型内部推理标注的根本难题。不同于以往依赖像素扰动或注意力图作为伪真值,该工作只保留那些专家标注区域在编辑后确实翻转模型预测的样本,从而建立严格的因果性测试基准。这揭示了现有归因方法普遍未能捕捉 LVLM 实际使用的视觉证据,为后续方法改进提供了明确方向。
  • **MedFocus** 提出概念级因果归因,借助不平衡最优传输将 CXR 图像分割为解剖学概念区域,并用定向干预量化每个概念对模型输出的因果效应。区别于传统热力图或 token 级归因,它输出空间、概念和 token 三级解释,且概念直接对应临床解剖结构。这种方法通过显式验证因果关联,大幅提升归因的临床可信度,同时避免对抗性掩码导致的虚假归因,在基准测试中显著超越 11 种现有方法。

方法

MedFocus 方法详解:输入为胸部 X 光图像和文本问题,结合冻结的 LVLM 进行归因分析。方法流程分为两个关键模块:

模块一:基于概念的解剖分割

  • 使用冻结的视觉编码器提取图像 patch 特征。
  • 预定义一个解剖概念词汇(如心脏、肺叶、主动脉等),通过不平衡最优传输(UOT) 在 patch 特征与概念嵌入之间建立软匹配。UOT 能够处理概念分布不均衡和区域重叠,避免强制硬分配。
  • 输出每个概念的软分割概率图,实现空间上的概念定位。

模块二:因果归因

  • 对每个概念执行目标干预:生成删除该概念区域的反事实图像(如掩蔽或替换语义),并送入 LVLM 重新生成答案。
  • 对比原始预测与反事实预测的变化,计算因果效应,量化每个概念对模型输出的贡献。
  • 因果效应高的概念被视为模型实际依赖的视觉证据。

最终输出三个层级的归因结果:

  • 空间归因:将概念因果效应投影到像素空间的热图。
  • 概念级归因:各解剖概念的重要性排序。
  • Token 级归因:关联到输出文本 token 的视觉证据强度。

与现有方法的核心差异:MedFocus 不再依赖注意力权重、梯度或黑盒扰动等启发式指标,而是通过显式的解剖概念分割与因果干预,直接测量模型输出对视觉概念变化的敏感度,显著提升了归因的忠实性和临床可解释性。

实验

实验设计

研究基于因果验证框架构建了 MedGround-Bench 评估基准:从 CXR-VQA 数据中筛选出经反事实编辑验证、专家标注区域对模型预测具有因果作用的样本。在 6 个开源 LVLM(含直接回答与逐步推理两种输出模式)上,系统评估了 11 种视觉归因方法,覆盖基于注意力、梯度、提示和扰动的典型方案。评价指标聚焦于归因结果与真实因果证据区域的一致性。

关键发现

现有归因方法普遍无法忠实反映模型实际依赖的视觉证据:它们的输出与专家确认的因果区域重叠度低,且在不同模型和推理模式下表现不稳定。为此提出的 MedFocus 方法通过概念级因果归因显著改进了这一缺陷。它先利用不平衡最优传输(unbalanced optimal transport) 将图像分割为临床可解释的解剖概念区域,再通过针对性干预量化每个概念对模型输出的因果效应,最终生成空间、概念和 token 三级归因。实验表明 MedFocus 在定位准确性和因果保真度上均大幅优于之前方法。

与基线的对比解读

相比基于注意力或梯度的传统解释,MedFocus 的核心差异在于因果验证驱动——它不依赖模型内部激活的启发式聚合,而是通过反事实操作直接测量概念的影响。这使得归因结果摆脱了“看似合理但未必忠实”的困境,更符合医学背景下对解剖学定位和可信解释的需求。该工作揭示了仅凭模型后验解释难以保证临床可信度,因果框架对于医疗 LVLM 的可信赖性具有根本意义。

行业影响

落地场景

MedFocus 及其因果评估框架直接瞄准临床放射学工作流中的 可解释性缺口。在胸部 X 光 (CXR) 智能诊断产品中,无论是自动报告生成、辅助阅片还是医疗 VQA,系统均需给出决策所依据的视觉区域,否则医生难以采信。该工作可嵌入 AI 辅助诊断系统 的解释模块,用于自动定位病灶相关解剖结构(心影、肺野、膈肌等),并量化各区域对模型输出的因果影响,从而生成概念级可视化解释。另一场景是医学影像教学平台:通过对比不同 LVLM 的归因结果,向医学生展示模型“关注”与专家标注的异同,训练临床推理能力。

商业价值

  • 降本:减少因模型错误解释导致的误诊风险,降低潜在法律纠纷与高额赔偿;同时,自动化归因省去专家二次标注成本。
  • 增收:增强 AI 诊断产品的市场竞争力,尤其是面对医院采购时,可验证的解释性成为关键差异化卖点;支持 SaaS 订阅模式按调用量收费。
  • 体验提升:放射科医生可快速定位模型输出依据,减少核查时间,提升周转效率;在远程医疗中,清晰的视觉解释有助于跨团队沟通。

与现有产品/工作流的接口

MedFocus 作为 模型无关的后验解释器,可通过轻量级 API 集成到现有 MLOps 管线。输入为原始图像、模型输出文本及内部 token 概率,输出为空间热力图、概念贡献度和 token 级归因,兼容 HL7 FHIR 标准下的影像报告交换。在部署时,可旁路部署于 PACS 服务器或推理网关,不改变原有模型架构,仅需提供 ONNXPyTorch 推理钩子。对于已有医疗 AI 平台(如 MONAI、NVIDIA Clara),可将该方法作为通用插件,与现有分割、检测模型联动,进一步提升整体可解释性。

具体落地 use case

  1. 全球远程放射学服务商:在跨国远程诊断平台中,对上传的 CXR 图像自动生成报告摘要时,MedFocus 可高亮支持诊断结论的肺结节或胸腔积液区域,并给出“该区域导致阳性判断的概率为 82%”等因果陈述,使异国放射科医生无需打开全部序列即可快速验证,缩短响应时间。
  2. 医疗大模型评测与监管机构:使用 MedFocus 的因果评估框架 MedGround-Bench 作为 LVLM 审批的标准测试项,确保模型在临床环境下不会因虚假相关性(如引流管、外部标记)而产生错误解读,从而通过监管准入。

局限

  • **对专家注释的依赖与概念覆盖的局限性**:MedFocus 的因果评估框架以专家标注的病变区域作为因果证据的 ground truth,但实际诊断中可能存在多个未被标注的协同因果区域,导致评估基准本身存在选择偏差。此外,概念分割依赖预定义的解剖概念词汇表,虽然覆盖了常见临床概念,但无法表示表外的新发细节或罕见表现,这限制了归因方法对模型内部视觉证据的全面捕获。
  • **反事实编辑的真实性与跨场景泛化**:框架通过图像编辑生成反事实样本来检验因果性,编辑过程可能引入纹理不连续、解剖失真等伪影,这些伪影可能干扰 LVLM 的决策,导致对因果效应的估计出现偏差。同时,方法仅在胸部 X 射线和六款开源 LVLM 上验证,尚未覆盖其他影像模态(如 CT、MRI)或商用闭源模型,其泛化能力有待进一步证实。
  • **计算效率与工程落地挑战**:MedFocus 的因果归因需要针对每个概念区域进行掩码干预并对比模型输出,概念数量增多时计算量线性增长,且包含不平衡最优传输的多次迭代,整体推理延迟较高,不利于实时交互场景。超参数(如参考图像选择、Sinkhorn 正则化系数、干预掩码尺度)对归因质量影响较大,实际部署时需要针对不同模型和数据集进行单独调优,增加了工程集成的复杂度。
论文Guangzhi Xiong2026-05-19原文

相关内容