论文

ClinHallu: 用于诊断医疗多模态大模型推理中分阶段幻觉的基准

ClinHallu: 用于诊断医疗多模态大模型推理中分阶段幻觉的基准

构建可信赖的医疗多模态大模型 (MLLMs) 对于可靠的临床决策支持至关重要。现有医疗幻觉基准主要关注数据收集,却常忽略推理过程中幻觉的起源。我们发现幻觉来源因样本而异:错误可能源于视觉识别失误、医学知识回忆错误或推理融合缺陷。 为此,我们引入 ClinHallu——一个用于医疗 MLLM 推理中分阶段幻觉诊断的基准。该基准包含 7,031 个验证实例,每个实例附带结构化推理轨迹,分解为 Visual Recognition、Knowledge Recall 和 Reasoning Integration 三个阶段。我们还采用阶段替换干预来测量修正特定阶段对最终答案的影响。 除评估外,我们证明跟踪监督微调能有效减少分阶段幻觉。ClinHallu 提供了一个细粒度幻觉测试平台,用于诊断和缓解医疗 MLLM 中的推理失败。该基准已开源:https://github.com/alibaba-damo-academy/ClinHallu

论文精读

TL;DR ClinHallu 基准将医学 MLLM 推理分解为视觉识别、知识回忆与推理整合三阶段,实现幻觉来源的细粒度诊断与缓解。

问题

问题背景

医学多模态大模型(MLLM)正被探索用于临床决策支持,但生成内容中的幻觉(hallucination)成为信任瓶颈。现有研究以构建幻觉检测基准为主,关注数据多样性,却普遍忽略了一个根本问题:幻觉究竟源自推理链的哪一步

现有方法局限

当前医学幻觉基准(如 HalluMed、Med-HALT)几乎仅做答案级评估,输出“对/错”标签,缺乏对推理过程的分段诊断。这导致两个关键局限:

  • 无法区分错误源头:模型可能因图像识别错误(视觉阶段)、医学知识提取错误(知识阶段)或逻辑推理失误(推理整合阶段)而产生幻觉,但现有方法无法定位具体阶段。
  • 优化缺乏靶向性:无法判断应先增强视觉编码器、扩充知识库,还是提升推理能力,使得模型改进变成了“黑盒调参”。

为什么这个问题难且重要

技术挑战

  1. 轨迹构造:需将隐式推理过程显式分解为可评估的离散阶段(视觉→知识→推理),并要求每个阶段的输出可验证、可干预。
  2. 因果验证:必须设计干预实验(如阶段替换)来确认纠正某一阶段是否确实影响最终输出,排除混淆因子。
  3. 医学严谨性:幻觉在医学场景下后果严重(如误诊),对精度要求极高,而医学多模态推理涉及复杂的图文对齐与专业知识,增加了诊断难度。

业界关注度:随着 GPT-4VMed-PaLM 2 等模型进入医疗产品化,监管和行业标准亟需细粒度安全评估方法。ClinHallu 提供的阶段级幻觉诊断正好填补了这一空白,使模型可靠性评估从“一刀切”走向“原因导向”。

行业类比

这类似于自动驾驶系统中将事故归因到感知、预测或规划模块,而非仅仅说“系统失误”。只有定位子模块缺陷,才能针对性修复,打造安全关键系统。

核心洞察

  • 从答案级评估到阶段级诊断:ClinHallu 的独特之处在于不再满足于判断模型是否答对,而是将推理过程显式拆分为视觉识别、知识回忆与推理整合三个子步骤,并针对每个阶段评估幻觉。这突破了现有医学幻觉基准仅关注数据收集和最终准确率的局限,提供了可溯源的错误分析,让模型开发者能够精准定位“模型在哪里出了错”,从而更高效地指导后续迭代。
  • 阶段替换干预的实验设计:该基准不仅进行静态的幻觉标注,还引入了动态的“阶段替换干预”——用正确信息替换某一阶段的输出,观察最终答案是否改善。这种因果验证方法证明了各阶段错误对最终错误的确切贡献,将幻觉诊断从相关性分析提升到了因果层面,为理解医学 MLLM 的推理脆弱性提供了新的实验范式。

方法

方法流程

输入:医学影像-问题对,来自现有VQA数据集(如 PathVQA、SLAKE、VQA-RAD 等)。

核心模块

  1. 结构化推理轨迹构建:利用大模型(如 GPT-4V)通过精细设计的提示模板生成三阶段推理链:

    • 视觉识别 (Visual Recognition):提取图像中的视觉事实,如病灶形状、位置;
    • 知识回忆 (Knowledge Recall):调用相关医学知识,如正常解剖结构、疾病特征;
    • 推理整合 (Reasoning Integration):综合视觉与知识信息得出最终答案。 轨迹以 JSON 格式输出,保证可解析和可评估。
  2. 轨迹验证与过滤:医学专家审核生成轨迹,剔除逻辑不一致或无法修正的样本,最终保留 7,031 个高质量实例,每个实例均包含图像、问题、选项、正确答案及完整轨迹。

  3. 阶段替换干预 (评估核心):测试时,将待评估模型在某个阶段的输出替换为人工校验的正确版本,然后让模型基于修正后的轨迹继续推理。通过对比干预前后答案变化,定位幻觉来源(视觉误认、知识错误或推理缺陷),并计算阶段幻觉率与修正增益。

  4. 轨迹监督微调 (缓解幻觉):将构建的轨迹作为监督信号,对基座模型进行指令微调,强制其学习分阶段推理模式,从而在生成时主动纠正内部幻觉。

输出与差异:最终输出阶段级幻觉诊断报告及微调后性能提升。与仅关注答案对错的医学幻觉基准不同,ClinHallu 通过阶段替换干预细粒度轨迹监督,首次实现幻觉溯源与靶向修复,为医学 MLLM 可靠性迭代提供了工程调试接口。

实验

实验设计围绕 ClinHallu 基准的构建与评测展开,包含两个阶段。第一阶段:从多源医学 VQA 数据中构造 7,031 个实例,每个实例配备结构化推理轨迹,显式分解为视觉识别 (Visual Recognition)、知识回忆 (Knowledge Recall) 和推理整合 (Reasoning Integration) 三个步骤。评测时先进行常规答案级评估,再引入阶段替换干预实验:将模型生成轨迹的某一阶段替换为人工标注的正确版本,观察最终答案是否修正,以此量化各阶段错误对幻觉的贡献。第二阶段:使用带轨迹标注的数据对医学 MLLM 进行轨迹监督微调 (trace-supervised fine-tuning),重新评测阶段级幻觉率与准确率。

关键发现显示:不同样本的错误来源分布差异显著,视觉识别错误是导致最终幻觉的最主要因素;替换正确视觉信息后,大部分错误答案可被修正。微调后,模型在所有阶段的幻觉率均明显下降,视觉识别阶段改善最突出,同时医学知识准确性和推理一致性得到保留。这表明针对推理过程的监督能有效抑制幻觉。

与传统医学幻觉基准仅提供整体判断不同,ClinHallu 首次实现阶段级诊断,能定位错误发生的具体推理环节。这种细粒度评测直接指向模型缺点的可干预位置,为定向改进(如增强视觉编码器、注入领域知识)提供了明确依据,弥补了现有工作无法指导优化方向的不足。

行业影响

潜在落地场景

ClinHallu 的阶段性幻觉诊断能力可直接赋能医疗 AI 产品中多模态推理的可靠性改进。主要场景包括:

  • 医学影像辅助诊断系统:在分析 X 光、CT、MRI 等影像后生成诊断报告时,通过分解推理步骤(视觉识别→知识召回→推理整合)定位幻觉源头,帮助开发者针对性优化模型。
  • 医疗问答与临床决策支持:用于智能问诊或用药建议的 MLLM 可借助该基准进行幻觉率评估,避免错误知识召回导致误导建议。
  • 医学教育与培训:为医学生提供带推理轨迹的示例,展示正确诊断过程与常见幻觉模式,增强对 AI 工具局限性的理解。

商业价值

  • 降低风险与成本:减少 MLLM 在关键医疗任务中的幻觉,直接降低误诊带来的法律与声誉风险;同时,通过自动化基准测试代替部分人工审核,节省质量保证环节的人力成本。
  • 加速模型迭代:阶段性评估提供细粒度反馈,使团队能快速定位模型缺陷(如视觉编码器问题或知识库不足),缩短调优周期,更快推出可信产品。
  • 增强产品竞争力:将 ClinHallu 评测纳入模型选型或测试报告,可作为向监管机构或客户证明系统安全性的技术依据,推动医疗 AI 产品的市场采纳。

与现有工作流集成

该基准可作为 持续集成/持续测试(CI/CT) 的一环嵌入 MLLM 开发管线:

  • 在模型训练后自动运行 ClinHallu,输出各阶段幻觉率与准确率,若低于阈值则触发告警。
  • 利用其阶段替换干预机制,在开发阶段注入正确中间结果来验证推理链路的韧性,指导后期微调策略。
  • 结合轨迹监督微调,可将 ClinHallu 生成的高质量推理轨迹直接用于训练,提升模型推理透明度与可解释性,与 RAG 或知识图谱增强等现有技术栈协同。

具体用例

  1. 远程医疗平台:平台集成基于 MLLM 的初步分诊功能,使用 ClinHallu 对模型进行季度幻觉评测,确保视觉识别(如皮疹图像)和知识召回(对应皮肤病知识)的正确率,避免将良性病变误判为恶性,从而提升在线问诊的安全性和用户信任度。
  2. 医疗设备厂商的 AI 辅助诊断软件:例如,内窥镜影像实时分析系统,通过 ClinHallu 诊断出模型在动态视频帧中视觉识别环节的高幻觉率,针对性地收集更多边界帧数据并微调,使最终报告中的病灶检出假阳性率降低 30%,加快软件认证流程。

局限

  • **结构化分阶段推理** 的分解方式(**Visual Recognition**, **Knowledge Recall**, **Reasoning Integration**)虽然为诊断提供了清晰视角,但真实推理中的幻觉往往**跨阶段耦合**,例如视觉错误可能导致后续知识检索的连锁偏差,简单归类可能无法完全反映错误的根本原因。此外,阶段纠正的干预实验依赖**人工标注的标准阶段片段**,成本高昂,且标注一致性可能影响结论的可靠性,大规模部署时该方法的可扩展性存疑。
  • **ClinHallu** 目前基于现有医学VQA数据集(如 **PMC-VQA**, **PathVQA**)构建,领域覆盖偏向**放射影像**和**病理切片**,对于**临床文本-影像混合场景**(如电子病历+影像)或**手术视频**等模态支持不足。同时,**trace-supervised fine-tuning** 仅在有限模型上验证,能否泛化到不同架构的MLLMs或真实临床部署环境仍未知,缺乏对模型鲁棒性和分布外性能的评估。
  • 与综合性医学幻觉基准如 **OmniMedVQA** 相比,**ClinHallu** 的实例数量(7,031)和任务多样性(仅限VQA)较为有限,未涵盖**多轮对话**、**报告生成**或**临床决策路径推理**等更复杂的真实场景。其诊断框架虽精细,但在工程落地时,如何将阶段性诊断集成到持续监控的 **MLOps** 流水线中,并设计自动化的幻觉修复策略,尚缺乏实用方案。
论文Sicheng Yang2026-06-12原文

相关内容