CARDEA:基于空间证据的可审计推理,用于端到端冠状动脉造影解读
有创冠状动脉造影(CAG)是诊断冠状动脉疾病的金标准,但不同观察者的解读差异显著。现有 AI 系统虽能提升一致性,却缺乏可审计的决策过程,且难以胜任全面的开放式评估,削弱了临床医生的信任与临床落地准备度。 我们开发了 CARDEA,一个统一的大型视觉语言模型,作为 CAG 流程的推理核心。它仅使用公开数据集和封闭式任务分三阶段训练: 1. 视觉特征对齐; 2. 自蒸馏的 Chain-of-Box (CoB) 冷启动; 3. 带可验证奖励的强化学习(RLVR),其中 CoB 奖励鼓励在推理轨迹中使用 bounding-box。 我们针对两项研究级诊断——dominance 分类与复杂度评估——将其与专用分类器及两位介入心脏病学家进行对比。报告生成未参与训练,使用 vessel-severity macro-F1 在外部队列上做跨阶段 zero-shot 评估。CARDEA 在分布内 dominance 上不及分类器,但在域偏移下追平水平(准确率 0.91,95% CI 0.86–0.95),在复杂度评估上与心脏病学家相当(准确率 0.90,CI 0.82–0.97)。仅 RLVR 改善了 zero-shot 报告生成,把 vessel-severity macro-F1(0.686,CI 0.664–0.707)提升至未调优基座模型(0.513)之上,并超过 always-normal 下限(0.312)两倍以上。 CARDEA 可运行从原始多视角视频、关键帧选择到研究级诊断的端到端 CAG 流程,同时公开其结论背后的可审计空间证据。在可验证的封闭式任务上做 RLVR,能激发出监督式模仿未能实现的开放式报告能力。临床应用仍需针对专家心脏病学家开展前瞻性验证。
论文精读
TL;DR CARDEA 用大视觉语言模型做冠脉造影解读,通过 Chain-of-Box 推理和可验证奖励强化学习,输出可审计的空间证据,并意外解锁了零样本报告生成能力。
问题
问题背景
侵入性冠状动脉造影(CAG)是冠心病诊断的金标准,但解读高度依赖医生经验,观察者间一致性差。AI 辅助可提升一致性,但临床部署要求决策过程可审计、可追溯,以建立信任。
现有方法局限
- 现有 CAG AI 系统多为专用分类器,仅输出单一标签,缺少 空间证据 或推理链,医生无法验证结论依据。
- 训练通常局限于封闭式任务(如狭窄分类),监督模仿难以泛化到开放式报告生成,导致 零样本报告能力 弱。
- 多数系统仅处理单视图静态帧,而非原始多视角视频流,割裂了真实介入工作流。
为什么难/重要
- 技术挑战:需同时对齐视觉特征与自然语言,生成包含 边界框 的可验证推理;CAG 视频时空信息复杂,端到端处理难度高。
- 业界关注度:监管机构强调医疗 AI 可解释性,可审计推理是临床部署前置条件;RLVR 通过可验证奖励驱动模型利用空间证据,是当前语言模型对齐的热点,但在医学影像中验证不足。
行业类比
类似 自动驾驶场景理解:不仅需要输出碰撞风险,还要在传感器证据上给出可解释路径,才能通过安全审计。
核心洞察
- 强化学习利用可验证奖励与 Chain-of-Box 机制,将闭集任务中的空间推理能力迁移到零样本报告生成,而监督模仿未能诱发该能力。与仅使用监督微调 LVLM 的方法不同,CARDEA 通过 RLVR 奖励模型在诊断过程中使用 bounding-box 定位病灶,使模型在未见过的报告生成任务上血管严重度宏 F1 从 0.513 提升至 0.686(超过 always-normal 基线 0.312 的两倍)。这表明可验证的中间推理信号可以作为隐式课程,让模型学会将空间证据与临床结论关联,无需昂贵的报告标注。对工程实践的启示是:在医疗多模态模型训练中,可优先设计可验证的闭集任务并配合结构奖励,以低成本获得开放生成能力。
- 端到端统一 LVLM 将多视图视频处理、关键帧选择、诊断和空间证据暴露整合到单一模型,且在领域偏移下与专用分类器性能相当,暗示统一架构具有更好的泛化鲁棒性。传统 CAG 分析通常采用多阶段管道(帧选择、血管分割、狭窄检测、分类器),各组件独立优化,错误会级联。CARDEA 用一个 LVLM 处理原始多视图视频到研究级诊断,并在分布偏移时从落后专用分类器变为准确率持平(0.91),同时输出可审计的 bounding-box 推理轨迹。这为工程上减少医疗影像管道复杂性与维护成本提供了证据:统一模型可能在数据分布变化时更稳定,并且可审计证据有助于临床验证和信任建立,但需通过前瞻性研究确证。
方法
输入与处理管线
CARDEA 接收原始多视角 CAG 视频作为输入,首先经过关键帧选择模块提取具有诊断价值的关键帧,随后送入统一的大视觉语言模型(LVLM)作为推理核心。
三阶段训练方法
模型训练仅使用公开数据集和封闭式任务,分为三个阶段:
- 视觉特征对齐:将视觉编码器的输出映射到语言模型的嵌入空间,使模型能理解 CAG 图像内容。
- 自蒸馏 Chain-of-Box (CoB) 冷启动:让模型自身生成包含边界框(bounding box)标注的推理链作为伪标签,再通过自蒸馏进行监督学习,从而冷启动模型输出带空间证据的推理过程。
- 强化学习与可验证奖励 (RLVR):在封闭式任务上采用 RLVR,奖励函数由三部分组成:
- 格式奖励:约束输出结构与预期一致;
- 任务准确性奖励:基于封闭式诊断结果的正确性;
- CoB 奖励:额外鼓励推理轨迹中使用边界框,强化证据的可审计性。
输出与能力涌现
经过上述训练,CARDEA 输出研究级诊断结果(优势分类、复杂性评估),同时在推理过程中暴露可审计的空间证据(边界框与推理链)。值得注意的是,报告生成任务未被纳入训练,但在 RLVR 阶段后,模型零样本报告生成的 vessel-severity macro-F1 从基线的 0.513 提升至 0.686,表明 RLVR 在可验证封闭式任务上涌现了开放式报告能力,而纯监督模仿未能实现这一点。
与同类方法差异:现有 CAG AI 系统缺乏可审计的决策过程且局限于封闭式评估,CARDEA 通过 RLVR 与 CoB 奖励将空间证据显式纳入推理路径,使诊断结论可追溯,并意外解锁了零样本报告生成能力。
实验
实验设计
CARDEA 在公开数据集上分三阶段训练:视觉特征对齐、自蒸馏 Chain-of-Box 冷启动、RLVR(含 CoB 奖励)。封闭任务评估与专用分类器及两位心内科医生对比;报告生成以 zero-shot 方式在外部 AngioCAD 队列上用 vessel-severity macro-F1 评估。
关键发现
- 领域漂移下 dominance 分类准确率 0.91,与专用分类器持平;复杂度评估准确率 0.90,与心内科医生相当。
- 仅 RLVR 阶段提升 zero-shot 报告生成,vessel-severity
macro-F1达 0.686,高于未调基座 0.513,且超过 always-normal 底线 0.312 的两倍。
与基线对比解读
作者论断:RLVR 在可验证封闭任务上涌现了开放式报告能力,监督模仿未实现该提升。
工程启示:通过 CoB 奖励 强制推理轨迹输出 bounding box,使 LVLM 在 end-to-end CAG 管线中提供可审计的空间证据,这是相对单任务分类器的重要差异;且该能力在 domain shift 下仍保持 competitive,说明 RLVR 有助于泛化。但 zero-shot 报告仍待前瞻性验证。
行业影响
落地场景
CARDEA 展示了从原始多视角视频到结构化诊断报告和空间证据的端到端流程,可迁移到多个行业场景:
- 医疗影像辅助诊断平台:嵌入 PACS 或影像工作站,自动生成冠状动脉造影初步解读,标注狭窄位置并输出可审计的 bounding box 证据。
- 工业视觉质检:在缺陷检测中利用 Chain-of-Box 推理输出缺陷区域和类型描述,提供可追溯的定位证据,降低误检争议。
- 自动驾驶感知:对多视角传感器数据进行场景理解,输出带边界框的决策解释,满足安全审计与法规要求。
商业价值
- 降本:减少医生重复性初步筛查工作,降低人力成本;在工业质检中提升检测吞吐量。
- 增收:审计友好的 AI 辅助报告有助于通过监管审批,打开医疗付费市场;零样本报告生成能力避免为每个新报告模板单独收集标注数据。
- 体验提升:医生获得可追溯的空间证据,信任度显著提升;RLVR 在封闭任务上训练泛化出开放生成能力,为其他视觉语言模型产品提供训练范式参考。
接口集成
- 作为微服务部署,接收 DICOM 视频或关键帧,输出 JSON 格式的结构化诊断与证据。
- 与现有 PACS / EMR 系统通过 HL7/FHIR 标准对接,或提供 REST API / gRPC 接口。
- 采用容器化(Docker/Kubernetes)方便集成进医院私有云或边缘设备。
- RLVR 奖励设计可复用,在封闭任务上训练以提升开放生成能力,为其他视觉语言模型产品的训练流程提供参考。
具体 use case:医疗影像云平台可集成 CARDEA 类模型提供自动报告与病灶标注;工业缺陷检测 SaaS 可利用 CoB 推理输出可审计的缺陷定位与描述。
局限
- **临床验证缺口**:论文明确提到临床使用需要前瞻性验证,目前仅基于回顾性数据和有限专家对比,尚未与大型多中心专家 panel 或临床结局关联。复杂度评估仅对比两名介入心脏病医生,样本量较小,统计效力有限,可能高估一致性。真实工作流中的变异源(不同导管室、操作者习惯、成像设备)未充分覆盖,泛化性存疑。此外,对罕见病变、多支血管病变或左主干等高危亚组未做亚组分析,临床安全性未评估。
- **训练任务与数据范围局限**:模型仅使用公开数据集和 closed-ended tasks 训练,报告生成完全零样本,未经过监督微调或奖励直接优化,因此其文本质量、术语准确性和结构化程度仍不可控,宏 F1 0.686 虽高于基线但与临床可用水平仍有差距。训练数据来源有限,可能存在人群、设备和采集协议偏差,导致域外泛化风险,尤其在复杂病例或非标准视角下表现未知。此外,数据预处理阶段依赖初步 LVLM 进行 study-level 数据准备,可能引入级联误差。
- **可解释性与奖励设计的固有局限**:Chain-of-Box 奖励鼓励在推理轨迹中使用边界框,但空间证据的粒度仅限于框级定位,无法验证框内病变类型、狭窄程度或功能意义,可能存在框对但诊断错误的“表面正确”情况。RLVR 仅针对可验证的 closed-ended 任务设置奖励,对开放式报告没有直接奖励信号,报告能力的涌现是间接的,缺乏可保障的因果机制。此外,自蒸馏冷启动可能放大教师模型的偏差,且未与专门的可解释性方法(如 Grad-CAM 或概念激活向量)对比,证据质量上限未知。