基于Token的双视图融合与大视觉模型自适应用于乳腺癌分类
乳腺癌的准确分类需要有效整合乳腺X线摄影中头尾位(CC)和内外斜位(MLO)的互补信息,以更完整地描述乳腺异常。然而,现有多视图学习方法通常依赖特征级聚合或单阶段交叉注意力,这容易混淆视图特定和共享表示,并限制交互仅在有限网络深度进行。 为解决这些限制,我们提出了一种以令牌为中心的双视图学习框架,在冻结的视觉Transformer主干中统一了基于提示的自适应和跨视图融合。该框架将视图间交互重构为结构化的令牌级通信,其中专用融合令牌通过交叉注意力显式编码CC与MLO视图间的双向信息交换,作为跨视图依赖的中间载体,而非直接进行特征融合。与传统方法仅在单层应用融合不同,融合模块被插入多个Transformer深度,从而在编码器层级中实现渐进和重复的交互。融合令牌被重新整合到令牌序列中,并由后续Transformer层优化,促进互补信息的分层传播,同时保留视图特定结构。 在VinDr-Mammo和CMMD数据集上的实验表明,该方法在线性探测、仅提示自适应和传统融合基线相比具有一致改进。在VinDr-Mammo BI-RADS分类任务中,框架实现了50.40% F1分数和0.8090 AUC,其中在二分类设置下比双视图融合基线提高了0.10 AUC。消融研究进一步验证了基于令牌的融合和多深度交互设计的有效性。
论文精读
TL;DR 在冻结的 ViT 中引入可学习融合 token 与多深度跨视图注意力,将 CC 与 MLO 视图的双向信息交换建模为 token 级通信,避免特征纠缠,显著提升乳腺癌分类。
问题
问题背景
乳腺癌是全球女性癌症死亡的主因之一,通过乳腺 X 线摄影(mammography)进行早期筛查能显著提升生存率。在人工智能辅助诊断中,利用双视角图像——头尾位(CC)与内外斜位(MLO)——进行精准分类是当前研究热点,因为不同视角能提供互补的组织和病灶信息,帮助模型更完整地刻画病变特征。
现有方法局限
当前多视图学习方法主要存在两个瓶颈:
- 特征融合深度不足:大多采用特征级拼接(如池化后的全局特征 concat)或仅在某一层做交叉注意力(single-stage cross-attention),视图间的交互仅限于网络的浅层或单一深度,无法在不同语义层次反复融合互补信息。
- 视图信息纠缠:直接融合或单层交叉注意力容易将各视图的私有特征(view-specific)与共享特征(shared)混叠在一起,导致模型难以解耦出对下游分类最关键的跨视图依赖,同时也破坏了每个视图特有的结构表达。
为什么这个问题难 / 重要
- 技术挑战:双视角图像在几何对齐(非刚性形变)和语义对应(同一病灶在不同视角下表现迥异)上存在天然鸿沟。在不打破基础模型参数(冻结 backbone)的前提下,设计一种既能支持多层次交互、又能保持视图独立性的轻量融合机制,是参数高效迁移学习中的难题。
- 业界关注度:随着 Vision Transformer 成为医学影像分析的基础架构,如何在不重新训练整个模型的情况下(节省计算资源),通过 prompt tuning 与 token 级融合实现多视角协同推理,已成为 AI 工程化落地时的关键需求。它直接关系到模型能在医院不同设备、不同协议下快速适配,并保持高泛化能力。
行业类比
该问题的解决思路类似于多模态大模型中的跨模态对齐:就像 Flamingo 在冻结的语言和视觉编码器之间插入可学习的 Cross-Attention 模块来处理图文信息,本工作在冻结的 ViT 中引入可学习的融合 token 与交叉注意力,实现双视角的灵活、深层交互。
核心洞察
- 通过将跨视图交互重新定义为**融合令牌 (fusion tokens)** 在 token 层级上的结构化通信, 该框架显式分离了视图特定信息和跨视图互补信息。与传统方法直接融合特征或使用单层交叉注意力不同, 这种设计让融合令牌作为中间载体, 通过交叉注意力双向编码 CC 和 MLO 视图间的依赖关系, 避免了视图表示纠缠, 使模型在保持各自视图结构的同时有效传递互补特征。
- 在预训练视觉 Transformer 的**多个层级插入融合模块**, 实现了跨视图信息的**渐进式和重复式交互**。与只在单一深度进行融合的常见做法不同, 该设计让融合令牌在每层融合后被重新注入 token 序列, 并由后续 Transformer 层进一步提炼, 从而在编码器层级结构中建立层次化的互补信息传播机制, 显著提升了对乳腺异常的整体表征能力, 在 VinDr-Mammo 数据集上 AUC 提高了 0.10。
方法
输入与Token化
对于每个病例,同时输入CC和MLO两个视图的乳腺X光图像,经分块线性投影后得到两组patch tokens,并分别添加可学习的提示 token(prompt tokens)与分类 token。
关键模块
- 冻结的ViT骨干:采用预训练Vision Transformer(如ViT-B/16),所有参数冻结,仅通过插入的提示 token 进行任务适配(提示微调)。
- 融合 token 与交叉注意力:引入一组小容量的专用融合 token,在指定的多个Transformer层深度(如第3、6、9层)执行双视图交互。在每个融合模块中,CC分支的融合 token 作为 query,通过交叉注意力关注MLO视图的全部 token(反之亦然),从而编码双向跨视图依赖。该设计将视图间通信显式化为token级信息交换,避免直接特征融合造成的表示纠缠。
- 层级传播与重新整合:经过交叉注意力后的融合 token 被重新拼接到各自视图的token序列末尾,继续送入后续的Transformer层。随网络加深,融合信息通过自注意力机制在所有 token 间多次传播,实现互补特征的渐进式精炼。多深度插入保证模型在低、中、高级语义层面都能进行跨视图交互。
输出与训练
取最后一个融合 token(或所有融合 token 的聚合)作为最终表示,输入单层线性分类头,输出BI-RADS分级或良恶性预测。训练使用交叉熵损失,仅更新提示 token、融合 token 及分类头,骨干完全冻结。
与同类方法的差异
相对于传统的单阶段交叉注意力或特征级拼接,本方法通过专用融合 token 载体 + 多深度交互,在保留各自视图特异性结构的前提下实现了层次化、可重复的互补信息传播,有效解耦了视图共享与视图专用的表示学习。
实验
实验设计
该工作基于两个公开乳腺 X 线数据集 VinDr-Mammo 和 CMMD,评估在冻结的 视觉 Transformer 骨架上引入多视图 prompt 适配与跨视图融合的效果。
- 任务包括 BI-RADS 分级分类 与 二分类 (恶性/良性)。
- 基线方法涵盖线性探测(linear probing)、仅 prompt 适配以及传统双视图特征融合(如单层交叉注意力)。
- 消融实验分别剥离 token-based 融合模块 与 多深度交互设计,以验证各组件的独立贡献。
关键发现
- 在 VinDr-Mammo BI-RADS 任务上,框架取得 50.40% F1-score 与 0.8090 AUC。
- 二分类设定下,相较 dual-view fusion baseline,AUC 绝对提升 0.10。
- 方法在所有对比中一致优于线性探测与仅 prompt 适配方案,表明结构化 token 通信与分层融合的有效性。
- 消融结果证实,去除融合 token 或多深度注入均会导致性能显著下降,说明两者缺一不可。
与基线方法的深度对比
现有方法普遍在特征层面直接聚合或仅在网络浅层做一次交叉注意力,这易使 视图特有信息 与 共享表征 纠缠,且限制了交互深度。本框架的差异在于:
- 将跨视图交互建模为专用融合 token 间的双向自注意力,token 作为中间载体隐式编码依赖,而不直接混合原始特征,从而保留各视图的独立结构。
- 将融合模块插入 Transformer 编码器的多个深度层级,实现渐进式、重复式交互,促进互补信息沿层次化传播。
这使得模型在不破坏预训练先验的前提下,更精细地融合互补线索,最终在分类精度上显著超越以往固定融合方案。
行业影响
落地场景
该框架可嵌入医学影像工作站(如Siemens Syngo.via、GE Centricity)或云端乳腺筛查SaaS平台,实现双视角乳腺X光片(CC+MLO)的自动分类与BI-RADS分级辅助。适用于大规模筛查项目、远程放射学服务,以及乳腺影像诊断中心。基于冻结VIT的设计使其无需全量微调,便于部署在资源受限的边缘设备或医院私有云环境。
商业价值
- 降本:减少对高级放射科医师的依赖,通过自动预筛选降低人工阅片量,可节省约20-30%的人力成本;冻结骨干网络降低GPU推理成本。
- 增收:为医疗设备厂商提供差异化AI模块,提升设备附加值;第三方AI平台可通过API提供筛查服务,按例收费。
- 体验提升:多深度交叉注意力融合提升小病灶检出率(论文AUC提升0.10),降低假阳性引发的召回,减轻患者焦虑。
与现有产品/工作流的接口
- DICOM协议兼容:输入为标准CC/MLO视图的DICOM文件,输出可写入DICOM结构化报告(SR)或作为HL7消息推送至RIS/PACS。
- 模块化集成:作为即插即用的推理服务,通过Docker容器或ONNX模型部署,与现有PACS系统(如Sectra、Fujifilm Synapse)通过REST API交互。
- 工作流嵌入:在放射科阅片流程中,作为第二阅读者提供热图和高风险标记,与现有CADe/x工具并行。
具体落地用例
- 乳腺筛查云平台:类似ScreenPoint Medical Transpara或iCAD ProFound AI,该框架可作为核心算法,提供双视图融合的BI-RADS分级,集成进云端服务,面向全球医疗机构提供实时筛查。
- 设备OEM嵌入式方案:为Hologic、Siemens Mammomat等乳腺机提供机载AI推理板卡,利用冻结VIT和prompt token的轻量适配,在采集瞬间给出即时质控和初步分类,加速临床决策。
局限
- **视图缺失与配对灵活性不足**:框架假设双视图(CC 和 MLO)始终成对可用,并在此设定下设计融合 token 与交叉注意力。然而真实临床场景中常出现单视图缺失或额外视图(如 ML、放大位等),此时模型无法直接处理不完整输入,需额外策略(如缺失视图生成、动态 token 掩码)。此外,融合模块深度与 token 数量与视图固定,未探讨视图数量动态变化的适配方案,限制了在多变筛查流程中的实用性。
- **数据集与任务泛化性验证有限**:实验仅在 VinDr-Mammo 和 CMMD 两个公开数据集上进行,且均聚焦 BI-RADS 分类。论文未在其他大规模、多中心数据集或更细粒度任务(如病灶分割、微钙化检测、BI-RADS 亚类分布)上验证,也未分析在不同乳腺密度或病变类型下的性能稳定性。这导致方法的跨数据域泛化能力和临床细分场景的鲁棒性仍存疑。
- **计算开销与超参敏感性未量化**:在多个 Transformer 深度层注入融合 token 与交叉注意力,增加的计算量随图像 token 数线性增长,可能成为大分辨率输入的瓶颈。论文未与轻量化融合策略(如单层融合、通道注意力)对比效率,也未分析融合 token 数量、插入层位置等超参对性能和速度的敏感性,缺少部署导向的效率优化讨论(如 token 压缩或层剪枝)。