ConEx: 通过概念感知归因实现人类可解释的显著性图
计算机视觉中的许多视觉解释方法虽能高亮像素重要性,却难以将这些低层线索与语义上有意义的概念关联起来,从而限制了其可解释性与可信度。 我们提出 Concept-based Explanations (ConEx),一个将 显著性可视化 与 基于概念的推理 相结合的新框架,兼具 忠实性 与 可解释性。ConEx 自动发现类别特定的概念,并通过 概念激活向量(CAVs)表示它们;这些向量借助架构特定的掩码机制学习,无需人工监督,可减少分割掩码引入的噪声、提升概念纯度。该框架还能生成忠实的 显著性图,揭示每个概念在图像中的出现位置及其对预测的贡献。 为评估所学概念的可靠性,我们提出两个互补指标:Vector-Concept Match (VCM) 与 Concept-Class Match (CCM),用于量化概念对齐程度,并支持与现有方法直接比较。 大量跨设置实验表明,ConEx 在 忠实性、分割 与 概念质量 基准上均达到 SOTA。总体而言,ConEx 推动了视觉模型向真正可解释、以概念为根基的解释方向迈进。
论文精读
TL;DR ConEx 用自动发现的类别概念与 CAVs 生成揭示概念位置及贡献的忠实显著图,并通过 VCM/CCM 指标验证概念对齐,在 faithfulness、分割与概念质量上达 SOTA。
问题
问题背景
视觉模型可解释性领域当前聚焦于从像素级归因升级到语义概念级解释,以支持模型审计与可信部署。
现有方法局限
- 基于显著图的方法(Grad-CAM、Integrated Gradients 等)只输出像素/区域热力,缺乏“是什么概念驱动预测”的语义标签,人类仍需二次猜测。
- 概念瓶颈模型(CBM)依赖人工预定义概念集和标注,扩展性差,无法覆盖长尾/隐式概念。
- 基于 Concept Activation Vectors (CAVs) 的方法往往需要用户提供概念示例图,或依赖无监督分割得到候选片段;分割掩码的粗糙边界会引入背景噪声,使学到的概念向量纯度下降,导致概念归因与真实语义不一致。
- 缺乏统一的自动验证指标,难以横向比较不同方法发现的概念质量。
为什么这个问题难/重要
自动发现类特定概念并保持概念纯度是核心挑战:需要区分与类别相关的前景概念和与任务无关的背景/纹理噪声;不同架构(CNN vs. ViT)的特征空间和局部化能力差异很大,尤其 ViT 的全局注意力使空间定位困难。此外,概念与类别之间的对齐关系需要量化,否则概念解释可能是巧合或误导。业界对高风险场景(医疗影像、自动驾驶、金融 AI 审计)的可解释性要求越来越高,既需要归因忠实于模型决策,又需要解释语言人类可懂。
行业类比
类似于推荐系统不仅给出“点击概率高”的物品,还要解释“因为命中了用户对某主题的长期偏好”这类概念级依据,视觉模型也需要把“这张图是猫”解释为“因为检测到毛茸茸的圆脸 + 尖耳朵 + 胡须”等语义要素。
核心洞察
- 将概念归因与像素级显著性图融合,通过概念激活向量(CAVs)实现语义级解释且保持忠实度。与 TCAV 仅提供全局概念重要性、像素显著性方法缺乏语义不同,ConEx 能定位每个概念在图像中的位置并量化其对预测的贡献,弥合低层线索与高层语义的鸿沟。在实际工程中,该框架可让开发者直接查看模型依据哪个语义概念做决策,便于调试和审计。
- 架构特定掩码机制自动发现类别特定概念,无需人工标注,并通过减少分割掩码噪声提升概念纯度。相比依赖预定义概念集或分割质量的方法,ConEx 针对 CNN 和 ViT 设计不同嵌入策略,使概念发现更鲁棒。该设计让工程师无需额外标注即可获得高质量概念表示,适合大规模部署和持续监控模型行为。
- 提出 VCM 和 CCM 两个互补指标,分别衡量概念向量与视觉概念的匹配度、概念与类别的关联度,为概念解释提供可量化验证手段。与以往依赖人工评估或间接性能指标相比,这两个指标支持直接比较不同方法的概念质量,推动可复现研究。工程上可作为模型审计工具,识别模型学到的是否为可理解且与类别强相关的概念。
方法
方法流程
输入:一张测试图像与一个预训练视觉分类模型(支持 CNN 与 ViT 两种骨干架构)。
关键模块:
- 自动概念发现:不使用人工标注,借助分割掩码与架构特定的掩码策略自动提取类特定概念。掩码机制会抑制分割边界噪声,提升概念纯度,使后续 CAV 更干净。
- 概念激活向量 (CAV):将每个发现的概念表示为模型特征空间中的一个方向向量。CAV 通常通过线性分类器区分“属于该概念”与“不属于该概念”的特征激活,从而编码语义方向。
- 架构特定嵌入策略:针对 CNN 使用卷积特征图,针对 ViT 使用 patch token 或 CLS token 的对应激活,确保概念向量与模型内部表示对齐。
- 概念感知归因:
- 先通过 channel-weighted vectors 将 CAV 投影回空间维度,实现概念定位。
- 再用 multiplicative fusion 将概念激活与像素级 saliency 相乘,得到概念级归因图。
- 可按需输出 class-specific 或 global 语义归因,前者解释某一类别的概念贡献,后者跨类别聚合概念重要性。
- CAV 验证指标:引入 Vector-Concept Match (VCM) 与 Concept-Class Match (CCM) 两个补充指标,分别衡量概念向量与真实概念的对齐程度、概念与类别的关联强度,用于量化评估概念质量。
输出:faithful saliency maps,显示每个概念在图像中的出现位置及其对最终预测的贡献,同时给出每个概念的 CAV 质量分数。
与同类方法的差异:TCAV 等传统方法需要人工定义概念示例,而 ConEx 全自动发现概念并显式优化概念纯度,同时将概念归因与像素 saliency 统一到同一框架,避免了事后拼接带来的不一致。
实验
实验设计
ConEx 在多个公开视觉基准上评估,重点覆盖 faithfulness(忠实性)、segmentation alignment(分割对齐)与 concept quality(概念质量)三个维度。方法自动发现类别特定概念,以 CAV(Concept Activation Vectors)表示,并通过架构特定的掩码机制(如针对 CNN 与 ViT 的不同处理)降低分割掩码噪声,提升概念纯度。评估协议包括像素级归因忠实性、概念激活与人工标注概念的匹配度,以及新提出的 VCM(Vector-Concept Match)和 CCM(Concept-Class Match)指标。
关键发现
实验结果表明,ConEx 在以上基准上均取得 state-of-the-art 性能。其生成的概念感知 saliency maps 不仅定位精准,还能解释每个概念对预测的贡献,有效弥合了低层像素重要性与高层语义之间的差距。自动发现的概念无需人工监督,且通过噪声抑制机制获得了更纯净的概念表示。
与基线的深度对比
与仅输出像素重要性的传统 saliency 方法相比,ConEx 额外提供了概念层面的归因,从而提升可解释性与信任度。与完全基于概念的解释方法相比,ConEx 保留了空间定位能力,并通过架构特定设计减少 mask 噪声,验证了概念纯度对整体性能的关键影响。
行业影响
落地场景
ConEx 适用于对可解释性 有强需求的高风险或高价值视觉任务。例如:
- 医疗影像诊断:自动发现如“毛玻璃影”“分叶征”等病灶概念,生成概念定位热图,辅助医生快速复核模型判断。
- 自动驾驶感知:解释检测模型对“行人”“车道线”“交通标志”的概念响应,用于安全审计与事故归因。
- 电商商品审核:解释商品属性识别(材质、款式),定位具体区域,帮助商家修正错误标签。
商业价值
- 降低人工标注与审核成本:CAV 学习无需手工概念标注,减少专家标注投入。
- 提升信任与合规通过率:符合 GDPR / AI Act 等对可解释性的要求,降低法律风险。
- 加速模型调试与数据纠错:通过概念质量指标
VCM/CCM快速定位概念混淆或数据偏差,缩短迭代周期。
与现有工作流接口
ConEx 作为 post-hoc 解释层,无需重新训练模型:
- 接入已部署的 CNN / ViT 模型,只需提取中间层特征与梯度。
- 概念发现依赖的分割 mask 可复用 SAM / DeepLab 等分割模型,降低集成成本。
- 输出概念激活向量(CAVs)和概念 saliency map,可直接对接现有解释面板(如 TensorBoard 插件)或监控系统,作为概念漂移检测指标。
- 对 ViT 需使用论文提出的 architecture-specific embedding 策略,ML 团队需按模型架构适配。
局限
- 概念发现的质量高度依赖分割掩码的精度。尽管 ConEx 设计了架构特定的掩码机制来降低噪声,但底层分割模型在复杂场景(遮挡、小目标、细粒度纹理)中仍可能产生不准确的掩码,导致提炼出的 **概念激活向量 (CAV)** 混杂无关像素,影响概念纯度和最终显著性图的忠实度。此外,无监督自动发现的概念可能缺乏清晰的人类可理解语义,需要人工审查与筛选,这在一定程度上削弱了方法的可扩展性和自动化程度。
- 方法具有明显的架构依赖性。论文中提出的 **架构特定嵌入策略** 需要针对不同模型结构(如 CNN 与 ViT)分别设计,且附录中仅讨论了向多标签分类的扩展,暗示当前框架主要针对单标签分类任务。对于目标检测、分割或其他视觉任务,以及混合架构或新兴 backbone,可能需要较大的改动才能适配,这限制了 ConEx 作为通用解释工具的适用性。
- 提出的两个指标 **VCM** 和 **CCM** 虽然为概念质量评估提供了量化手段,但尚不构成公认的基准。与插入/删除、指向游戏等传统显著性指标相比,它们需要预先定义概念集并可能引入人工标注的主观性,且概念对齐程度与人类对解释的整体理解之间仍存在差距。此外,新增评估协议增加了复现和比较的负担,可能影响其在社区中的快速采纳。