论文

在类别不均衡的 CT 身体成分分割中解耦采样与训练预算

在类别不均衡的 CT 身体成分分割中解耦采样与训练预算

类别不均衡是医学图像分割中的基本挑战,频繁出现的类别通常在训练中主导代价而忽略稀有类别。基于损失的方法通过批量内逐像素损失重新加权来缓解不均衡,而采样策略则控制哪些图像进入批量。然而,这两者都未明确控制批量中出现的类别,导致稀有类别的暴露仅部分重平衡。 在本工作中,我们从少样本学习中引入情景采样(episodic sampling),在完全监督设置下促进类别均衡的批量构建。我们将其与传统的度量学习背景解耦,并在 CT 身体成分分割中进行评估。在来自公共 SAROS 数据集的 210 次扫描中,我们对 9 种肌肉和脂肪组织比较了情景采样与随机采样和加权采样。训练在全数据与低数据条件下进行,并在匹配训练迭代预算下进行额外比较。 在全数据训练下,三种策略表现相近(平均 Dice 0.882 对 0.878 和 0.878)。在低数据训练下,情景采样优于随机和加权采样(0.787 对 0.758 和 0.762),这得益于 12 倍的训练迭代差异。在匹配训练预算下,随机和加权采样更早过拟合,而情景采样在性能提升后约三倍迭代次数才趋于平稳。 我们的发现将训练迭代预算识别为采样策略中未充分认识的混杂因素,促使小数据集采用迭代感知评估协议。此外,情景采样的残余优势与类别均衡批次的隐式正则化效应一致,为类别不均衡医学图像分割提供了一种低成本、模型无关的策略。代码见 https://github.com/iasonsky/episodic-sampling。

论文精读

TL;DR 本文引入小样本学习的 episodic sampling 构建类平衡批次,在低数据 CT 体成分分割中大幅优于随机与加权采样,并揭示训练迭代预算为被低估的关键因素,提供低成本类不平衡解法。

问题

医学图像分割中,类别不平衡 是核心瓶颈,尤其在多组织 CT 身体成分分割 任务中,常见组织像素占比高,主导训练梯度,而稀有组织分割精度不足。

现有主流解决方案分为两类:损失重加权采样策略。损失重加权通过调整类别权重缓解不平衡,但仅在已有类别上操作,无法迫使模型在训练批次中见到稀有类别;加权采样按图像级频率或困难度选择图像,但图像内仍可能不包含全部类别,导致批次类别组成仍被常见类别主导。两者均 未能显式控制每个 mini-batch 中的类别组成,稀有类别仅在偶然出现时得到训练,暴露频率远低于常见类别。这对小数据集(如仅 210 例的 SAROS 数据集)尤为致命。

构造类别平衡批次需预知图像像素级标签,而推理时这是未知的。此外,训练迭代预算 是一个被低估的混杂变量:不同采样策略下模型收敛速度与过拟合时间点各异,若固定相同迭代次数比较,会错误地将 “训练不充分” 归因为 “策略无效”。研究发现随机和加权采样在低数据量下快速过拟合,而 episodic sampling 能持续改进约三倍迭代数才平台化,这凸显了 迭代感知评估协议 的必要性。业界对医学图像分割的鲁棒性要求极高,罕见组织(如特定筋膜、小器官)的漏检可能导致临床误判,因此类别平衡采样是提升分割可靠性的低成本方案。

类似 长尾图像分类 中的少样本学习,episodic 训练将稀有类视为独立分类任务;在分割中,可将每个类别视为一个 episode,强制学习类别平衡特征,避免偏向头部类。

核心洞察

  • **训练迭代预算(training iteration budget)是采样策略对比中被长期忽视的混淆因子**。以往工作通常在固定 epoch 或迭代次数下比较不同采样方法,但低数据场景下各策略的实际收敛速度差异巨大。本文通过显式控制迭代次数并设计匹配预算的实验,揭示情节采样在低数据下的 Dice 优势(0.787 vs 0.758/0.762)很大程度上源于其训练迭代数比随机、加权采样多 12 倍。这一发现迫使社区重新审视不平衡学习方法的公平评价基准,强调迭代次数应与网络架构、损失函数同等对待,作为实验控制变量。
  • **情节采样(episodic sampling)通过强制类别平衡的 mini-batch 构造提供隐式正则化,显著延缓小数据集过拟合**。与依赖超参的 Loss 加权或仅考虑图像出现频率的采样不同,情节采样确保每批包含所有目标类的至少一个样本,使梯度更新更均匀。在匹配迭代预算的实验中,虽然随机和加权采样初期收敛更快,但很快进入过拟合;而情节采样允许网络持续改善约 3 倍的迭代次数才达到平台期,最终性能更优。这为极低数据情形(罕见病、特定解剖结构)提供了一种低成本、模型无关的正则化策略,建议作为医学图像分割的标准基线尝试。

方法

输入与任务定义

本方法以腹部 CT 扫描 为输入,来自公开数据集 SAROS,共 210 例,每例均标注 9 类肌肉与脂肪组织。任务目标是像素级 多类语义分割,核心挑战在于类别极度不均衡——常见类(如皮下脂肪)会主导训练,迫使稀有类(如某些深层肌群)欠拟合。

采样策略设计(关键模块)

方法围绕 批次构造 展开,对比三种采样策略:

  1. Random Sampling: 从所有训练图像中均匀随机抽取,不控制类分布,批次内各类出现频率与全数据分布趋同。
  2. Weighted Sampling: 依据预计算的图像级权重采样,权重由图像内稀有类占比决定,使含更多稀有类的图像更常被抽中。
  3. Episodic Sampling(核心创新): 借鉴小样本学习中的 episodic training,完全剥离度量学习语境,直接在全监督分割任务中构造类平衡批次。具体做法是将整个数据集按 类别 分组,每次迭代从每个类别中抽取等量的若干像素/切片形成一批,强制保证每批内各类样本数量均衡。

网络架构采用标准 卷积分割主干(原文未指定具体模型,但策略与架构解耦),训练协议使用 交叉熵损失恒定学习率 的 SGD。

实验与输出

为解耦采样策略与训练迭代预算的影响,设计两类实验:

  • 固定迭代次数(30k 次)直接比较不同采样;
  • 迭代预算校准:让每种策略训练至验证损失平台化,再等量迭代后对比。 最终输出为多类分割掩膜,以 Dice 系数 评估。

关键设计差异

与常见的损失加权或样本重加权方法不同,本方法在批次构造层面直接操控类均衡,不修改损失函数,因此与任何损失函数或骨干网络兼容。与传统的基于元学习的 episodic sampling 相比,移除了 query-support 架构,仅保留其“每批包含所有类”的构造原则,落地为一种极低成本、可插拔的医学分割训练策略

实验

实验设计

该工作基于 SAROS 数据集 的 210 张 CT 扫描,标注了 9 种肌肉与脂肪组织,进行体成分分割。实验对比三种采样策略:

  • Random Sampling: 均匀随机选取图像构成 batch。
  • Weighted Sampling: 根据类别像素比例加权采样图像。
  • Episodic Sampling: 借鉴少样本学习,显式构建类均衡 batch (每个类别均出现在 batch 中)。

训练分为 全数据 (full-data)低数据 (low-data) 两种 regime。低数据下进一步设置 固定迭代次数迭代次数对齐 两种评估协议,以剥离训练步数对采样策略效果的混淆。

关键发现

  • 全数据下性能相当: 三种方案 Dice 均约 0.88,episodic 略高 (0.882 vs 0.878),但无显著差异。
  • 低数据下 episodic 显著胜出: episodic 的 Dice 达 0.787,远超 random (0.758) 和 weighted (0.762),主因是 episodic 能支撑约 12 倍 的训练迭代而不过拟合。
  • 迭代次数匹配后,episodic 仍具优势: 当刻意对齐训练步数,random/weighted 更早过拟合,episodic 可多训练约 3 倍 迭代才进入平台期,表明类均衡 batch 自带隐式正则化效果。

与基线对比解读

Episodic sampling 通过 显式控制 batch 内的类别组成,解决了 random/weighted 仅控制图像级采样而无法保证稀有类别在每个 batch 出现的缺陷。低数据场景下,训练迭代次数成为被低估的混杂因素:传统固定迭代的评估会掩盖采样策略的真实潜力。因此,该工作呼吁采用 迭代次数对齐的评估协议,尤其针对小数据集。该方法模型无关、即插即用,为类别不平衡的医学图像分割提供了低成本提升手段。

行业影响

落地场景

论文提出的 episodic sampling 主要面向 医学图像分割,特别是 CT 身体成分分析(肌肉、脂肪组织分割)。可直接集成到放射科工作站、PACS 系统、自动化影像后处理平台,用于肌少症筛查、肿瘤恶病质评估、肥胖相关代谢疾病监测。此外,在健康管理 App、运动医学分析工具中,利用低剂量 CT 或 opportunisitic screening 数据,自动输出体成分报告,辅助营养/运动干预决策。

商业价值

  • 降本:低数据场景下(罕见病、小样本标注)Dice 提升 3~5 个百分点,减少人工复审和重标注成本;同时随 training iteration budget 匹配,随机/加权采样更早过拟合,episodic 可延长有效训练 3 倍迭代,降低试错算力浪费。
  • 增收:更准确的罕见组织分割(如器官边界、小肌肉群)能提升 AI 辅助诊断产品的差异化竞争力,进入高端体检、专科随访等付费场景。
  • 体验提升:放射科医生在 PACS 中一键获取全自动、可信的肌肉/脂肪量化结果,无需手动勾画,报告流转速度加快。

与现有工作流的接口

Episodic Sampling 作为训练时的轻量级数据采样器,与现有分割栈无缝对接:

  1. DataLoader 中替换原有随机/加权采样器,按 way-shot 原则构建 class-balanced mini-batch。
  2. 不改动网络结构或损失函数,可搭配任何分割模型(如 nnU-NetSwinUNETR)。
  3. 生产部署阶段无需额外推理开销,预测时仍使用常规推理流程。
  4. 建议将 iteration budget 作为超参数纳入训练协议,通过指数衰减学习率+早停,匹配最佳训练轮次。

具体落地 Use Case

  1. 医院放射科肌少症筛查:对腹部 CT 平扫数据自动分割腰大肌、腹壁肌群及内脏脂肪,生成肌少症评分报告。采用 episodic 训练(低数据场景),在仅有 20~30 例标注时 Dice 达 0.787,优于常规采样,减少初期标注投入,快速上线试点。
  2. 跨国 CRO 影像评估:药物减肥临床试验中需对大量 CT 扫描进行标准化体成分分析。集成 episodic 采样训练的模型到云端影像判读平台,稳定处理多中心异构数据,避免稀有类别(如肌间隙脂肪)分割漂移,提升跨机构结果一致性,缩短分析周期。

局限

  • **单数据集验证**:实验仅在 **SAROS** 数据集的 210 例 CT 身体成分分割任务上进行,虽然包含九类肌肉与脂肪组织,但未在其他医学图像分割场景(如器官、病灶分割)中评估。不同任务的数据分布、类别不平衡程度及解剖结构差异可能影响 **episodic sampling** 的有效性,方法泛化性尚未得到充分验证。
  • **采样超参数未充分探索**:**episodic sampling** 引入了类别选择数量、每类支持样本数等超参数,文中可能采用预设配置,未系统探讨这些参数对性能的影响。尤其在低数据条件下,超参数选择可能直接决定批次内类别平衡的程度与训练效率,而该研究未对此提供敏感性分析或调优指导。
  • **训练预算混杂分析局限于固定学习率**:实验采用恒定学习率与固定迭代次数对比,但实际训练中常使用学习率衰减、早停等策略。**episodic sampling** 延缓过拟合的结论是否在各学习率调度下保持稳健,文中未加以检验,可能限制其对真实训练流程的指导意义,且匹配训练预算的实验设计也未考虑动态停止准则。
论文Iason Skylitsis2026-05-19原文

相关内容