论文

LightMIS:无需逐阶段解码器的超轻量医学图像分割

LightMIS:无需逐阶段解码器的超轻量医学图像分割

LightMIS 是一族可扩展的超轻量卷积网络,用于 2D 二值医学图像分割,且不含可学习的逐阶段解码器(stage-wise decoder)。 方法:LightMIS 通过 Scale-Aligned Projection 模块将五级编码器的输出对齐到统一分辨率,一次性聚合,再用 Adaptive Fusion Cascade 精炼融合表示。该级联结构结合了 Adaptive Kernel Fusion 与提出的 Progressive Receptive Fusion 模块,后者采用临时通道扩展、互补的深度可分离感受野以及渐进式跨分支信息传递。 实验:在 DRIVE、Kvasir-SEG、DSB18、BUSI、ISIC-2017 与 ISIC-2018 上,按统一的 nnU-Net v2.3.1 协议进行五折交叉验证,评估 LightMIS-T、LightMIS-S 与完整版 LightMIS。完整版仅含 0.131 M 参数,3×256×256 输入下需 0.575 GFLOPs,取得模态宏平均 Dice 86.71% 与 IoU 78.99%;Mobile U-ViT 为 86.75% Dice 与 79.07% IoU,差距仅 0.04 与 0.08 个百分点。 效率与结论:相比 Mobile U-ViT、nnWNet 与 nnU-Net,参数量减少 90.58–99.61%,GFLOPs 减少 82.54–96.14%。在 Arm Mali-G52 MC2 GPU 上,所有变体均实现完整 GPU 委托,委托延迟中位数从 LightMIS-T 的 53.31 ms 到完整版的 138.31 ms。结果表明其在所评估任务上具有良好精度-复杂度权衡与端侧部署可行性。代码见 https://github.com/AndreiiArhire/LightMIS 。

论文精读

TL;DR LightMIS 是不依赖逐级解码器的超轻量医学图像分割网络,通过多尺度特征对齐与自适应融合,以 0.131M 参数逼近 Mobile U-ViT 精度,算力降低超 80%,适合端侧部署。

问题

问题背景

医学图像分割当前聚焦于精准分割 与计算效率 的平衡,尤其随着远程诊断和便携设备普及,对低资源部署的需求持续上升。

现有方法局限

主流 U-Net 家族依赖逐级解码器逐步恢复分辨率,带来三方面问题:

  • 参数冗余:解码器与编码器对称,大量参数用于上采样特征融合,如 nnU-Net 常常超过 30M 参数。
  • 计算开销高:多级 skip connection 和转置卷积/插值导致高 GFLOPs,难以在边缘 GPU 上实时推理。
  • 内存带宽压力:高分辨率特征图在解码阶段反复读写,移动端带宽受限时成为瓶颈。

轻量变体如 Mobile U-ViT 虽降低部分开销,但仍保留 stage-wise decoder 结构,未能从根本上消除解码器冗余。

为什么这个问题难/重要

分割任务需要多尺度感受野与精确边界定位;去掉 stage-wise decoder 后,单次聚合空域信息难以保留细节。同时医疗图像模态多样(眼底、内镜、超声、皮肤镜),目标尺度差异大,对模型泛化能力要求高。业界关注点不仅是精度,更在于能否部署到 Arm Mali-G52 等嵌入式 GPU 上完成 full GPU delegation,实现毫秒级延迟。

LightMIS 的动机正源于此:用 Scale-Aligned Projection 对齐五级编码特征并一次聚合,以 Adaptive Fusion Cascade 替代繁琐解码,实现 0.131M 参数和 0.575 GFLOPs 的极端轻量化。

行业类比

类似在智能手表上实现实时房颤检测,需在极低算力下保持关键信号分割的精度,任何多余解码层都会拖慢响应。

核心洞察

  • LightMIS 的核心架构创新是完全移除 learned stage-wise decoder,仅保留五级 encoder 输出,经 Scale-Aligned Projection 对齐到统一分辨率后一次性融合,再用 Adaptive Fusion Cascade 细化。与 nnU-Net、nnWNet 以及 Mobile U-ViT 等依赖对称或非对称 decoder 逐步恢复空间分辨率的方案不同,这种设计将参数量压到 0.131 M、计算量缩至 0.575 GFLOPs,同时 modality-macro Dice 仅比 Mobile U-ViT 低 0.04 个百分点,表明精心设计的 encoder 特征聚合已能替代大部分 decoder 功能,为移动端分割提供了新的架构范式。
  • Progressive Receptive Fusion (PRF) 模块是补偿无 decoder 后多尺度上下文缺失的关键。它采用临时通道扩张、互补 depthwise 感受野以及跨分支渐进信息传递,在不显著增加参数的前提下模拟了 decoder 的上下文聚合能力。相比轻量网络常用的简单特征相加或深度可分离卷积,PRF 强调“渐进”与“互补”,在 DRIVE、Kvasir-SEG、DSB18、BUSI、ISIC-2017/2018 共六个数据集上通过五折交叉验证证实了其有效性,为后续 ultra-lightweight 分割模型设计提供了一个可复用的构建块。

方法

LightMIS 是一种无 stage-wise decoder 的超轻量卷积分割网络。输入为 2D 医学图像,输出二值分割掩码。整体流程:

  • 五级编码器 提取多尺度特征,各级分辨率递减、通道数递增。
  • Scale-Aligned Projection blocks 将五级编码器输出对齐到同一分辨率(通过上采样/投影),然后一次性聚合,避免逐级解码。
  • Adaptive Fusion Cascade 对聚合特征进行细化,包含两个子模块:
    • Adaptive Kernel Fusion 自适应选择/组合不同核大小的卷积,增强多尺度表示。
    • Progressive Receptive Fusion 先临时扩张通道,利用互补的 depthwise 感受野并行提取特征,并通过跨分支渐进传递信息,融合不同感受野上下文。

最终经简单预测头输出分割结果。训练采用 nnU-Net v2.3.1 协议,五折交叉验证。

与同类方法差异:LightMIS 用一次性对齐聚合 + 级联细化取代了 U-Net 式 stage-wise decoder,在参数和 FLOPs 大幅降低的同时保持相近 Dice/IoU。

实验

实验设计

  • 统一协议:五折交叉验证 + nnU-Net v2.3.1 预处理/训练配置
  • 数据集:DRIVE、Kvasir-SEG、DSB18、BUSI、ISIC-2017、ISIC-2018
  • 基线:Mobile U-ViT、nnWNet、nnU-Net
  • 复杂度评估:参数量、GFLOPs(3×256×256)、Arm Mali-G52 MC2 延迟

关键发现

  • LightMIS 全量模型仅 0.131 M 参数、0.575 GFLOPs,Dice 86.71%、IoU 78.99%
  • 与 Mobile U-ViT 差距仅 0.04 pp Dice / 0.08 pp IoU,几乎无损
  • 相对基线参数减少 90.58–99.61%,计算量减少 82.54–96.14%
  • 端侧全 GPU delegate:LightMIS-T 53.31 ms,LightMIS 138.31 ms

与基线对比解读

  • 在保持精度接近的前提下,将计算与存储开销压缩到极低水平,验证了无阶段式解码器设计的有效性
  • 通过 Scale-Aligned Projection 对齐多尺度特征并一次性聚合,避免了 U-Net 式逐级上采样的冗余
  • 端侧延迟数据显示可部署性,适合算力受限的医疗影像场景

行业影响

落地场景

LightMIS 系列主要面向 2D 医学图像分割的边缘部署,适合以下产品:

  • 便携式医疗设备:如手持超声、皮肤镜、眼底相机,在嵌入式 GPU 上实时分割病灶。
  • 移动健康应用:用户拍摄皮肤或视网膜图像,离线完成分割与初筛,避免上传隐私数据。
  • 内窥镜辅助系统:实时息肉分割与标注,辅助内镜医师。

商业价值

  • 降本:参数仅 0.131 M,GFLOPs 0.575,相比 nnU-Net 等减少 90% 以上,可显著降低云端推理成本和边缘硬件要求。
  • 增收:设备厂商可作为高精度轻量 AI 模块提升产品竞争力,或提供订阅式 AI 诊断服务。
  • 体验提升:在 Arm Mali-G52 MC2 GPU 上全委托延迟 53–138 ms,满足实时交互;离线运行提升用户信任与合规性。

与现有产品/工作流接口

  • 模型基于 PyTorch,训练协议兼容 nnU-Net v2.3.1,可直接替换现有分割模型编码器,无需重构预处理/后处理流程。
  • 导出为 ONNX 或 TFLite 后,可集成到 TensorFlow Lite、Arm NN 等移动推理框架。
  • 提供预训练权重,针对新数据集微调即可适配不同模态。

具体 use case

  1. 远程皮肤癌筛查 app:用户在手机拍摄皮肤病变,离线运行 LightMIS 分割病灶,标记可疑区域,辅助用户或基层医生。无需上传图像,隐私安全。
  2. 内窥镜实时辅助系统:在消化内镜检查中,将 LightMIS 部署在 GPU 加速的边缘设备,实时分割息肉,提示医生注意,降低漏检率。

局限

  • **任务范围受限**:LightMIS 仅针对 2D 二值医学图像分割设计,未涉及 3D 体数据或多类别分割任务。论文中所有实验(DRIVE、Kvasir-SEG、DSB18、BUSI、ISIC-2017、ISIC-2018)均为二分类分割,因此无法判断该方法在更复杂的解剖结构或多标签场景下的表现。对于临床应用,如肿瘤亚区分割或器官多类别分割,需要额外的架构调整或验证,这限制了其直接适用性。
  • **精度优势不明确**:与 Mobile U-ViT 相比,LightMIS 的 Dice 差异仅 0.04 个百分点(IoU 差 0.08 个百分点),虽然参数和计算量大幅降低,但在精度敏感的诊断任务中,这微小的差距可能影响模型选择。论文未提供统计显著性检验的详细结果(摘要提到有统计检验,但正文未给出 p 值或效应量),无法确认该差异是否在统计学上可忽略。此外,在更高分辨率输入或不同数据分布上,精度差距是否扩大尚不可知。
  • **部署评估单一**:论文仅在 Arm Mali-G52 MC2 GPU 上测试了延迟,并报告了 full GPU delegation,但未提供在通用 CPU、NPU 或其他移动端加速器上的性能数据。实际医疗设备常配备不同硬件,单一硬件结果可能无法反映边缘部署的普适性。同时,训练协议统一使用 nnU-Net v2.3.1,虽然保证了公平性,但可能掩盖了 LightMIS 在自定义训练策略下的潜在优势,也未探索量化、剪枝等进一步压缩手段对精度和延迟的影响。
论文Andrei Arhire2026-09-24原文

相关内容