论文

每个细胞类型一次点击足矣:无需训练的Group Interaction用于Cell Instance Segmentation

每个细胞类型一次点击足矣:无需训练的Group Interaction用于Cell Instance Segmentation

细胞实例分割模型在特定细胞类型数据集上训练后,遇到分布外细胞类型时性能严重下降。交互式基础模型虽能通过逐实例提示(per-instance prompting)解决该问题,但对于包含数百到数千个密集实例的组织病理学图像,成本过高。 本文提出 Group Prompting 新范式,将交互式分割从逐实例复杂度 O(N) 降至逐类型复杂度 O(T),即每个细胞类型只需一次点击即可分割该类型的所有实例。关键发现是:Segment Anything Model (SAM) 的冻结图像编码器在未给定任何提示时,已在特征空间中将相同类型的细胞聚类。基于此,我们提出无需训练的 Chain-of-Prompts (CoP) 框架,递归扩展单次点击,具体通过:(1) 对多尺度编码器特征进行非参数门控(non-parametric gating)以识别可靠的相同类型位置;(2) 选择空间距离最远的可靠点作为下一个提示以最大化覆盖率。 在三个细胞类型标注基准上,CoP 每类型一次点击保留超过90%的逐实例性能,并超越无需额外训练的全监督方法。在四个形态同质基准上,单次点击保留超过99%。项目页面:https://shjo-april.github.io/Chain-of-Prompts/

论文精读

TL;DR 利用 SAM 冻结编码器的类型聚类特性,**单次点击即可分割全部同类细胞**,将交互成本从 O(N) 降至 O(T),无需训练且性能超越全监督方法。

问题

问题背景

计算病理学中,细胞实例分割 是定量分析的基础任务,直接影响细胞计数、形态测量等下游应用。然而,细胞形态的高度异质性与组织类型的多样性,使得模型在分布外 (OOD) 细胞类型 上的泛化成为核心挑战。

现有方法局限

当前主流方案分为两类:

  • 细胞特定模型:无论是无监督、弱监督还是全监督方法,均在特定数据集上训练,学到的特征表示与训练细胞类型紧密绑定。面对未见过的细胞形态或组织背景时,性能急剧下降。
  • 交互式基础模型(如 SAM3):通过逐实例点提示实现分割,无需任务特定训练,可自然泛化到任意细胞类型。但其每实例一次交互的范式在组织病理全切片图像中代价极高——单张图常包含成百上千个密集细胞,逐一点击完全不可行。

为什么这个问题难且重要

挑战在于效率与泛化的对立:泛化性强的交互式模型反而因高昂的人工成本而无法落地,而训练高效的专用模型又难以覆盖真实世界中无限多样的细胞表型。业界迫切需要在保持零样本泛化能力的同时,将交互次数从 $O(N)$ (实例数) 降至 $O(T)$ (类型数) 的范式革新。此外,预训练视觉编码器(如 SAM)能否在无任何提示时便内在地组织细胞类型信息,是一个关键但未被探索的问题。

行业类比

这类似于在全景分割中,用单次提示完成语义级标注(如“分割所有行人”)以替代逐个实例标注——将交互粒度从实例提升到类别,极大释放人机协同的效率潜力。

核心洞察

  • 冻结的 SAM 图像编码器在未见提示时已能按细胞类型聚类特征,为免训练的按类型分组提示提供了直接的信号来源。这一发现打破了交互式分割必须依赖繁琐的逐实例提示或需要针对特定细胞类型微调模型的惯例,证明了大模型内部表征的通用区分能力足以支撑高效的群组级交互,从而完全回避了分布外细胞类型导致的性能退化。
  • Chain-of-Prompts 通过多尺度编码器特征的非参数门控和空间最远点递归,将用户单次点击自动扩展为覆盖全部同类实例的提示链,实现了从逐实例 O(N) 到逐类型 O(T) 的成本骤降。不同于仅依赖特征相似度传播的方法,它显式地优化空间覆盖,减少了密集场景下同类细胞互相污染的风险,同时无需任何训练或在线学习,为高细胞密度病理图像的实际部署铺平了道路。

方法

输入与任务定义

Group Prompting 范式将交互式细胞实例分割从 每实例 O(N) 降为 每类型 O(T):用户仅需对每类细胞提供 一次点点击,方法自动分割该类型所有实例。

关键观察与整体框架

Chain-of-Prompts (CoP) 是一种 训练免费 的递归提示扩展框架,依赖冻结的 Segment Anything Model (SAM) 编码器。核心观察:在未给定任何提示时,SAM 图像编码器已在特征空间中将 同类型细胞聚类。CoP 利用这一性质,从一个初始点击出发,通过两个模块循环扩张提示集,直至覆盖所有实例。

核心模块

  1. Hierarchical Similarity Gating (分级相似门控)
    对已有提示的位置,在多尺度编码器特征上计算 特征相似度,并通过 非参数门控 筛选出属于同一细胞类型的可靠位置。门控不依赖可学习参数,仅基于特征分布统计,有效抑制背景与异类细胞。

  2. Farthest Prompt Recursion (最远提示递归)
    在获得的可靠位置集合中,选择 空间距离最远 的点作为下一个提示,输入 SAM 解码器生成新候选掩码,并重复门控-递归过程。这种策略确保提示尽可能分散,最大化单次点击的覆盖范围。

输出与推理流程

初始点击 → 门控筛选同类型位置 → 选最远点作为新提示 → SAM 生成掩码 → 重复直至无新增实例,最终输出所有同类型细胞的实例分割结果。整个过程 无需微调 SAM,仅使用其预训练编码器与解码器。

与同类方法的差异

相比每实例单独提示的交互式模型,CoP 通过 分组提示特征聚类先验 将用户交互成本压缩到与细胞类型数成线性,且不损失精度;相较于全监督方法,它在跨域细胞类型上不需要额外训练即可保持高性能。

实验

实验设计

本文在两类细胞分割基准上评估 Chain-of-Prompts (CoP):三类细胞类型标注基准(含多种形态异质细胞)和四类形态均质基准,覆盖不同组织与染色条件。基线包括 (1) 逐实例交互分割方法(如 SAM 直接点选);(2) 全监督细胞特异性模型。评估指标聚焦于性能保留率:以逐实例提示的性能为 100%,衡量单次类型点击所能保留的比例。

关键发现

CoP 仅需每类一次点击即可实现大幅效率提升:在细胞类型标注基准上,保留逐实例性能的 90% 以上;在形态均质基准上,单次点击可保留超过 99%。更重要的是,CoP 无需任何额外训练即超越了全监督细胞特异性方法,而这些方法在出分布细胞类型上性能严重下降。

与基线的深度对比

逐实例交互分割虽然泛化性强,但成本与细胞数 N 呈线性增长(O(N)),在病理全切片图像中不可行。CoP 将交互范式从 O(N) 降至 O(T)(T 为细胞类型数),仅用一个点击覆盖同类所有实例。与全监督方法相比,CoP 打破了训练数据分布限制,直接利用冻结的 SAM 图像编码器 已有的特征聚类特性,无需任何微调即可泛化到新细胞类型。这种零样本的群体交互能力,使得大规模病理分析从“逐细胞注释”变为“逐类型定义”,显著降低人工干预成本。

行业影响

落地场景

Group Prompting 将交互式实例分割从「逐实例提示」降维到「逐类型提示」,特别适用于高密度、多实例的病理图像分析。典型落地场景包括:

  • 数字病理学平台:在整张切片图像(WSI)中快速分割肿瘤细胞、免疫细胞或基质细胞,辅助病理医生进行定量评估。
  • 药物研发中的细胞表型分析:对大规模细胞成像实验进行自动化表型分类与计数,减少人工圈注的工作量。
  • 医疗AI产品中的标注工具:作为交互式分割前端,大幅提升标注效率,加速训练集构建。

商业价值

  • 降本:仅需一次点击即可分割某一类型全部细胞,人工交互成本从 O(N) 降至 O(T)(T 为细胞类型数,通常远小于 N)。在包含数百至数千个细胞的病理图像中,可节省 90% 以上的点击与校正时间。
  • 增效:无需针对新细胞类型训练或微调,直接利用冻结的 SAM 编码器特征,零样本泛化到形态各异、训练未见的细胞种类,避免模型性能在分布外数据上急剧下降。
  • 体验提升:交互逻辑简单直观(每类型一点),非专业用户也能快速完成分割,降低专业门槛。

与现有产品/工作流的接口

该方法作为训练免费的 Chain-of-Prompts(CoP) 框架,可直接集成到现有交互式分割流程中:

  • 后端集成:CoP 仅依赖 SAM 的编码器(冻结),无需梯度计算,可作为轻量级 Python 服务部署在云端或本地工作站。
  • 前端对接:提供单点采集接口,前端只需捕获用户点击并传输坐标,后端返回该细胞类型的所有分割掩码。现有标注工具(如 LabelMe、CVAT)可通过插件形式集成。
  • 数据流兼容:输出为标准掩码,可直接输入下游任务(细胞计数、空间分析)或作为伪标签启动弱监督训练。

具体落地使用案例

  1. 全球数字病理学诊断平台
    某跨国病理 AI 公司为其浏览器端标注工具增加“按类型分割”按钮,病理学家在肺部组织图像上点击一个癌细胞,CoP 在数百个细胞中自动分割出所有同类型癌细胞,并给出计数与面积统计。集成后,单张 WSI 的标注时间从 20 分钟缩短到 2 分钟,且无需针对不同癌种额外训练模型。

  2. 生物制药公司的高通量细胞筛选
    某制药企业在药物毒性检测中,使用高内涵成像系统每天产生数万张细胞图像。通过将 CoP 嵌入其自动分析管线,只需对每种细胞形态点击一次(如正常细胞、凋亡细胞、分裂相细胞),即可获得全板分割结果,替代了之前需要针对每种细胞类型重新训练分割网络的工作流,让分析科学家直接专注于生物学结论。

局限

  • **特征聚类假设的敏感性**:方法依赖 SAM 冻结编码器在特征空间中对同类型细胞的自然聚类,但当细胞类型间形态差异极微(如免疫细胞亚型)或染色不均导致特征混淆时,非参数门控可能失效,导致递归扩展至错误类型。论文未讨论对**细粒度类型**(如不同淋巴细胞亚群)的区分能力,也未提供特征分离度的定量分析,实际部署中可能需要针对特定组织进行特征空间校准。
  • **依然存在的人工交互负担**:虽然从每个实例点击 (O(N)) 降为每个类型点击 (O(T)),但当组织样本包含数十种细胞类型时(如肿瘤微环境中多种浸润免疫细胞、基质细胞),逐一标注类型仍耗时;且用户需具备细胞形态学知识以提供正确的初始点击,无法实现完全无监督的自动化分析,在**大规模全切片图像**处理中仍可能需要多重交互。
  • **泛化与重叠细胞处理的不确定性**:实验仅在有限基准(三个细胞类型标注集、四个形态均质集)上验证,**密集重叠或包裹的细胞**场景下递归扩展的有效性未充分检验;此外,方法基于 SAM 的二维切片特征,对**三维组织或不同染色模态**的扩展性存疑,跨实验室、跨扫描仪的图像分布漂移下是否保持 90%+ 性能仍需评估。
论文Sanghyun Jo2026-05-28原文

相关内容