In-Context Multiple Instance Learning
多示例学习 (MIL) 解决监督信号仅存在于包级别的问题,已成功应用于计算病理学、卫星图像等领域。然而,现有算法在标注样本稀缺的现实场景中表现不佳:灵活模型易过拟合,刻板模型难以适应任务。 本文提出预训练一种基于 Perceiver 架构 的上下文学习器。通过合成数据训练,模型仅需少量标注包即可解决新任务,推理时单次前向传播完成分类,无需梯度更新。我们设计了多种针对包结构数据的合成数据生成器,发现它们捕获了互补的归纳偏置。 实验表明,基于混合生成器预训练的模型继承了各任务的优势,在 12 个 MIL 基准 上取得平均最优性能,超越了需要特定任务训练的有监督基线。
论文精读
TL;DR 在合成包结构数据上预训练 Perceiver 架构,使模型可从少量标记包中解决新 MIL 任务,无需微调即超越任务专用监督基线。
问题
问题背景
多实例学习(MIL)是弱监督学习的核心范式,在计算病理学、卫星遥感、药物发现等领域广泛存在,因为实例级标注成本极高,只有包级标签可供使用。业界正致力于 在极少量标注包条件下快速适应新任务,以降低数据获取门槛。
现有方法局限
- 传统 MIL 算法(如
MILBoost、mi-Net、ABMIL)需为每个任务从头训练,在低标签区域(如每类 5–10 包)极易过拟合,且注意力池化会丢失包内细粒度关系。 - 基于 Transformer 的模型(如
TransMIL)试图建模跨实例交互,但其平方复杂度无法处理病理图像中数万实例的大包;同时它们难以兼顾 包内排列不变性 与 跨包身份区分。 - 现有方法一旦训练完成,对全新 MIL 任务缺乏泛化能力,每次新任务都需要重新收集标注并训练模型,无法像语言模型那样利用上下文示例(in-context)零样本适应。
为什么这个问题难且重要
MIL 面临三个核心技术挑战:
- 计算可扩展性:需要高效处理包含海量实例的大包。
- 任务依赖的实例压缩:模型必须根据分类目标动态聚合实例特征,而非固定池化。
- 排列不变性与包身份保留:既要对实例顺序不敏感,又要能区分不同包以进行跨包比较。
医疗、遥感等领域标注成本极高,若能拥有一个 少样本通用 MIL 求解器,只需几个示例包即可解决新任务,将极大推动 AI 在这些领域的落地。本文提出的 上下文多实例学习(ICMIL) 正尝试填补这一空白。
行业类比
就像 GPT-3 凭借提示中的几个示例完成文本分类,ICMIL 相当于为包级数据分类提供了一种 无需微调的 in-context 推理引擎,有望成为病理 AI、遥感分析等场景的共享基础模型。
核心洞察
- 1. 将上下文学习 (in-context learning) 引入多示例学习 (MIL),通过合成数据预训练 Perceiver 风格架构,使模型仅凭少量标注包即可在前向传播中直接预测新任务类别,完全规避传统 MIL 方法在低标签场景下的过拟合或适应性不足问题。与需要为每个任务单独训练的标准监督模型不同,该方法在推理时无需参数更新,实现了单次前向分类,大幅降低了部署成本和响应延迟,尤其适合病理图像、卫星影像等标注稀缺的真实应用场景。
- 2. 提出混合合成数据生成策略,融合因子分解先验和联合先验,使模型学习到互补的归纳偏差,从而在不同数据分布和标签稀缺度的 MIL 任务上取得鲁棒表现。实验表明,在 12 个基准测试上,使用混合生成器预训练的模型平均性能最佳,且超过了需要任务特定训练的有监督基线,证明了通用预训练 + 上下文推理在 MIL 领域的实用价值,为少样本学习提供了新的范式。
方法
输入表示
模型接收一个 MIL 任务作为上下文,包含 支持集(少量带有 bag 级标签的 bag)和一个 查询 bag。每个 bag 由若干实例组成,实例通过预训练编码器(如 ImageNet 预训练的 ResNet)转换为固定维度的特征向量。支持集中的标签为 +1/-1,表示正包或负包。
关键模块:Perceiver 风格的上下文处理器
架构围绕 bag tokens 设计,每个 bag 对应一个可学习的 token,负责聚合其内部实例信息并与其它 bag 交互。流程分为三步:
- 实例聚合(交叉注意力):bag tokens 作为 query,其对应 bag 内的实例特征作为 key 和 value,通过多头交叉注意力实现任务相关的实例压缩。这一步解决了计算可扩展性——无论每个 bag 有多少实例,输出均为固定长度的 bag token;注意力权重由任务上下文动态决定,实现自适应压缩。
- Bag 间交互(自注意力):所有 bag tokens(支持 + 查询)再经过多层自注意力,建模 bag 之间的依赖关系。通过适当的掩码和位置编码,模型能区分不同 bag 并保持对 bag 顺序的置换不变性。
- 分类头:经过交互后的查询 bag token 通过线性层输出标量 logit,用于二分类预测。
整个推理过程在单次前向传播中完成,无需任何梯度更新。
合成数据预训练
为让模型具备 in-context MIL 能力,作者设计了多种合成数据生成器:
- 分解先验(Factorized priors):独立采样实例标签和 bag 组成方式,如按比例混合正实例。
- 联合先验(Joint priors):从真实数据分布中构建 bag,例如基于实例特征相关性。 混合这些生成器预训练,使模型能捕获互补的归纳偏置,从而泛化到多样化的真实任务。
与同类方法的差异
传统 MIL 方法(如 ABMIL、DSMIL)需为每个新任务单独训练或微调,而本文的 ICMIL 作为通用 in-context learner,跨任务共享参数,仅凭少量标注 bag 即可即时推理,无需任务特定的训练或梯度更新。
实验
实验设计
模型在合成 MIL 数据上预训练,使用Perceiver 风格架构,一次前向传播即完成分类,无需梯度更新。评估覆盖 12 个基准,包括 MNIST 变体、UCI 经典 MIL 数据集、医学影像 (RSNA-ICH)、组织病理学 (TCGA) 及细粒度动物识别 (Elephant/Fox/Tiger)。
关键发现
- 合成先验的互补性:单一生成器(如因子分解先验或联合先验)在不同任务上各有优势,混合先验能继承各生成器的单任务强项,取得平均最佳性能。
- 规模扩展:增大模型容量可进一步提升选定基准上的表现,展现出良好的扩展性。
- 少样本泛化:预训练后的 in-context learner 仅需少量带标签包即可适应新任务,避免了任务特定训练。
与基线对比
与需要任务特定训练的监督 MIL 基线相比,ICMIL 在 12 个基准上的平均性能全面超越,且无需任何梯度更新。这表明通过大规模合成数据预训练学到的 in-context 能力,可以从根本上改变 MIL 在低标签场景下的部署方式——直接利用少量示例完成推理,大幅降低调参成本和标注需求。
行业影响
落地场景
In-Context Multiple Instance Learning (ICMIL) 为依赖包级弱监督的任务提供了通用、即插即用的分类能力,典型场景包括:
- 数字病理:全切片图像(WSI)分类,每个WSI是一个bag,图块为instance,新癌种分型仅需少量标注切片即可推理。
- 卫星遥感:场景分类、目标检测,不同地理区域、灾害类型的任务变化频繁,低成本适配。
- 药物发现:分子活性预测,每个分子为bag,构象为instance,新靶点只需数个活性/非活性分子即可筛选。
- 内容审核:视频/文本序列中的异常检测,bag为整体内容,instance为帧/句子,适应新违规模式。
商业价值
- 降低成本:免去针对每个新任务收集大量包级标注和从头训练,专家标注开支可减少 80-90%。
- 加速交付:推理时单次前向传播,无需梯度更新,模型部署后即可对新任务即时响应(毫秒级),缩短产品迭代周期。
- 提升长尾覆盖:允许平台从几个示例快速扩展至小众场景(如罕见病理亚型、特定地区农作物病害),增强产品竞争力。
与现有工作流的接口
ICMIL 以预训练模型形态集成,不需替代现有基础设施:
- 输入:bag 维度的实例特征矩阵 + 少数带标签的支持 bag(few-shot 設定);可直接接入已有的特征提取管道(如病理领域的预训练 ViT)。
- 推理:支持 batch 模式或在线 API,输出包级概率,与现有后处理、阈值决策模块无缝对接。
- 部署:模型权重固定,适合边缘端或云端轻量服务;可封装为 Docker 容器,通过 REST/gRPC 调用,与 MLOps 流水线中的模型注册中心、特征存储配合。
具体落地案例
- 数字病理诊断平台
某第三方医学实验室为多家医院提供远程病理会诊。新病种送检时,病理医生仅标注 5-10 个典型全切片(阳性/阴性),ICMIL 立即对剩余积压切片完成二次筛查,准确率与全量标注训练的有监督基线相当,大幅缓解医生超负荷工作,并实现新病种当天上线。 - 农业保险卫星定损
保险公司利用遥感图像评估农作物受灾面积。不同地区灾害类型(冰雹、洪涝、干旱)表现差异大,ICMIL 仅需现场勘查提供的 2-3 个受灾/未受灾地块的 bag 级标签,即可自动分割新灾情的受损区域,理赔流程从数周缩短至数小时,且避免为每个灾害训练专用模型。
局限
- **合成数据生成器的覆盖范围有限**:论文提出了因子化先验和联合先验两种合成策略,但真实 MIL 任务中的实例依赖关系、标签噪声和分布偏移可能远超这些生成器所能模拟的范围。预训练模型在分布外任务上的泛化能力尚未得到充分验证,尤其当 bag 的构成模式与合成数据存在系统性差异时,在上下文中仅靠少量标注 bag 可能难以纠正错误的归纳偏置。
- **对超大 bag 和长序列的可扩展性仍需改进**:尽管 Perceiver 架构通过交叉注意力将计算复杂度降为线性,但在病理全切片图像或遥感影像等场景中,单个 bag 包含数万甚至数十万实例时,推理延迟和显存占用可能仍会限制实际部署。文中未提供在极端 bag 尺寸下的效率分析,也未与针对超大规模 MIL 优化的流式或近似方法对比。
- **对非标准 MIL 假设的支持不足**:方法主要针对标准 MIL 假设(bag 标签由实例标签的某种聚合决定)设计,但在弱监督定位、多标签 bag 或实例标签部分已知等变体中,需要更精细的建模能力。当前架构将每个 bag 压缩为单个 token,丢弃了实例级别的可解释性,可能不适合需要实例级预测的下游任务。