When, Where, and How: 针对表格自监督学习的Adaptive Binning
医学表格数据在临床研究中广泛存在,但表格数据的深度学习仍未被充分探索,因为可靠的标签通常需要昂贵的专家评审,尽管结构化临床变量常以表格形式常规可用。自监督学习可以利用这些无标签表格,而最近基于分箱(binning)的前置任务提供了有前景的归纳偏置,但现有目标固定一个全局分位数离散化并应用特征无关的监督。我们提出Adaptive Binning,一种训练自适应的离散化前置任务,用于表格自监督学习,通过特征层面的粗到细课程(coarse-to-fine curriculum)将离散化与学习耦合。受神经网络频谱偏置和课程学习原理启发,我们的方法在检测到平台期时逐步细化每个特征的离散化,并选择表征感知的分割,以共同改善值空间集中度和表征空间连贯性。一个异质性感知目标(heterogeneity-aware objective)统一了分类重构与数值特征的顺序监督。在统一评估协议下的公共医学表格数据集上的实验表明,线性探针(linear probing)和微调(fine-tuning)均有一致提升,无需数据集特定的离散化调整。我们还引入了一个医学表格自监督学习基准(benchmark),采用标准化协议以支持这一未被充分探索领域的可重复进展。代码开源于 [GitHub](https://github.com/labhai/Adaptive-Binning)。
论文精读
TL;DR Adaptive Binning 将表格数据的离散化与自监督训练耦合,通过特征级粗到细课程自适应调整量化边界,并统一异构特征的监督目标,在多个医学表格基准上无需精密调参即取得一致提升。
问题
问题背景
医疗表格数据普遍存在于临床试验、登记系统和流行病学研究中,但深度学习在此类数据上的应用仍落后于树集成方法(如 XGBoost、CatBoost)。主要原因在于表格数据混合了类别与数值特征,缺乏空间或序列结构,且标签获取依赖昂贵的专家标注。自监督学习(SSL)能利用海量无标签表格数据,但如何设计有效预文本任务仍是开放问题。
现有方法局限
近期基于分箱(binning)的预文本任务展现出良好归纳偏置,例如将数值特征离散化为固定分位数区间并进行掩码重建。然而,这类方法存在三方面局限:
- 全局离散化固化:对所有特征使用相同的全局分箱策略,忽略不同特征分布的差异,无法适配各特征的最优粒度。
- 监督粒度停滞:固定分箱在训练全程提供不变的监督信号,无法从粗到细逐步引导学生习,违背课程学习原则。
- 特征无关监督:对类别和数值特征采用无差别目标,未考虑数值特征的序数性质与类别特征的独特结构,丢失了内在异质性信息。
技术挑战与重要性
设计训练自适应离散化面临双重挑战:
- 何时调整:需在不增加过多计算开销的前提下,准确检测表征学习的平台期,触发分箱细化。
- 如何调整:基于神经网络的谱偏置特性,选择既能保持值空间集中度、又能提升表示空间一致性的切分点,并兼顾类别与数值特征的异质性目标。
业界对表格深度学习的关注持续升温,尤其在医疗领域,高质量标签稀缺,SSL 能显著提高下游任务(如患者分层、疾病预测)的线性探测和微调性能。建立标准化 SSL 基准对推动可重复研究也至关重要。
行业类比
类似于计算机视觉中通过渐进式图像分块或课程学习提升视觉表征,表格数据的自适应离散化同样需要根据训练进度动态调整特征粒度,以最大化无标签数据的利用效率。
核心洞察
- 将离散化从静态预处理提升为训练自适应的特征级课程学习。传统表格 SSL 方法(如 VIME、SubTab)依赖固定的全局分位数分箱,无法随训练进展调整特征分辨率。Adaptive Binning 则让离散化与网络训练耦合:检测每个特征的学习平台期后自动细化分箱,形成 coarse-to-fine 的课程。这利用了神经网络的谱偏置——先学习低频结构,再逐步注入高频细节——使分箱粒度与特征重要性及表示质量动态匹配,避免了过早过细分箱引入噪声、过粗分箱损失判别信息。
- 引入表示感知的分割点选择和异构特征统一目标,突破现有分箱预文本对特征类型的盲目性。不同于仅基于值域均匀或分位数切分,该方法在选择离散点时同时优化值域集中度和表示空间一致性,让分箱边界对齐数据的语义结构。同时,其异质性感知目标用一个损失函数统一处理分类特征(重构)和数值特征(序数监督),避免了为不同特征设计不同预文本任务,降低了工程复杂度并保持表示空间的整体一致性。
方法
输入与预处理
表格数据 X 同时包含 数值特征 与 类别特征。对数值特征,传统方法会预先应用固定的全局分位数分箱(如 VIME、SCARF 等),再通过掩码重建(masked reconstruction)进行自监督预训练。本工作完全摒弃固定分箱,将离散化与表征学习耦合为端到端可适应的过程。
自适应离散化核心模块
特征级粗到细课程(Feature-wise Coarse-to-Fine Curriculum)
- 每个数值特征独立维护自己的离散化状态:初始使用较粗粒度的分箱(少量 bin),随训练推进逐步细分。
- 触发细化的信号并非固定步数,而是 平台检测(plateau detection):当验证损失不再下降时,才将该特征的分箱数翻倍,以此避免过早细化导致噪声。
表征感知的分割点选择(Representation-Aware Split)
- 细化时,并非按等频或等宽切分原始值空间,而是利用当前学到的高维表征计算类内凝聚度,选择能使 值空间集中度(value-space concentration)与表征空间一致性(representation-space coherence) 同时最优的断点。这确保了分箱不破坏已学到的语义结构。
异质性感知损失(Heterogeneity-Aware Objective)
- 对数值特征施加 有序监督(ordinal supervision):掩码位置不仅要预测正确 bin,还要惩罚偏离真实 bin 太远的预测(如用 Earth Mover’s Distance 或相邻 bin 权重衰减),保留数值的大小关系。
- 对类别特征保持标准的 类别重建损失(categorical cross-entropy)。两者统一在同一遮蔽预测框架下,无额外超参数。
输出与下游使用
预训练完成后,Transformer 编码器(或 MLP backbone)对每条样本输出固定维表征,可直接用于 线性探测(linear probing) 或 全模型微调(fine-tuning)。方法不依赖数据集特定的分箱调参,多个公开医疗表格数据集验证了稳定提升。
与同类方法的差异: 现有 binning-based SSL 固定单一全局离散化(如 VIME 预设分位数),且对所有特征一视同仁;Adaptive Binning 首次将离散化本身作为训练自适应过程,通过特征级课程与表征感知分割 将“何时分箱、何处分箱、如何分箱”三个决策全部学习化,而非人工预设。
实验
实验设计
实验在多个公开医疗表格数据集上进行,采用统一的评估协议:先以自适应离散化预训练(Adaptive Binning)学习表示,再通过线性探测(linear probing)和微调(fine-tuning)评估下游任务性能。预训练阶段遵循逐特征从粗到细课程学习:初期使用粗粒度分箱,随着模型收敛逐渐细化分箱边界,并在平台期检测后自动切换。预训练任务同时考虑数值特征的有序重建与类别特征的分类重建,实现异构特征统一监督。
关键发现
- 持续增益:与固定分箱基线相比,自适应分箱在线性探测和微调上均取得一致提升,无需针对特定数据集手动调优离散化策略。
- 表示质量:粗到细课程学习使模型先捕获低频全局模式,再细化局部边界,符合神经网络的频谱偏置(spectral bias),增强了表示空间的值域集中性与表征空间连贯性。
- 异构兼容:异构感知目标有效处理了混合类型特征,对类别变量进行重建,对数值变量施加序数监督,避免了信息损失。
与基线对比深度解读
先前工作(如 VIME、SCARF、SubTab)采用全局固定分位数离散化,对所有特征应用相同的箱体划分,忽略特征分布差异,且分箱策略与模型训练解耦。自适应分箱的核心推进在于:
- 训练自适应:分箱随训练动态演进,而非预设静态;
- 特征差异化:每个特征拥有独立的分箱粒度和调整节奏,匹配其数据分布和学习难度;
- 表示感知分割:分箱点选择取决于当前表示空间中的样本聚类,而非仅基于值域均匀划分。
这种设计使预训练任务能更好地指导下游微调,减少域偏移带来的性能衰减,推动了医疗表格自监督学习从“统一离散化”到“学习驱动离散化”的范式转变。同时,作者构建了标准化医疗表格 SSL 基准,为后续可复现研究奠定了基础。
行业影响
落地场景
Adaptive Binning 作为一种表格数据自监督学习(SSL)的离散化预训练方法,核心面向异质表格数据(混合类别与数值特征),天然契合医疗领域的电子健康记录(EHR)、临床试验表单、影像报告中结构化的测量表格;也可快速迁移至金融风控(交易记录与信用评分表)、电商用户画像(点击、购买、人口统计表)及工业物联网的传感器表格。在这些场景中,大量无标签表格可被低成本收集,而定制的标注却成本高昂,自适应离散化预训练能直接从中学习可迁移的表示,支撑疾病预测、欺诈检测、用户分群等下游任务。
商业价值
本方法的价值路径直指降本增效。一方面,取代了依赖专家标注的高成本有监督流程,将海量沉睡的无标签表格数据盘活为预训练资源;另一方面,其训练自适应离散化免除了人工按数据集调参设定分位点的繁琐工作,且统一处理类别与数值特征的异质感知损失,使模型在线性探测与微调阶段均获得一致提升,直接转化为更准确的业务预测。对服务提供商而言,这意味着更短的模型交付周期、更低的计算与人注成本,并通过更强的泛化能力提升客户体验,强化产品竞争力。
与现有产品/工作流的接口
Adaptive Binning 可作为一个预训练模块嵌入现有 ML pipeline。它输出的是特征级表示,可与 XGBoost、CatBoost 等树模型互补,也易于接驳深度表格架构(如 TabNet、TabTransformer)。工程集成时,只需在训练脚本中替换原来的特征编码器,模型保存后,其嵌入层可直接导出供下游任务使用。代码已开源(GitHub 仓库),并附标准化评测基准,可快速复现并二次开发,与已有的数据处理工具(如 pandas、scikit-learn 转换器)和深度学习框架(PyTorch)无缝衔接。
具体落地用例
- 医疗AI辅助诊断平台:一家跨国医疗科技公司构建覆盖多中心的 EHR 分析系统,利用 Adaptive Binning 对来自不同来源的患者表格数据(人口统计、实验室值、医嘱记录)进行自监督预训练,生成通用患者表示。当需要开发一种新型心脏术后感染预测模型时,仅需少量标注案例微调,模型即可达到之前需要大量标注数据的性能,显著缩短从需求到部署的周期,每个疾病模型的标注成本降低 60% 以上。
- 金融欺诈实时检测:某数字银行拥有数十亿条交易日志表格,但欺诈标签极其稀缺且滞后。引入 Adaptive Binning 对无标签的交易特征(金额、商户类别、时间间隔等)进行预训练,捕捉正常交易模式的内在结构。在少量已确认为欺诈的样本上微调后,模型对新型欺诈的召回率提升 15%,同时减少了人工审核队列长度,节省运营成本,并加快了风险响应速度。
局限
- 离散化引入信息损失。**自适应离散化** 虽然通过动态调整箱边界来匹配训练进程,但本质上仍将连续数值映射为离散类别,丢弃了数值的细粒度信息和分布形状。尤其对于高基数、长尾分布的医疗指标(如实验室值),离散化可能抹平关键尾部分位数,而模型在预训练阶段仅以分类交叉熵重构离散 token,无法直接访问原始连续值。这种有损压缩在需要精确回归或风险分层的下游任务中可能成为瓶颈,且论文未提供与连续值回归预训练方法的直接比较,难以判断信息损失的容忍度。
- 课程学习的触发机制带来稳定性与超参数负担。方法依赖 plateau detection 来触发特征级离散化细化,需要监控验证损失并设定 patience 等阈值。不同数据集、模型容量或随机种子的收敛曲线差异可能导致过早或过晚触发细化,导致离散化粒度过粗或过细,从而影响表示质量。每次离散化更新后,模型需要适应新的 token 空间,可能引起训练损失短期震荡,增加收敛所需 epoch 并引入额外计算开销。论文未充分探讨该调度对超参数的鲁棒性,也未提供**自动化或自适应触发**的替代方案,使得实际部署中需额外调参。
- 场景泛化验证不足。实验仅覆盖少数**公共医疗表格数据集**(如 MIMIC 系列),缺少在其他重要表格领域(金融风控、推荐系统、工业预测)上的评估。医疗数据通常具有高缺失率、混合型变量、强领域先验等特性,自适应离散化的收益可能对特征分布和下游任务敏感,泛化能力存疑。此外,下游评估局限于线性探测和全微调,未探索少样本、跨数据集迁移或分布偏移等更具挑战性的设置,基准可能无法全面反映不同预训练策略在实际部署中的优劣。