超越IID:表格基础模型的通用性到底有多强?
近年来,表格数据的基础模型在学术界和工业界备受关注,跨学科研究团队在不同数据集和任务上对其进行评估。然而,这些评估因基准软件和协议碎片化而难以被模型研究者复用,导致他们依赖标准基准——这些基准主要包含表格基础模型已擅长的IID任务,排除了更挑战性的场景,使得研究聚焦于IID数据上的边际改进,而非更广泛、更苛刻的挑战。 为突破这一局限,我们推出BeyondArena,首个统一的表格数据综合基准,支持多样任务类型(IID、时序、分组),覆盖不同样本量和特征维度规模,包含多种特征类型(如文本、高基数特征),来自广泛学科。同时,我们提出Data Foundry,一个Python框架和元数据模式,用于策划表格数据集以进行预测性机器学习。 我们在11个模型和142个策划数据集上的结果显示:现有表格基础模型在小到中等规模的IID数据上表现出色,而传统树模型和深度学习模型在非IID、大规模和高维数据集上仍占主导。BeyondArena引导模型研究聚焦表格数据中最具挑战性的问题,推动真正基础的表格模型进步。
论文精读
TL;DR 提出 BeyondArena 统一基准,揭示表格基础模型仅在 IID 小规模数据上占优,传统树与深度学习在更广泛的非 IID、高维、时序场景仍主导,引导向真正通用的表格基础模型发展。
问题
问题背景
表格数据预测是工业 AI 的核心场景,涵盖金融风控、医疗诊断、用户行为预测等。随着基础模型在 NLP/CV 取得成功,学术与产业界开始探索 表格基础模型(Tabular Foundation Model) ,希望将“预训练-微调”范式迁移到结构化数据,实现跨任务泛化。
现有方法局限
当前主流基准(如 OpenML-CC18、AutoML Benchmark)几乎全部基于 IID(独立同分布) 假设,模型评估局限于小/中型 IID 数据。现实世界中表格数据远非 IID:
- 分布偏移: 时序数据(如交易流水)要求模型适应时间漂移,分组数据(如患者多次就诊)要求跨组泛化。
- 特征复杂性: 高基数类别特征、混合文本字段在实践中普遍存在,但多数基准刻意剔除这些“脏”特征。
- 评估碎片化: 各学科(如医疗、金融)的评测任务分散在独立工具中,缺少统一接口与元数据规范,模型研究者难以横向对比。
这导致现有表格基础模型过度拟合 IID 场景,面对非 IID、高维、大规模数据时表现不如传统树模型或深度学习模型,而这类难例才是工业落地的关键。
为什么这个问题难/重要
表格数据的异构性(数值、类别、文本、缺失值混合)使得统一建模极具挑战。不同任务类型(IID、时序、分组)要求模型捕获根本不同的归纳偏置,单一架构难以适配所有。外加学术界缺少对“泛化困难场景”的系统评估,模型改进只能围绕 IID 做边际提升,无法逼近真正的“基础模型”目标——像 LLM 那样在多样下游任务中稳定工作。业界对表格基础模型的需求迫切,但基准缺失导致研发方向模糊,资源浪费在无关痛痒的指标上。
行业类比
就像 NLP 领域通过 SuperGLUE 将模型从简单句子匹配推向复杂推理,表格领域也亟需一个覆盖分布外、时序、高基数特征的统一竞技场,迫使模型走出 IID 舒适区。
核心洞察
- 表格基础模型在 IID 小中型数据上表现亮眼,却难以泛化到非 IID、高维、大样本等现实复杂场景,其“通用”性被明显高估。大多数现有基准仅聚焦 IID 任务,导致模型研发陷入边际改进的误区,而 BeyondArena 通过统一纳入时序、分组、混合特征类型等任务,首次系统性地暴露出现有基础模型在非 IID 设置下的性能断崖:传统树模型和深度学习仍占据统治地位。这提醒工程选型时,不应盲目追求“基础模型”标签,需根据数据分布和任务特点优先考虑梯度提升树或深度网络。
- 碎片化的评估生态是表格基础模型发展的隐性瓶颈,Data Foundry 以统一元数据与 Python 框架打通了跨学科、多任务的数据集复用,大幅降低基准构建成本。此前不同领域的预测任务各自为政,协议不兼容,导致模型比较困难,而 Data Foundry 标准化了数据整理流程,使研究者得以聚焦真正的挑战——非 IID 与大规模高维数据,而非在 IID 舒适区内反复调优。这一基础设施为构建真正通用的表格模型提供了可复现的试炼场。
方法
Data Foundry 是论文提出的标准化数据集治理框架,包含 Python 工具包和元数据 schema。其输入为来自不同领域的原始表格数据(142 个数据集),通过统一元数据描述任务类型(IID、时间序列、分组预测)、样本规模、特征维度、特征语义(含文本、高基数类别)等关键属性,将异构数据转化为一致的预测任务容器。
BeyondArena 基准 基于 Data Foundry 构建,以 任务类型为核心维度 组织评估,覆盖三类挑战场景:
- IID:独立同分布预测,传统表格模型的优势领域,侧重中小规模、低维数据;
- 时间序列:要求模型捕捉时间依赖,需处理序列划分和概念漂移;
- 分组:测试模型对未知分组(如新用户、新站点)的泛化能力,训练/验证/测试按分组严格隔离。
每个任务统一采用 交叉验证式拆分(非随机打乱),输出指标为评测模型在该类型下的排序一致性和相对胜率。所有数据集通过 Data Foundry 预处理管道自动完成缺失值填充、编码和划分,保证复现性。
评估模型共 11 个,涵盖三类主流范式:树模型(LightGBM、XGBoost 等)、深度学习模型(MLP、ResNet、FT-Transformer)、表格基础模型(TabPFN、TabR、RealMLP 等),使用官方推荐超参,无额外调优,以检验零样本或少样本泛化能力。
与同类基准的差异:现有表格基准(如 OpenML-CC18)几乎全部聚焦 IID 场景,且数据集治理碎片化,依赖临时脚本划分;BeyondArena 首次以非 IID 任务为一级设计目标,并配套 Data Foundry 实现可扩展、可复现的多维治理,迫使模型研究直面表格数据最困难的泛化挑战。
实验
实验设计
BeyondArena 基准覆盖 142 个精心策划的数据集,来自广泛学科,支持 IID、temporal、grouped 三种任务类型,刻意包含不同样本规模、特征维度以及文本、高基数特征等多样性。评估对象包括 11 个模型:代表性表格基础模型(如 TabTransformer、FT-Transformer、SAINT 等)、传统树模型(XGBoost、LightGBM、CatBoost)及深度神经网络。所有实验通过 Data Foundry 框架统一元数据与评估流程,避免碎片化。
关键发现
- 表格基础模型在微型到中型 IID 数据上表现强劲,但在 非 IID 设置(时间序列、分组预测)中系统性落后。
- 传统树模型在大型、高维、非 IID 数据上仍占统治地位,深度神经网络在高维场景中也优于大多数表格基础模型。
- 特征类型影响显著:含有文本或高基数特征时,不同模型的性能差距拉大,表格基础模型的鲁棒性不足。
与基线对比的深度解读
对比暴露了当前表格基础模型的关键局限:它们的设计和预训练大多偏向于 IID 假设,导致在现实世界常用的时间偏移、域偏移场景下泛化能力弱。传统树模型(如 XGBoost)尽管结构简单,却凭借对异构数据和分布漂移的自然适应,长期占据工业落地的主力。这一发现说明,单纯在固定 IID 基准上追求微小提升将陷入局部最优,未来表格基础模型的研究必须将非 IID、高维、多模态特征纳入评测与训练范式,否则无法成为真正通用的基础模型。BeyondArena 为此提供了统一跑道,引导资源投向最具挑战性的问题。
行业影响
落地场景
表格基础模型最直接的应用场景是中小规模 IID 表格数据的自动化预测,例如:
- 电商冷启动推荐:新商品 / 新用户的属性稀疏,传统协同过滤失效,可用表格基础模型快速产出基线推荐分数,减少人工规则编写。
- 金融交易反欺诈:异构交易记录含文本描述(转账备注)、高基数特征(商户 ID),表格基础模型对多模态特征的表征能力可提升小样本欺诈检测的召回率。
- 医疗诊断辅助:基于少量病例表格数据的诊断预测,表格基础模型可避免从头训练,直接输出风险评分。
商业价值
- 降本:在小数据场景(如新品、新药试验),减少特征工程和模型调参的人力成本,加速模型开发周期。
- 增效:对 IID 分布稳定的业务(例如跨时期不变的客户画像预测),表格基础模型可直接复用,避免重复训练,提升模型上线速度。
- 体验提升:在需要快速反应的应用(如实时推荐)中,表格基础模型一次前向即可输出预测,延迟低,用户感知更流畅。
然而,在非 IID(时序、分组)、大规模、高维表格数据上,传统树模型(XGBoost、LightGBM)和深度学习(TabNet、SAINT)仍占优势。企业不应盲目替换,需基于业务数据分布选择模型。
与现有产品 / 工作流的集成
BeyondArena 作为统一基准,可直接集成到企业内部的模型选型决策流程:
- 使用 Data Foundry 框架将业务数据集标准化为统一元数据格式,支持多种预测任务类型(IID、时序、分组)。
- 在 BeyondArena 上按数据规模、特征类型、任务类型筛选对应赛道,对比表格基础模型与传统模型的性能。
- 基于结果选择最优模型,并通过 Data Foundry 的 Python 接口直接加载数据进行训练 / 微调。
这种方式避免了依赖碎片化的学术基准,使模型评估更贴近真实业务数据特征,降低选型风险。
具体案例
- 电商平台商品销量预测:对于成熟商品,LightGBM 在时序任务上优势明显;但对于新上市商品(无历史销量,仅有描述文字和品类),表格基础模型(如 TabTransformer 变体)可利用文本特征直接输出预测,帮助运营人员制定备货计划。
- 企业客户流失预警:客户数据包含高基数特征(行业代码、公司 ID)和少量行为记录。表格基础模型能在数百条样本上获得可用 AUC,对比传统树模型在小样本上容易过拟合,可减少数据采集和标注成本。
局限
- - 尽管 **BeyondArena** 覆盖了 IID、temporal、grouped 等多种任务类型和 142 个数据集,但仅评估了 11 个模型,可能遗漏最新的表格基础模型变体或集成方法。数据集来源虽广,却未专门针对高度不平衡、流式数据等边缘场景,**Data Foundry** 的元数据模式也需扩展才能描述更复杂的数据特性。该基准目前偏重静态预测性能,未来需要纳入更多模型和动态数据条件以提高代表性。
- - 论文聚焦于预测精度这一单一指标,未讨论训练开销、推理延迟、模型可解释性等实际部署的关键维度。与 **MLPerf** 等生产级基准相比,**BeyondArena** 缺少对这些工程因素的评估,使得结果难以直接指导工业选型。表格基础模型若无法在资源受限或可解释性要求高的场景中与树模型竞争,其实际价值将受局限。
- - 实验结论显示树模型在非 IID 和高维数据上依然占优,但未深入分析内在原因,也未给出改进表格基础模型的方向。这可能导致社区过度依赖传统方法,忽视基础模型在迁移学习、少样本等任务上的潜力。与 **TabPFN**、**TabTransformer** 等工作的对比缺少对模型归纳偏置的系统讨论,削弱了基准对模型设计的启示。