论文

Markov Boundary 在表格预测中的好、坏与丑

Markov Boundary 在表格预测中的好、坏与丑

在标准图形假设下,目标变量的 Markov boundary 是使所有其他特征冗余的最小特征集。一旦观测到该边界,目标变量与表格其余部分条件独立。这对于表格预测很有吸引力,因为它精确指明了模型所需的列。然而,现代回归器仍使用全部特征集。我们通过 SCM3K(一个包含 3450 个合成 SCM 任务的基准,特征数从 40 到 1000,涵盖六个 SCM 族)评估 Markov boundary 对预测的实际效用,并使用六个回归器。 结果比理论更复杂。将回归器限制在最优边界上通常能大幅提升预测性能,且特征空间越大越稀疏时提升越明显。但先通过因果发现恢复边界,再使用恢复的掩码训练的常规流程并未奏效。现有估计器在达到边界最有效的区域之前就耗尽了计算预算,即便运行完成,也极少超越全部特征集。 我们将其归因于三个原因:1. 因果发现优化的是结构恢复而非预测;2. 假负与假正带有的预测成本极不对称;3. 精确边界仅是众多优于全部特征的特征集之一。基于这些发现,我们提出了对面向预测的特征选择和利用因果结构的表格模型的启示。

论文精读

TL;DR 本文通过大规模基准实验,揭示马尔可夫边界在表格预测中“理论最优但工程失效”的根因:计算瓶颈、不对称预测损失与边界非唯一性,并给出预测对齐的特征选择路径。

问题

问题背景

表格数据(tabular data)预测是 AI 在金融、医疗、风控等领域的核心任务。当前,无论是树模型还是深度学习模型,大多默认使用全部特征进行训练,忽略了特征间可能存在的因果结构。理论上,Markov boundary (MB) 提供了预测目标变量的最小充分特征子集,使用 MB 应该能提升预测性能并增强可解释性,但这一理论优势在实践中并未被广泛验证。

现有方法局限

现有的 MB 发现方法(如因果发现算法)试图从数据中恢复完整的边界结构,但其根本局限在于优化目标与预测任务的错配

  • 优化目标偏离:因果发现旨在准确恢复全部因果图边,而非直接最小化预测损失;即使结构恢复的 SHD(Structural Hamming Distance)较低,所获特征子集也未必能提升回归器的性能。
  • 计算可扩展性差:精确的 MB 发现算法在高维(特征数 >100)场景下消耗巨大算力,往往在计算预算耗尽前无法运行到最有帮助的特征规模,或是运行后仍无法击败全特征集。
  • 不对称的预测代价:从预测角度看,遗漏关键特征(假阴性)的代价远高于引入冗余特征(假阳性),而当前算法对这两类错误一视同仁,导致恢复的 MB 常缺失重要的直接原因,却保留了一些对预测无用的变量。

为什么该问题难且重要

问题的难度在于因果充分性与预测最优性并非等价。理论上 MB 是条件独立的最小集,但实际中:

  1. 严格最小性并非必须:存在多种特征子集在预测上可超越全特征,精确 MB 只是其中之一,盲目追求最小性可能丢掉有益的非最小变量。
  2. 大规模场景下的算法瓶颈:随着特征维度膨胀,因果发现的“计算悬崖”使得真实助益仅出现在人工 oracle 边界上,现有估计器几乎无法抵达这一增益区间。
  3. 业界关注度上升:以 Tabular foundation models 为代表的表格大模型正尝试在充分性与可扩展性之间寻找平衡,但 MB 的可扩展估计、与预测模型的协同优化仍是开放设计空间。

行业类比

这类似于推荐系统中的因果去偏:理论上仅保留因果特征可消除混杂偏倚,但在实践里,由于因果图发现不完美,直接使用高维行为特征(类似全特征集)常比不精确的因果筛选更稳健,引发了对“预测导向的因果特征工程”的重新反思。

核心洞察

  • **目标不匹配**:因果发现追求结构恢复精度(如 SHD),而预测任务需要最小化均方误差。这种目标差异导致即使恢复了高精度的因果图,所选特征集也未必提升预测性能。尤其在大规模稀疏场景下,边界理论优势明显,但现有发现方法在算力耗尽前达不到该优势区。这提示需要设计以预测损失为导向的特征选择机制,而非依赖精确因果重建。
  • **不对称代价与超越最小性**:丢失真实因果父节点(假阴性)比包含冗余变量(假阳性)对预测的伤害更大,打破了传统对最小边界的追求。同时研究发现,存在多个非精确边界也能击败全特征集,表明“足够信息量”比“严格最小性”更实用。这为特征选择开辟了新的设计空间:允许可控的冗余以换取计算可行性和鲁棒性,而非死板追求因果发现的精确解。

方法

实验设计

该工作以 SCM3K 基准为核心,涵盖 3 450 个由结构性因果模型 (SCM) 生成的合成表格任务,特征维度从 40 到 1000,覆盖六种 SCM 家族 (线性、非线性等),确保结果有广泛代表性。

评估管线

对每个任务,作者构建三条预测管线:

  1. Oracle 边界:利用真实因果图提取目标变量的马尔可夫边界,仅用该特征子集训练回归器。
  2. 完整特征集:将所有可用特征输入同一回归器。
  3. 恢复边界:先用因果发现算法 (如 PC、GES) 估计马尔可夫边界,再用估计出的 mask 训练回归器。

六种常见回归器 (梯度提升树、多层感知机等) 被统一纳入,预测性能通过 R² 与负均方误差衡量,关键指标 MB gap 定义为 oracle 边界与全特征预测性能之差。

归因与失败分析

  • MB gap 归因:按特征总数、边界大小、稀疏度等维度分层统计,揭示 oracle 边界收益主要出现在高维、稀疏场景。
  • 计算可扩展性:记录因果发现算法在不同特征数下的运行时间与成功率,发现现有方法在维度超过数百时频繁超时或崩溃。
  • 不对称误差代价:将估计边界中的假阴性 (漏掉真正因变量) 与假阳性 (纳入冗余变量) 分离,测量它们各自导致的预测损失,发现漏掉关键特征的代价远高于多引入噪声。
  • 最小性松弛:与 oracle 边界相比,以预测性能为标准筛选非最小但性能更优的特征集,表明精确边界只是众多 “足够好” 子集之一。

推断与设计空间

基于上述观察,作者提出 分层边界 (layered blankets)预测增益图 (prediction gain maps) 概念,将特征按因果距离分层可视化,并指出面向预测的特征选择应直接以预测损失为导向,而非单纯追求结构恢复的精确度。

与同类工作的差异

不同于传统因果发现方法以 SHD 或 F1 衡量结构恢复,该工作首次系统量化了马尔可夫边界 估计误差对下游预测的实际影响,并明确指出:在有限计算预算下,追求精确边界可能得不偿失,预测对齐的特征选择应当放宽最小性约束。

实验

实验设计

本文在 SCM3K 基准上验证 Markov boundary 的预测价值。该基准包含 3450 个合成回归任务,特征数从 40 到 1000,涵盖 6 种结构因果模型(SCM)家族(如线性、非线性、后非线性等)。使用 6 种常用回归器(包括 XGBoostRandom ForestMLP 等)评估三种特征选择策略的预测性能:全特征集、Oracle Markov boundary(真实边界)、因果发现算法(如 PCGES)恢复的边界。

关键发现

  • Oracle boundary 增益显著:以真实边界训练,预测性能通常大幅提升,且提升幅度随特征空间增大、稀疏度升高而增长。
  • 因果发现流程失效:现有因果发现估计器在特征数增大时计算预算往往耗尽,未能进入边界帮助最大的区域;即使能运行,恢复的边界极少超越全特征集。
  • 三个深层原因:1) 发现算法优化结构恢复而非预测损失;2) 假阳性和假阴性对预测代价高度不对称;3) 最小边界只是众多优于全特征集的特征子集之一,精确恢复并非必要。

与基线的对比解读

理论上 Markov boundary 是最小充分特征集,但实证表明,当前因果发现工具偏离了这一理论优越性。与全特征集基线相比,Oracle boundary 的显著增益证实了边界概念的有效性,但恢复边界的失败揭示了预测导向特征选择需重新权衡 充分性、可扩展性与简洁性。论文进一步提出“层次化边界”与“预测增益图”等概念,指出表格模型应内化因果结构的学习,而非依赖前置的精确结构恢复。这为表格预测的特征选择与基础模型设计开辟了新的方向。

行业影响

落地场景

论文揭示了马尔可夫边界在表格预测中的实际效用与局限,直接影响到所有依赖表格数据的机器学习系统。适用场景包括金融风控、医疗诊断、用户增长、供应链预测等,尤其是特征维度高、因果关系混杂的领域。当特征数量达到数百至上千维时,利用因果关系筛选出的最小特征集可以显著降低模型复杂度,提升可解释性,并规避虚假相关带来的风险。

商业价值

  • 降本:特征集缩减后,数据采集、存储和预处理成本下降;模型推理速度提升,尤其适合实时决策系统(如在线风控、推荐引擎)。
  • 增收 / 体验提升:去除噪声特征可减少过拟合,提升预测准确率,直接带来业务指标改善(如风控降低坏账、推荐提升点击率)。
  • 解释性增强:在受监管行业(如信贷、保险)中,基于因果关系的特征选择更容易通过合规审查,减少模型风险。

与现有产品 / 工作流的接口

现有因果发现方法(如 PC 算法、GES)的计算开销在 100 维以上表中将超出常规预算,因此直接嵌入 AutoML 流水线不现实。短期内可采取分层策略:先通过轻量级关联性特征筛选缩维,再在低维空间运行因果发现获得边界估计;或使用预测导向的边界近似方法。长期来看,应推动预测对齐的因果特征选择方法,并集成到表格基础模型(Tabular Foundation Model)中,使其在训练时隐式习得因果结构,而非依赖显式因果发现。

具体案例

  1. 金融信用评分:原始特征常包含数百维人口统计、交易行为、社交关系等。使用马尔可夫边界可识别与违约直接因果关联的少量特征(如收入稳定性、历史逾期次数),排除仅存在虚假相关的特征(如手机品牌),提升模型稳健性和监管合规性。
  2. 电商推荐系统:用户行为序列产生海量特征,通过因果边界筛选出影响购买决策的核心特征(如近期搜索品类、价格敏感度),而非仅依赖关联强但因果弱的行为(如浏览时长),可提升推荐转化率,并减少因兴趣漂移导致的模型衰减。

局限

  • - **可扩展性不足**:当前基于约束或核条件独立检验的边界发现方法计算复杂度高,在特征数超过数百时已耗尽 64GB 内存或 24 小时预算,无法进入论文中收益最大的高维稀疏区域(如 1000 维、10 样本/维),限制了在实际表格数据中的应用前景。
  • - **恢复目标与预测错位**:因果发现普遍以图结构恢复(如 SHD、F1 边)为优化准则,但边界成员的假阳性与假阴性对下游回归的损失贡献高度不对称,导致高结构分数不一定转化低预测误差,现有的边界估计器因而难以在预测任务中超越全特征训练。
  • - **精确边界命题过于严格**:实验显示存在多种非边界特征子集在预测上同样优于全部特征,最小性假设并非实用必需,论文未进一步给出可放宽的边界准则或自动选择替代子集的机制。
论文Shu Wan2026-05-28原文

相关内容