适配 prior-data fitted networks 用于表格异常检测
尽管深度特征已改变图像与视频的异常检测,但在表格数据上成效有限,部分原因是缺少强深度表征。近期,prior-data fitted networks (PFN) 成为表格数据此类表征的一个有前景来源。本文研究如何适配并利用 PFN 表征做异常检测。问题比看起来更难:部署前没有异常样本,模型参数无法监督调优;而定义正常行为的 reference set 本身可能就包含它本应揭示的异常。 我们首先使用冻结的 TabPFN 特征:以样本在特征空间中到最近邻的距离打分,已能得到很强的结果;我们还确定了应当使用哪些层,并提出一套适合该任务的特征提取流程。为进一步提升性能,我们利用 reference set 微调模型,使所得特征能更好地区分正常样本与异常。 在 ADBench 基准上,免微调方法 ZEN 的平均 AUROC 高于所有 baseline,而微调方法 FOCUS 在此基础上进一步提升;该思路还能在不同 PFN 模型之间泛化。
论文精读
TL;DR 利用 PFN 预训练表示进行表格异常检测,提出无需训练的 ZEN 与微调的 FOCUS,在 ADBench 上超越所有基线,并有效抵抗参考集污染。
问题
问题背景
表格数据异常检测是工业监控、金融风控等场景的核心需求。深度学习在图像和视频异常检测中显著提升了性能,但表格数据领域仍缺少强预训练表示,导致深度方法收益有限。
现有方法局限
- 经典浅层方法(如孤立森林、LOF)依赖距离或密度假设,对高维、异构、非线性表格数据表现不佳。
- 深度自编码器等模型需要大量干净正常样本训练,且容易过拟合噪声,无法利用预训练知识。
- PFN(Prior-Data Fitted Networks) 如 TabPFN 提供了表格数据的强先验表示,但如何将其适配到异常检测仍未被系统研究:特征提取层选择、特征构造方式、打分函数以及与参考集的自适应机制均不明确。
为什么这个问题难且重要
部署前没有异常样本可用,模型参数无法通过监督方式调优;同时,定义正常行为的参考集本身可能混入异常,模型必须对污染保持鲁棒。ADBench 基准显示现有方法平均 AUROC 仍有较大提升空间。本文发现:即使冻结 TabPFN 特征、仅用特征空间最近邻距离打分,也能超过所有基线,说明预训练表示中蕴含的判别信息被严重低估。
行业类比
类似信用卡欺诈检测或设备故障预测场景:标注异常极少,正常样本集中也可能混入未标记异常,需要无需训练或仅依赖参考集自适应的方法。
核心洞察
- PFN 预训练得到的表格数据表征可以直接用于异常检测,无需针对异常任务微调。ZEN 仅用冻结 TabPFN 特征 + kNN 距离,就在 ADBench 上超过所有专用基线,说明 PFN 的先验里已经编码了“正常 vs 异常”的流形结构。这与图像/视频领域的深度特征迁移类似,但此前表格异常检测缺少这种通用强表征;ZEN 把 PFN 从分类模型转成可用的 AD 特征提取器,且没有训练成本,适合冷启动。
- FOCUS 通过在参考集上做 one-class 微调,把 PFN 特征空间进一步拉向“正常样本紧凑、异常样本偏离”的方向,同时用 epoch 平均来抵抗参考集自身的污染。这与传统 AD 方法把参考集当干净数据训练不同;FOCUS 不假设参考集无异常,而是让微调过程对少数污染鲁棒,因此在 contaminated regime 下仍能提升 AUROC。该机制为无监督 AD 的域适应提供了新思路:不需要外部标签,仅利用部署前可获得的参考集,就能改善预训练表征的判别性。
方法
输入与表示
给定表格数据,包括待检测样本和定义正常行为的参考集(可能含少量异常)。使用预训练的TabPFN 作为特征提取器。
关键模块
特征提取:冻结TabPFN,将每个样本(参考集和待测样本)输入网络,选取适合异常检测的中间层输出作为特征。作者通过实验确定合适的层和提取流程,以保留判别性信息。
ZEN(Zero-training Embedding Neighbors):对每个样本的特征,计算其到参考集中最近邻居的距离(如欧氏距离)作为异常分数。由于参考集可能被异常污染,引入soft cleaning:在计算距离时对疑似异常样本降低权重,或迭代更新参考集权重,减轻污染影响。
FOCUS(Fine-tuned One-Class Unsupervised Scoring):在ZEN基础上,利用参考集对TabPFN 进行无监督微调。目标函数基于单类假设,使正常样本特征更紧凑,从而在特征空间中远离潜在异常。微调多个epoch后,对每个epoch提取的特征取平均,以减少过拟合和噪声。最终仍用最近邻距离评分。
输出
输出每个样本的异常分数,分数越高越可能是异常。
与同类方法的差异:不同于直接使用冻结预训练特征或传统表格异常检测器,ZEN/FOCUS 针对参考集污染设计了软清理和无监督微调,能自适应地改善特征空间分离度。
实验
实验设计
在 ADBench 表格异常检测基准上,作者对比两种策略:
- ZEN:使用冻结的 TabPFN 特征,通过特征空间最近邻距离评分,无需训练。
- FOCUS:利用参考集对 TabPFN 进行微调,采用单类无监督评分,并平均多个微调 epoch。 实验覆盖 受污染参考集 与 干净参考集 两种设定,并验证方法对 TabPFN v2 等其他 PFN 模型的迁移性。
关键发现
- ZEN 仅凭冻结特征与最近邻评分,在 ADBench 上的平均 AUROC 即高于所有基线方法。
- FOCUS 通过微调进一步提升了性能。
- 在参考集包含异常样本时,方法仍保持鲁棒性,归因于 软清洗 与 微调 epoch 平均 的设计。
- 方法可迁移至其他 PFN 模型(如 TabPFN v2),具有通用性。
与基线对比的解读
与经典异常检测器相比,ZEN/FOCUS 利用 PFN 的先验数据拟合表示,获得了更强的判别特征;与需要大量调参的深度异常检测器相比,ZEN 无需训练即可部署,FOCUS 仅需在参考集上做轻量微调。更重要的是,在参考集可能被污染的现实场景下,FOCUS 通过软清洗和 epoch 平均有效抑制了异常的影响,使得工程落地更稳健。
行业影响
落地场景
基于 TabPFN 的表异常检测方法 ZEN(冻结特征 + kNN)与 FOCUS(参考集微调)可直接用于金融欺诈检测、工业传感器监控、电商用户行为异常与内容平台流量作弊识别。ZEN 无需训练,适合快速上线;FOCUS 在无标签参考集上自适应微调,提升难例分离。
商业价值
- 降本:替代大量规则引擎与人工审核,减少误报带来的运营开销;
- 降低风险:提高 AUROC,在欺诈交易中更早拦截,减少资金损失;
- 体验提升:减少对正常用户的误杀,例如内容平台减少误判正常创作者。
与现有产品/工作流集成
可将 TabPFN 作为特征提取器插入现有 ML pipeline,输出向量后接 FAISS 近似最近邻索引;FOCUS 微调后导出 ONNX 模型部署为实时评分服务。该方法与 ADBench 基准对比优势明显,可替换 Isolation Forest、KNN 等经典检测器。
具体用例:某在线零售平台在支付环节用 ZEN 对交易特征做实时异常评分,拦截盗刷;某企业服务 SaaS 对用户 API 调用序列做异常检测,识别滥用或账户接管。更多实现见 GitHub。
局限
- **计算开销与扩展性受限**:PFN 模型(TabPFN)推理本身较慢,FOCUS 还需要在参考集上微调,进一步增加训练成本。论文在 Limitations 部分专门列出 Hardware and runtime 与 Scale,表明作者意识到该方法在超大表格数据集(百万级样本、数千特征)上的可行性有限。此外,FOCUS 针对每个参考集单独微调,若参考集频繁更新,重复微调开销高。与经典表格异常检测器(如 Isolation Forest 或基于原始特征的 KNN)相比,计算成本显著更高,限制了在实时检测或资源受限环境中的部署。
- **对参考集污染的鲁棒性仍有风险**:尽管 FOCUS 通过微调目标设计了对污染的抵抗性,但 ZEN(无训练版本)本质上依赖参考集内最近邻距离,若参考集本身混入一定比例异常(实际场景常见),距离评分可能将异常样本误认为正常邻居,导致检测性能下降。论文提出 soft cleaning 缓解,但该步骤依赖阈值或概率裁剪,对污染比例可能敏感,且无法完全消除影响。与一些专门设计为对污染鲁棒的异常检测方法相比,该方法缺少理论保障或严格的污染上界分析。
- **泛化性受限于 PFN 表示能力**:方法建立在 TabPFN 的预训练特征之上,这些特征通过合成先验数据学习,对于真实世界表格数据中可能出现的极端偏态分布、高基数类别特征、缺失值模式或噪声,表示质量可能不稳定。虽然论文展示了在其他 PFN 模型上的迁移(如 TabPFN v2),但根本上受限于 PFN 家族的表征能力。此外,ADBench 基准虽覆盖较广,但多为中小型数据集,对于工业级高维稀疏表格(如用户行为日志、金融交易),该方法的表现缺乏验证,实际效果可能低于基准报告。