SAGA: 一种用于多水平概率预测的序列自适应生成架构,结合自适应时序共形预测
财政部和中央银行使用的微观模拟模型依赖终身收入的参数化过程,仅捕捉条件分布的一阶和二阶矩,遗漏了长期非线性结构。我们提出 SAGA——一种用于不规则表格面板序列的解码器专用 Transformer,并配以 分裂共形校准 包装器,提供具有有限样本边际覆盖保证的个体级预测区间。 模型在 1990 年至 2022 年的瑞典 LISA 纵向登记数据上训练,包含 2,143,817 个体和 61,284,903 人年,预测 1 至 30 年范围内的年度劳动收入,并通过 蒙特卡洛聚合 得到折现后的终身收入分布。与经典的 Guvenen, Karahan, Ozkan 和 Song 参数过程及表格和循环基线相比,SAGA 在 10 年水平上将 连续排名概率评分 降低 31.9%,在 20 年水平上将 平均绝对误差 降低 37.7%。共形区间在边际上达到标称覆盖误差小于 0.4 个百分点,在最差情况的人口统计子组内误差小于 2.4 个百分点。重建的终身收入基尼系数为 0.327,而部分观测的真实值为 0.341,GKOS 估计值为 0.378。 模型权重、校准表以及合成等效数据集已发布,供在受保护的 SCB MONA 环境外进行复制。
论文精读
TL;DR SAGA 用 decoder-only transformer 建模不规则面板序列,配 split conformal 校准,在瑞典终身收入预测上 CRPS 降 31.9%,预测区间几乎完美覆盖。
问题
问题背景
微观模拟模型(Microsimulation Models)被财政部门和中央银行广泛用于评估税收、养老金等政策的长期效应。其核心组件之一是终身收入过程(lifetime earnings process),直接影响政策模拟的可靠性。
现有方法局限
当前主流采用 Guvenen 等人(GKOS)参数化框架,它仅对条件分布的一阶和二阶矩建模,假设残差服从简单随机过程。这导致:
- 无法捕捉非线性长程依赖:真实收入序列存在高阶自相关、异方差性和分布不对称,参数化方法对此建模不足。
- 序列不规则性被忽略:实际面板数据常包含缺失年份或非等间隔观测,传统方法需插值到规则网格,引入偏差。
- 预测不确定性量化缺失:仅提供点估计或过度简化的置信区间,无法为个体决策(如退休储蓄)提供校准的概率判断。
为什么这个问题难 / 重要
- 技术挑战三重叠加:需同时处理(1)长达 30 步的多步概率预测,(2)高度不规则的表格面板序列(3)个体级别的有限样本校准保证(marginal coverage)。普通 Transformer 难以直接处理此类混合长度、混合频率的异构输入。
- 业界关注度:精准的终身收入分布预测直接影响宏观经济模型(如代际核算、养老金可持续性)的可信度。政策制定者需要可靠的异质性效应评估,而不仅仅是平均效应。错误的预测区间可能导致公共资源的巨大错配。
行业类比
类似 个性化患者健康轨迹预测,电子健康记录(EHR)同样面临不规则时序和长期风险预测问题,需要模型既能估计未来多种可能路径,又能提供个体特定的置信区间。
核心洞察
- SAGA 通过为不规则表格面板序列设计的 decoder-only transformer,直接建模长程非线性依赖,突破了传统参数收入过程仅捕获一阶与二阶矩的局限。该架构将纵向观测视为 token 序列,自适应处理缺失与不规则间隔,相较 GKOS 等参数方法及表格型、循环基线,在 1–30 年多步预测上大幅降低 CRPS 与 MAE,表明捕捉更丰富的条件分布对长期收入预测至关重要。
- 引入 split conformal calibration 使个体预测区间获得有限样本边际覆盖保证,且最差人口子组的覆盖误差仅 2.4 个百分点。这对政策微观模拟特别有价值:传统模型无法校准不确定性,而 SAGA 的保形包裹不仅输出点预测,还提供可靠的概率区间,使税收、养老等下游任务能直接使用校准后的个体风险度量。
方法
SAGA 的方法链路遵循 “不规则面板序列 token 化 → 自回归 decoder-only Transformer → 分布预测 → 蒙特卡洛聚合与共形校准” 的路径。
输入与 Token 化
- 输入为纵向个体面板数据(如年龄、教育水平、历史收入),时间点间隔不规则,且存在缺失值。
- Tokenization of Irregular Tabular Sequences 模块将每个时间点的多维特征编码为固定长度的 token,并注入时间位置编码,使模型感知观测之间的实际时间差。
核心架构
- 使用 decoder-only Transformer,自回归地预测未来每一年的收入分布。
- 训练时,模型被要求输出一个概率分布(而非点估计),损失函数直接优化 Continuous Ranked Probability Score (CRPS),从而捕捉完整的条件分布,而不限于均值和方差。
- 推理时,对每个未来时间步,模型基于自身先前生成的预测和已知历史,逐步生成多条可能轨迹。
输出与后处理
- 模型可生成 1 到 30 年的年度收入预测。
- 利用 蒙特卡洛采样,将每年的收入分布聚合为生命周期收入现值的分布,进而计算个体的预期终身收入、基尼系数等统计量。
- Split Conformal Calibration 作为外部校准包装器:在保留的校准集上计算非符合性分数,为个体预测区间提供有限样本边际覆盖保证,确保区间覆盖概率接近名义水平(偏差 < 0.4 个百分点)。
与同类方法的差异
传统参数方法(如 GKOS 过程)仅拟合条件均值与方差,丢失长程非线性结构;SAGA 通过 非参数 transformer + CRPS 训练 + 共形校准,在捕捉复杂依赖的同时提供严格的不确定性量化,并在实际数据上大幅提升概率预测精度。
实验
实验设计
- 数据:使用瑞典LISA行政登记面板数据,覆盖1990–2022年,共214万个体、6129万人员年,预测1–30年期的年度劳动收入。
- 模型:SAGA为专为不规则表格序列设计的decoder-only transformer,结合split conformal calibration生成个体级预测区间,再通过Monte Carlo聚合为终身收入分布。
- 基线:对比经典参数模型GKOS、表格模型及循环神经网络基线,评估指标包括CRPS、MAE、校准误差及终身收入Gini系数。
关键发现
- 长时序预测精度大幅提升:在10年期CRPS降低31.9%,20年期MAE降低37.7%,表明SAGA捕获了参数模型忽略的长程非线性结构。
- 可靠的不确定性量化:split conformal校准使边际覆盖率偏离名义值仅0.4个百分点,即使在最差人口子组偏差也仅2.4个百分点。
- 终身收入分布更贴近现实:SAGA重建的终身收入Gini系数为0.327,接近观测到的0.341,而GKOS高估至0.378,证实非参数生成式架构的优越性。
与基线的深度对比
- vs GKOS:GKOS仅建模条件分布的一二阶矩,无法捕捉长期依赖与非正态性,导致CRPS和MAE显著落后,且终身收入不平等估计偏误。
- vs 其他DL基线:SAGA的tokenization策略与decoder-only设计更适配不规则面板数据,通过自适应时序注意力避免传统循环模型的长程遗忘问题。
- 工程启示:若微模拟系统需强分布外推与个体不确定性,应优先考虑transformer+保形推理组合,而非依赖简单参数假设。数据安全要求下,论文公开了模型权重与合成数据集,便于复现。
行业影响
落地场景
SAGA 将 decoder-only transformer 扩展到不规则表格面板序列 (irregular tabular panel sequences),并搭配 split conformal calibration 输出具有有限样本覆盖保证的预测区间。该技术可直接迁移至任何需要长周期、多步概率预测且重视不确定性量化的业务场景,例如:
- 金融风控与保险精算:建模个人或企业的长期收入 / 信用轨迹,生成带有置信区间的风险评分。
- 供应链与零售需求预测:对 SKU 未来数月甚至数年的销量进行概率预测,支持库存优化与促销决策。
- 医疗健康管理:预测患者长期健康支出或病情演化轨迹,辅助个性化干预与保险定价。
商业价值
- 降本增效:替代传统参数化精算模型,减少人工特征工程与重训练成本;conformal calibration 作为轻量后处理步骤,无需修改主模型即可提供可靠性保证。
- 增收与风险控制:更精准的长期预测区间可帮助金融机构优化定价、计提准备金;供应链企业可减少缺货与库存积压。
- 体验提升:为用户(如理财顾问、患者端)提供可解释的预测范围,增强决策信心。
与现有产品 / 工作流的接口
SAGA 可封装为 概率预测微服务,通过 REST/gRPC 接入现有数据流水线:
- 数据预处理阶段将业务数据转为成对 (特征, 观测窗口) 的 token 序列。
- 推理输出为分布参数与 conformal 校准后的分位数,可直接写入决策引擎或 BI 看板。
- 模型管理可对接 MLflow 或 Kubeflow,校准表兼容任何支持分位数输出的预测器。
具体落地 Use Case
- 跨国电商平台销量预测:利用历史销售、促销、节假日等不规则面板数据,预测未来 1-12 个月的单品销量分布。conformal 区间帮助采购团队在置信度 90% 下制定安全库存,替代现有点估计方法,降低滞销风险。
- 全球医疗保险赔付预测:基于会员过往就诊、用药记录,预测未来 5 年的医疗费用分布,并输出个人级别的预测区间。精算部门可直接将该区间用于动态保费调整,确保赔付率可控的同时改善会员健康管理体验。
局限
- **数据依赖与可推广性受限**:模型在瑞典 **LISA** 行政登记数据上训练,数据覆盖 1990–2022 年,虽样本量大,但社会经济结构、税收政策、劳动力市场特征等高度地域特定,直接迁移至其他国家或时期可能失效。论文配套的合成数据虽便于复现,但难以完全保留原始分布中的长尾依赖与异质性,外推风险未量化。
- **计算开销较高**:SAGA 采用 **decoder-only transformer** 处理不规则面板序列,多步预测结合 **Monte Carlo** 聚合生成终身收入分布,推断时需大量前向传播。论文虽提及计算成本,但未给出与轻量参数方法的效率对比,可能限制其在实时政策模拟或资源受限环境中的部署。
- **自适应 conformal calibration 的子群体覆盖率偏差**:尽管边际覆盖率接近名义水平,但最差子群体的覆盖率偏差达 2.4 个百分点,表明在特定人口统计组上预测区间过窄或过宽。论文未深入分析导致覆盖不足的子群体特征及自适应权重分配的稳定性,可能影响公平性关键应用(如税收模拟)中的决策可靠性。