论文

时间序列基础模型中的预测崩溃

时间序列基础模型中的预测崩溃

在预测 1,000 只美国股票的每小时收益率时,我们观察到一个意外现象:预测结果变得几乎平坦,且股票排序能力极差(以横截面相关性衡量)。我们将此称为预测崩溃。令人惊讶的是,在相同设置下预测交易量时,该现象基本消失。我们对时间序列基础模型 (TSFMs)、12 个深度学习预测模型和 97 个公开基准配置进行了系统研究,发现预测崩溃与目标可预测性密切相关。 我们识别出两个不同的成因:低可预测性限制了校准点预测的幅度,而逐序列目标 (per-series objectives) 忽略了跨序列结构。这些发现揭示了一种校准-排名权衡:优化平方误差会导致预测平坦,而直接优化横截面相关性虽可提升排序,却可能将预测幅度放大一个数量级以上。 为解决这一权衡,我们提出了 CalibRank,一个同时兼顾校准与排名的简单目标函数。在 Finance1K 数据集上,CalibRank 使横截面相关性提高了近三倍,同时保持预测幅度接近真实目标,并在所有测试模型上一致提升了相关性。 我们的结果揭示了传统时间序列评估中的一个盲点:逐序列指标可能掩盖下游决策所需的跨序列结构的失败。

论文精读

TL;DR **预测坍缩**:时序基础模型预测股票收益时预测值趋于平坦;本文揭示低可预测性与逐序列目标导致**校准-排序冲突**,提出 **CalibRank** 平衡二者,显著提升截面相关性。

问题

时间序列基础模型(TSFM)如 TimesFM、Chronos、Lag-Llama 等在多领域预测中受到关注,但评估主要聚焦于逐序列误差指标,如 MSE、MAE。这些指标衡量单条序列的拟合质量,却无法反映模型是否捕捉到多条序列之间的相对结构。

现有方法的局限在于:训练目标通常为 per-series squared error,导致在低可预测性序列上输出近乎平坦的预测,因为模型为最小化误差会收缩振幅;同时逐序列优化不共享跨序列信息,使得横截面排序结构未被识别。论文发现预测股票小时收益时出现 forecast collapse:预测接近常数,横截面相关系数极低,但预测成交量时该现象大幅消失,说明与目标的 predictability 高度相关。

这个问题难且重要,因为许多下游决策依赖横截面排序(如资产配置、选股、风险排序),而单序列指标无法暴露这种结构缺失。金融时间序列信噪比低,校准良好的点预测倾向于向均值收缩,与保持排序信号之间存在根本张力,论文称之为 calibration-ranking tradeoff,并指出当前时间序列评估体系中的一个盲点。

行业类比:这与推荐系统中 点击率预估校准良好但排序质量差 的问题类似——模型输出的概率估计准确,却无法区分用户对不同物品的偏好次序,导致真实业务指标下降。

核心洞察

  • 预测塌缩(forecast collapse)是时间序列基础模型在低可预测性目标(如股票回报)上输出近乎平坦预测、丧失横截面排序能力的现象。与以往仅关注 per-series 误差(如 MSE)的评估不同,该工作揭示了 per-series loss 无法识别跨序列结构,导致校准与排序之间的内在冲突,这对依赖横截面相对比较的下游任务(如选股、组合构建)是根本性盲点。
  • CalibRank 通过显式优化横截面相关性并约束预测幅度,提供了一种可落地的损失函数修正方案。相比直接使用 MSE 或单纯最大化 rank correlation,CalibRank 在保持校准的同时显著提升排序能力,缓解了幅度膨胀问题。这为金融时序预测等需要同时兼顾点预测精度与相对排序的场景提供了新的训练目标,并提示基础模型可能需要加入跨序列约束。

方法

输入

  • 多维时间序列数据(如 Finance1K 中 1000 只股票的小时收益),各序列独立建模,模型输出逐点预测值。

关键模块:CalibRank 目标

  1. 校准项:保留传统的逐序列平方误差(MSE)或类似损失,确保每个序列的预测幅度与真实值接近,防止过度缩放。
  2. 排名项:对每个时间点,计算预测向量与真实向量之间的横截面相关性(如 Pearson 相关系数或秩相关),直接优化排序准确性,弥补逐序列损失对跨序列结构的忽视。
  3. 平衡机制:引入可调超参数 λ 将两项损失加权求和,通过联合优化实现校准与排名的平衡。

输出

  • 模型输出校准后的预测,幅度接近真实目标,同时在横截面上与真实排序高度相关,避免预测塌缩或幅度膨胀。

论文在 Finance1K 上验证,CalibRank 在所有测试模型中提升横截面相关性,并保持幅度合理。

与同类方法的差异点:单一逐序列 MSE 导致平坦预测,纯横截面相关优化又会使幅度失控,CalibRank 通过显式联合优化两项,在两者间取得可控折中。

实验

实验设计

实验在 Finance1K 数据集(1,000 只美股的小时收益与交易量)上展开,覆盖多类 时间序列基础模型 (TSFMs)、12 个深度学习预测模型和 97 个公开基准配置。对比了三类优化目标:传统 per-series 平方误差、直接优化 横截面相关性、以及新提出的 CalibRank 平衡目标。核心指标为 横截面相关性 和 预测幅度 与目标值的偏差。

关键发现

  • 预测崩塌:小时收益预测近乎平坦,横截面相关性极低;但同一设置下交易量预测未出现此现象。
  • 崩塌与 目标可预测性 强相关:低可预测性限制校准点预测的幅度,而 per-series 目标忽略跨序列结构。
  • 存在 校准-排序权衡:优化平方误差导致平坦预测;直接优化相关性改善排序,但幅度膨胀超过一个数量级。
  • CalibRank 在 Finance1K 上将横截面相关性提升近 3 倍,幅度接近目标,且在测试的所有模型上均改善相关性。

基线对比解读

传统 per-series 指标(如 MSE)无法捕捉下游决策所需的跨序列结构,这在资产排序和组合构建中尤为关键。直接优化横截面相关性虽能改善排序,但缺乏幅度约束,导致预测值严重偏离实际量纲。CalibRank 通过显式平衡校准和排序,在保持可用幅度的同时恢复排序能力,为金融时序预测提供了更可靠信号。该工作也提示:通用时间序列评估应引入跨序列结构指标,避免单序列指标良好但整体结构失效的盲点。

行业影响

落地场景

时序基础模型(TSFM)在金融、零售、供应链、能源与广告等场景已用于点预测与概率预测。本文揭示的预测崩溃现象直接影响需要跨实体比较的决策:例如股票收益排序、商品需求横向对比、区域电力负荷调度。CalibRank 可用于股票多因子选股、电商 SKU 库存优先级、广告预算分配等需要截面排序的业务。

商业价值

传统 per-series 损失(如 MSE)会优化出平坦预测,导致下游排序决策失效。CalibRank 在保持振幅校准的同时提升截面相关性,可显著降低错配成本:对金融场景,减少错误买卖信号带来的资金损耗;对零售/供应链,避免将资源错配到低价值实体。该目标函数可直接替换或混合现有训练损失,无需额外推理开销,属于低成本高回报的模型改进。

与现有产品/工作流的集成

  • 训练侧:将 CalibRank 作为辅助损失加入 TSFM 微调阶段,与 MSE/QL 等校准损失加权组合;
  • 评估侧:在现有回测流水线中增加截面相关性指标,避免只看 per-series 误差而漏掉排序失败;
  • 后处理:对已部署模型,可用轻量级排序校准层(如 Platt scaling 变体)修正输出,无需重训基础模型。

真实行业用例

  1. 金融资管:多因子模型输出 1000 只股票收益预测,使用 CalibRank 提升横截面相关性,直接改善组合构建中的股票排序与权重分配。
  2. 电商平台:预测数千 SKU 未来一周销量,若模型输出趋于均值,则无法区分爆品与滞销品;CalibRank 可恢复销量排序,优化库存补货与促销资源投放。

局限

  • **实验范围局限于金融数据**:本文的主要实证发现基于 `Finance1K`(1,000 只美股的小时收益率与成交量),并部分扩展到 97 个公共基准配置。虽然作者在多个时序基础模型(TSFMs)和 12 个深度学习模型上验证了 **forecast collapse** 现象,但该现象是否在非金融领域(如能源、交通、天气)同样普遍存在,尚缺乏系统验证。尤其是低可预测性导致的校准幅度收缩,可能与金融收益率的低信噪比特有相关;其他领域的目标变量可预测性分布不同,可能改变结论的普适性。此外,跨序列结构的重要性在金融截面选股中尤为突出,但其他时序应用(如单序列需求预测)可能并不需要截面排名,因此 **CalibRank** 的适用场景有待进一步界定。
  • **CalibRank 的实际部署成本与泛化性未充分讨论**:论文提出了一个简单的目标函数平衡 **校准** 与 **排名**,并在部分模型上展示了相关性提升。然而,该方法需要额外的超参数(权衡系数)调优,文中未给出系统的敏感性分析或自适应选择策略。在实际生产环境中,不同资产池、不同预测频率下的最优权衡可能显著不同,如何低成本地确定系数是一个未解决的问题。并且,CalibRank 直接优化截面相关性,可能对极端值更敏感,导致个别序列的预测幅度异常增大(作者也承认幅度膨胀超过一个数量级),这在风险控制严格的金融决策中可能带来额外约束。
  • **理论分析相对薄弱,机制阐释有待深化**:作者将 forecast collapse 归因于低可预测性限制校准幅度和 per-series 目标不识别跨序列结构,这一归因基于实验观察和相关性分析,但缺乏严格的理论证明。例如,为什么低可预测性必然导致校准点预测的幅度收缩?是否存在一个临界可预测性水平?per-series 目标下,不同模型结构(如 Transformer vs. 线性模型)对跨序列信息丢失的程度是否相同?这些问题没有被形式化建模。与一些同期工作(如直接建模协方差结构或使用排名损失)相比,本文的机制分析仍处于现象学层面,可能限制了后续理论改进的方向。
论文Shu Wan2026-08-14原文

相关内容