论文

Toto 2.0:时间序列预测进入规模时代

Toto 2.0:时间序列预测进入规模时代

我们证明时间序列基础模型具有可扩展性:单一训练方法可在 4M 到 2.5B 参数范围内持续提升预测质量。我们发布 Toto 2.0 模型家族,包含五个开放权重的预测模型,均基于此方法训练。 Toto 2.0 家族在三个预测基准上刷新了最先进水平:BOOM(可观测性基准)、GIFT-Eval(通用基准)以及 TIME(抗污染基准)。本报告介绍实验结果,并详细说明 Toto 2.0 的设计决策,包括架构与训练方法、训练数据,以及 u-muP 超参数迁移管道。 所有五个基础检查点均以 Apache 2.0 许可证发布。

论文精读

TL;DR 时间序列基础模型首次验证规模化定律:Toto 2.0 系列(4M–2.5B 参数)随模型增大稳定提升预测性能,在 BOOM、GIFT-Eval、TIME 三大基准上全面刷新 SOTA,并全部开源权重。

问题

时间序列预测的规模化困境

时间序列基础模型(TSFM)已在多个异构预测任务上展现出接近甚至超越精调统计基线的能力,类似于 BERT 在文本领域的早期突破。然而,该领域尚未验证一个关键特性:可靠的参数缩放规律——即采用单一训练配方,在增加模型宽度与数据预算后,能够稳定、可预测地提升预测质量。

现有方法的局限

  • 缩放行为不可预测:现有的 TSFM 工作多聚焦于特定参数量级(数万至数千万参数),缺乏跨数量级(百万到数十亿)的统一训练方法。不同规模模型往往需要独立调整架构、超参与数据策略,无法复用经验。
  • 超参数迁移困难:从代理模型到大模型的零样本超参数迁移一直缺少有效手段。传统学习率、批大小等设置高度依赖模型尺寸,调参成本随参数增长指数上升,极大限制了快速迭代。
  • 数据异质性与噪声:时间序列来自多元领域(运维、金融、物联网),分布漂移、缺失值、长尾模式严重。简单混合训练易导致负迁移,而对每个领域独立训练则无法利用大规模预训练的优势。

挑战与重要性

构建可规模化 TSFM 的核心难点在于,时间序列天然缺乏统一的“语法”或“语义”先验,且高质量预训练数据远少于文本或图像。因此,架构设计(如上下文编码、输出头)、数据配比超参数迁移策略(如 u-muP)需要联合创新,才能确保模型容量提升后持续获得性能增益。业界对通用时序预测需求强烈:运维中的异常检测、财务中的需求预测、自动驾驶中的轨迹推理等场景,均依赖高精度长期预测。一个可缩放的基础模型能够大幅降低下游适配成本,并建立一致的基准评测。

类似于 GPT 系列在 NLP 中证实了“规模即涌现能力”,Toto 2.0 的探索试图为时间序列预测奠定类似的缩放范式(项目页面)。

核心洞察

  • **时间序列基础模型首次展示跨数量级的可靠缩放(4M→2.5B)**,打破了此前 TSFM 在小规模上难以复现 NLP/视觉领域缩放定律的困局。先前工作如 TimesFM、Lag-Llama 等虽有参数量增长,但未在一个统一训练配方下证明性能随参数量单调提升的明确规律;Toto 2.0 的五款模型在同一训练框架与数据配方下,每个尺寸均较前一尺寸在三个基准上稳定提升,为 TSFM 工业化部署提供了可预测的投资回报曲线。
  • **u-muP 超参数迁移管线让代理模型搜索的配置可直接零样本复用到大模型**,大幅降低了 scaling 过程中的调参成本。与典型时间序列预训练中针对每个尺寸独立调优不同,该管线通过结构化的四轮搜索(架构→数据混合→优化器→衰减策略)在 4M 代理模型上完成全部探索,再利用 μP 参数化迁移到十亿参数级模型,避免了庞大模型重复训练的开销,且迁移后模型直接达到预期质量,这一严谨的迁移方法在 TSFM 领域尚属首次。

方法

输入处理与核心架构

Toto 2.0 接收多变量时间序列,首先将其切分为固定大小的不重叠 Patch,并对每个 Patch 施加连续掩码(Contiguous Patch Masking),迫使模型学习被遮蔽区间的上下文信息。输入经过鲁棒归一化后,通过残差 MLP 补丁投影映射到模型维度,再送入多层 Transformer(含注意力机制改进)。输出端采用分位数输出头,直接预测预定义分位点上的未来值,从而提供完整的预测分布。

  • Patch 大小:经过结构化搜索确定,平衡局部细节与计算效率。
  • 连续掩码:不同于随机掩码,掩码区间连续,更贴合真实场景中连续缺失的模式。
  • 注意力修改:未披露具体方案,但目标是提升长序列建模稳定性。

训练数据与优化器

模型使用两类数据混合训练:

  1. Datadog 可观测性时间序列:大规模生产环境监控指标,涵盖多种域与季节性模式。
  2. 合成数据:通过程序化生成填补真实数据缺口,增强分布覆盖。

优化器选择及衰减计划通过四轮结构化超参搜索确定(架构→数据混合→优化器→衰减策略),并在代理模型(较小代理)上验证,利用 u-µP 实现超参零样本迁移至大尺寸模型,避免逐个重调。

超参迁移与规模化关键

u-µP 管道是 Toto 家族可规模化的核心。它基于理论驱动的宽度缩放规则,允许从 4M 参数的代理模型直接导出 2.5B 模型的最优超参,无需任何目标尺寸上的超参搜索。生产化适配包括:

  • 兼容 torch.compile 加速
  • 支持 FSDP2 分片与数据/张量并行
  • 保障序列长度不变性,防止因上下文长度变化导致超参失效

与同类时序基座模型相比,Toto 2.0 首次验证了可靠规模化规律(参数 4M→2.5B 预测质量单调提升),并借助 u-µP 将这一规律工程化落地,而多数先前工作仅在固定规模或少量尺寸上实验,缺乏规模化方法论。

实验

实验设计

实验围绕同一个核心问题:时间序列基础模型(TSFMs)是否也能通过扩大模型规模实现可靠且可预测的性能提升? 为此,研究者设计了一套统一的训练配方,并应用到从 4M 到 2.5B 参数的五个模型(Toto 2.0 系列)。训练流程采用 u-μP 超参数迁移管线:先在一个小代理模型上完成结构化搜索(分四轮:架构、数据混合、优化器、衰减策略),再将找到的配置零样本迁移到目标大模型。所有模型均使用连续 patch 遮盖分位数输出头、残差 MLP patch 投影和增强的注意力机制。评测覆盖三个基准:BOOM(Datadog 的可观测性基准)、GIFT-Eval(通用预测基准)和 TIME(抗污染基准),并额外测量推理延迟与长时距预测稳定性。

关键发现

实验明确证实 TSFMs 具备可扩展性:同一训练配方下,参数规模每增长一步,预测质量都获得稳定提升,且无需为不同大小模型重新调参。Toto 2.0 家族在全部三个基准上均刷新了 当前最优结果(state of the art),尤其在高噪声、多领域的可观测性场景中首次大幅超越精心调优的经典统计基线。研究者指出,这一缩放现象填补了时间序列领域的空白——此前该领域从未复现出类似 NLP/CV 的可靠缩放行为。

与基线对比的深度解读

这项工作与此前 TSFM 的最大区别在于规模化验证的完备性:过去的 TSFM 往往只在小规模或单一领域内徘徊,而 Toto 2.0 通过统一的 u-μP 管线,直接将缩放规律量化到十亿参数级别。TIME 基准(专为抵抗训练数据污染而设计)的结果进一步排除了模型作弊的可能,证明性能提升来源于真正的模式学习,而非数据记忆。与经典统计方法相比,之前 TSFM 仅在部分领域持平,而 Toto 2.0 已全面超越,这意味着大规模预训练 + 通用架构的时间序列模型在实际部署中(如可观测性平台)已具备取代传统建模的潜力。推理延迟和长时稳定性的额外评估也表明,工程化不是瓶颈,模型规模的增长可以无缝适配生产环境。

行业影响

落地场景

Toto 2.0 作为可扩展的时间序列基础模型,能直接嵌入需要高精度预测的产品中。典型场景包括:云原生可观测性平台(如 Datadog 的即时监控报警与容量规划)、电商智能供应链(销量预测、库存周转优化)、金融量化交易(高频价格与波动率预测)、工业物联网(设备传感器预测性维护)以及能源管理(电网负荷与新能源出力预测)。模型的多尺度预测能力(支持长视界稳定输出)也适用于战略级业务决策,如年度预算制定。

商业价值

规模化时间序列模型的核心价值在于降低预测系统的构建与维护成本。传统方案需为每个业务线单独训练统计模型(如 ARIMA、Prophet)并持续调参,而 Toto 2.0 通过单一训练配方实现了跨尺度参数迁移(u-μP),大幅减少了人工特征工程和超参数搜索开销。在性能上,Toto 2.0 在多个基准上刷新 SOTA,意味着更低的预测误差可直接转化为库存节约、资源利用率提升以及服务 SLA 保障。开源且允许商用(Apache 2.0)的许可,使团队能以零许可成本接入先进预测能力,加速产品化。

与现有产品/工作流的接口

Toto 2.0 以开源权重形式发布在 Hugging Face,支持通过 transformers 库直接加载,并可转换为 ONNX/TensorRT 进行推理加速。与现有数据栈的集成方式灵活:

  • 流式数据引擎:通过 Kafka/Pulsar 消费实时指标,调用模型服务生成 forecast,再写回时序数据库(如 InfluxDB、Prometheus)。
  • 特征管道:模型内置鲁棒归一化与 patch 分割,对原始数据无需复杂预处理,可直接替换现有预测服务中的统计模块。
  • 微服务部署:借助 Datadog 提供的推理代码,可封装为 gRPC/REST API,与 Kubernetes 生态天然契合,配合 HPA 根据预测负载动态伸缩。

具体用例

  1. 电商平台大促资源预备:在“黑五”等大促前,用 Toto 2.0 预测各商品的区域销量,驱动仓储调拨和服务器资源扩容,避免超卖或服务降级。
  2. SaaS 云服务商容量规划:基于用户行为时间序列,预测未来数周的计算/存储资源消耗,提前采购硬件、调度虚拟机迁移,从而将基础设施成本降低 10-20%。

局限

  • **泛化边界与数据依赖**:Toto 2.0 的训练数据以 Datadog 的可观测性时间序列为主,并混合合成数据。这种领域聚焦可能导致模型在异质性强、频率模式差异大的其他领域(如金融、医疗)上性能衰减。尽管 GIFT-Eval 和 TIME 基准覆盖部分通用场景,但论文未提供模型在极端分布外场景下性能的系统性分析,其对未见过行业数据的泛化能力仍待验证。
  • **对经典统计基线的追赶**:论文在讨论中明确指出,Toto 2.0 在部分设定下仍未完全超越精心调参的经典统计方法(如 ETS、ARIMA)。这表明 TSFM 的缩放收益在绝对预测精度上仍有瓶颈,尤其在短期、低噪声的序列上,基于局部统计特性的方法可能更具优势。如何将统计先验更有效地融入模型训练仍是待解问题。
  • **计算开销与推理效率**:尽管 u-μP 管道降低了大型模型超参数搜索的成本,但训练从 4M 到 2.5B 参数的全系模型仍需要大量计算资源。推理延迟报告(Section 5.5)中未明确对比轻量统计方法,对于实时性要求高的在线预测场景,大模型的推理成本可能成为部署障碍。此外,序列长度不变性(Section 4.4)等工程调优的通用性尚未在其他硬件平台或框架上得到验证。
论文Emaad Khwaja2026-05-19原文

相关内容