TIDES: 选择性状态空间模型中的隐式时间感知
选择性状态空间模型(SSM),如 Mamba,通过把时间离散化步长 TildeΔ 变成输入的学习函数,获得了很强的 per-token 表达能力。但这也使 TildeΔ 不再等于相邻观测之间的物理时间间隔 Δ,限制了模型处理不规则时间序列的能力。连续时间 SSM(如 S5)保持 TildeΔ ≡ Δ,因而能原生处理不规则时间戳,但其动力学仍是线性时不变(LTI),per-token 表达力受限。 TIDES 是一种选择性 SSM 变体,把输入依赖从步长转移到对角状态矩阵,从而统一了选择性架构与连续时间架构。这样,TildeΔ ≡ Δ 与 S5 一致,模型既能原生处理不规则时间戳,又不牺牲让选择性 SSM 有效的 per-token 表达力。 作者还提出新的 Fading Flash 基准:一个紧凑的受控诊断任务,同时检验输入依赖性与对分布外 Δ 值的外推能力,并分离出当前 SOTA 架构各自特有的失败模式,而 TIDES 由构造上即可规避这些失败。 在大规模基准上,TIDES 在 UEA 时间序列分类与 Physiome ODE 回归上取得新的最佳平均排名,并在来自天文、农业、神经形态传感与气候事件的 8 个原生不规则数据集中,于 6 个上匹配或超越参考基线模型。代码见:https://github.com/TaylanSoydan/TIDES 。
论文精读
TL;DR TIDES 将选择性 SSM 的输入依赖从离散化步长迁移到对角状态矩阵,在保留真实时间间隔以处理不规则时间序列的同时,不牺牲 Mamba 类模型的逐 token 表达力。
问题
问题背景
状态空间模型(SSM)近期在序列建模中快速崛起,Mamba 等选择性架构通过让离散化步长 Δ~ 随输入变化,获得了显著的 token 级表达力,在长序列、语言、时间序列等任务上表现突出。
现有方法局限
然而,选择性 SSM 的 Δ~ 不再等于观测点之间的物理时间间隔 Δ,导致模型无法原生处理不规则时间序列(irregular time series)——即采样间隔不均匀的数据。相反,S5 这类连续时间 SSM 保持 Δ~ = Δ,能原生利用真实时间戳,但其动态是线性时不变(LTI)的,缺乏对每个 token 的输入依赖,表达力受限。两类架构形成明显的取舍:要么牺牲时间物理一致性换取表达力,要么保留时间一致性但损失 token 级表达力。
为什么这个问题难/重要
不规则时间序列广泛存在于医疗监护、金融交易、传感器网络、天文观测等场景,业界对能同时处理不规则采样和高表达力的序列模型有迫切需求。难点在于:将输入依赖性从步长 Δ~ 转移到其他参数(如状态矩阵 Λ)时,需要保持数值稳定性、训练效率与离散化的一致性,同时避免破坏对分布外 Δ 的泛化能力。现有方法常在这两个目标间顾此失彼,因此一个既保留物理时间语义、又具备选择性表达力的 SSM 变体具有实际工程价值。
行业类比
类似事件相机(event camera) 或电子健康记录(EHR) 中的不规则采样数据,模型需要同时理解“何时发生了事件”和“事件内容是什么”——单纯依赖输入驱动的离散化相当于丢失了时间戳信息,而固定动态又无法适应不同模式的变化。
核心洞察
- TIDES 通过将输入依赖性从离散化步长 Δ 转移到对角状态矩阵 Λ,构建了同时具备连续时间原语与选择性逐 token 表达力的状态空间模型。之前 Mamba 系模型让 Δ 依赖输入,虽获得强表达力但破坏了 Δ~ 与物理时间间隔 Δ 的等价关系,无法原生处理不规则采样;而 S5 等连续时间 SSM 保持 Δ~≡Δ 却因线性时不变动力系统限制表达力。TIDES 的构造在保留 Δ≡Δ 的同时,将选择机制注入 Λ,从而在架构层面调和了这两类模型的矛盾,避免了事后插值或复杂重采样。
- Fading Flash 实验揭示了当前主流 SSM 的两个独立失败模式:LTI 下 B、C 缺乏输入依赖导致的表达力不足,以及输入依赖 Δ 导致的分布外 Δ 外推失效。TIDES 将输入依赖放在 Λ 上,既引入了状态转移的输入调制,又不干扰时间离散化过程,从而同时躲避两种失败模式。这个诊断基准为选择性连续时间 SSM 的设计提供了清晰判据:时间感知应由物理 Δ 直接承载,而输入选择性应通过状态动力学实现,而不是耦合在步长上。
方法
输入与时间间隔处理
TIDES 接收序列 token 与对应的物理时间差 Δ。与 Mamba 家族不同,离散化步长 Δ̃ 直接设为 Δ,不引入输入依赖,从而原生支持不规则时间戳(类似 S5 的行为)。
关键模块:选择性从 Δ 迁移到 Λ
核心创新是将输入依赖从 Δ̃ 移到对角状态矩阵 Λ 上。具体实现包括:
- 选择性头:通过输入投影生成 Λ 的对角元素,使每个 token 拥有独立的状态转移特性。
- 低秩 B 和 C:限制输入 / 输出投影矩阵的秩,降低参数与计算开销。
- 深度投影器与投影归一化:提升投影表达能力并稳定训练。
- Λ 重参数化:对特征值进行裁剪等约束,确保数值稳定性。
离散化采用零阶保持 (ZOH),但 Δ 固定为观测间隔,因此离散状态转移由输入生成的 Λ 和物理 Δ 共同决定。
输出与架构差异
经 SSM 扫描与投影后,输出可接入线性头用于分类 / 回归。与 Mamba(选择性在 Δ̃,破坏时间一致性)和 S5(Λ 为恒定,牺牲每 token 表达力)相比,TIDES 通过“选择性 Λ + 固定 Δ̃”同时获得不规则时间序列原生支持和强表达力。
实验
实验设计
TIDES 首先在 Fading Flash 诊断基准上验证,该基准联合测试输入依赖性与对分布外 Δ 值的外推能力,能分离当前 SOTA 架构的不同失效模式。随后在 UEA 时间序列分类、Physiome-ODE 回归、随机丢失任务以及 8 个原生不规则数据集(来自天文、农业、神经形态感知和气候事件)上开展大规模评估。
关键发现
在 UEA 与 Physiome-ODE 上 TIDES 取得新的最佳平均排名;在 8 个原生不规则数据集中有 6 个达到或超过参考基线。Fading Flash 结果显示,仅依赖输入改变离散化步长 \tilde{\Delta} 会损害 OOD 外推,而 TIDES 将输入依赖转移到对角状态矩阵 \Lambda 后,同时保留了逐 token 表达力和对不规则时间戳的原生支持。
与基线对比
相比 Mamba 类选择性 SSM,TIDES 不再因 \tilde{\Delta} 偏离物理 \Delta 而限制不规则时间序列处理;相比 S5 等连续时间 LTI SSM,TIDES 通过输入依赖的 \Lambda 与低秩 B,C 克服线性时不变限制。这种构造性差异使 TIDES 在工程上更适合传感器数据、事件序列等原生不规则场景,无需预插值或时间戳归一化。
行业影响
落地场景
TIDES 适合处理原生不规则时间序列的产品:金融风控 (交易流水)、医疗监测 (可穿戴设备)、工业 IoT (传感器异常检测)、电商用户行为 (点击/购买事件流)。对事件驱动、采样间隔不一致的数据,避免插值预处理,直接建模。
商业价值
在 UEA 和 Physiome ODE 基准上平均 rank 第一,模型精度提升直接转化为业务收益。降本方面,去除插值/聚合步骤,减少特征工程成本与信息损失;同时支持 OOD Δ 外推,在分布漂移场景下更稳健,降低重训练成本。
接口集成
TIDES 可作为 SSM 层替换现有序列模型中的 Mamba/S5 模块,嵌入 PyTorch stack。代码已开源 (GitHub),提供与 mamba-ssm 类似的 API。对 S5 用户迁移成本低;对 Mamba 用户,TIDES 增强不规则时间处理能力,适合部署在实时流处理管道。
具体用例:
- 电商用户行为序列:用户点击、加购事件时间间隔非均匀,TIDES 直接建模原始事件流,提升推荐系统的序列特征质量。
- 金融交易风控:市场非交易时段无数据,TIDES 原生处理交易间隔变化,改善欺诈检测模型的鲁棒性。
局限
- - **计算与内存开销**:TIDES 将输入依赖性从标量 `Δ` 转移到 `Λ` 对角矩阵,意味着每个 token 需要计算一个与状态维度 `N` 等长的输入依赖向量,并通过低秩 `B`、`C` 和深投影器进行投影。相比 Mamba 仅学习标量 `Δ_tilde` 的输入依赖,TIDES 的额外选择性头部和低秩分解可能显著增加 FLOPs 与参数量。论文未提供与 Mamba/S5 的详细训练时间与内存对比(附录 I 可能有相关数据但未充分展开),在实际部署到资源受限或长序列场景时,该开销可能限制其应用范围。
- - **实验范围与泛化验证不足**:核心结论主要基于 UEA 时间序列分类与 Physiome-ODE 回归等中等规模任务,以及自建的 Fading Flash 合成诊断基准。虽然 Fading Flash 能分离输入依赖与外推失败模式,但合成数据分布与真实世界复杂不规则时序仍有差距。此外,在 8 个 natively irregular 数据集中仅 6 个达到或超过 baseline,说明 TIDES 并非在所有不规则场景下都占优;缺乏在大规模语言建模、长序列音频或视频等任务上的验证,其对超大规模模型的扩展性仍不明确。
- - **与 selective SSM 的设计取舍**:TIDES 固定 `Δ_tilde = Δ` 以保留物理时间语义,但这也放弃了 Mamba 中自适应步长带来的输入依赖采样灵活性。在某些固定频率但内部动态变化剧烈的序列(如语音、视频)中,学习步长可能比固定物理步长更有效。同时,TIDES 需要显式的时间间隔输入,对缺失时间戳或时间戳噪声的数据预处理要求更高。论文未讨论时间戳不完整或不确定时的鲁棒性,这可能成为其与连续时间 SSM 相比的潜在弱点。