面向长序列建模的分数阶状态空间转移
状态空间模型(SSMs)将序列历史压缩进有界的循环状态,因此所得的记忆规律成为决定长上下文性能的核心架构选择。然而多数现代 SSM 依赖基于 ODE 的动力学,导致指数遗忘,难以在宽泛的时间范围内保留信息。 为此,我们提出 FRAC:一种源自分数阶动力学的选择性 SSM 架构,用幂律长记忆替代指数衰减。为让分数阶动力学真正可用,FRAC 用一个有限状态、对数间隔的指数模式之和去近似重尾目标核;这一构造把分数阶记忆转化为高效的循环模块,既支持并行训练与 prefill,又保留有界状态下的自回归解码。 实验方面,包括 1.3B 参数语言建模在内的广泛评测显示,FRAC 在长上下文任务上持续优于当前最优的 SSM 基线,同时在短上下文上保持竞争力。这些结果表明,分数阶动力学为长上下文 SSM 提供了一种实用且有效的先验。
论文精读
TL;DR FRAC 通过分数阶动力学将 SSM 的指数遗忘替换为幂律长记忆,用有限状态对数间隔指数模式近似,在 1.3B 参数语言模型上超越 SOTA 长上下文性能,同时保持高效训练与解码。
问题
问题背景
长序列建模是当前序列模型的核心方向,Transformer 的二次复杂度促使研究者转向状态空间模型 (SSMs) 等线性复杂度架构。SSM 将历史序列压缩为有界的循环状态,其记忆衰减规律直接决定长上下文性能。
现有方法局限
大多数现代 SSM(如 Mamba 系列)基于常微分方程 (ODE) 动态,状态转移遵循指数衰减。这种衰减在时间上快速下降,导致模型遗忘远期信息。即使引入选择性机制(输入依赖的门控)来调整衰减速率,基础衰减函数仍然是指数族,无法表达幂律长记忆。有限的归纳偏置限制了模型在宽时间跨度 上的信息保留,长程依赖常常被过早丢弃。
为什么这个问题难/重要
实现分数阶动态的难点在于:把理论上的 heavy-tailed 核(如 Mittag-Leffler 函数)转化为有限状态、可并行训练的循环模块。直接计算分数阶微分涉及非局部算子,存储和计算开销难以接受。工业界对长上下文建模需求迫切(文档理解、代码库推理、多轮对话),而现有 SSM 在长程检索和关联任务上表现受限,需要新的先验来改善记忆保留。
行业类比
类似推荐系统中需要记住用户长期兴趣的场景:指数衰减只保留近期行为,难以捕捉历史偏好;幂律记忆则能更自然地保留早期关键信号,这与 FRAC 引入的分数阶先验直接对应。
核心洞察
- **用分数阶动力学替换指数遗忘,引入幂律长记忆**:FRAC 将 SSM 的状态转移从 ODE 改为 Caputo 分数阶微分方程,使记忆核从指数衰减变为幂律衰减。与 Mamba、S4 等基于 ODE 的模型相比,指数遗忘会导致远距离信息快速消失,而分数阶动力学的长记忆特性更符合自然语言和 DNA 等长程依赖场景,为 SSM 提供了更合适的先验。这一理论动机直接针对现代 SSM 的核心局限。
- **有限状态的对数间隔指数和近似使分数阶记忆高效可训练**:直接计算分数阶核涉及 Mittag-Leffler 函数或无限维状态,难以实用。FRAC 将目标核近似为 log-spaced 的有限项指数和,将其转化为一个带有多个衰减模式的循环状态,既保留了幂律长记忆,又实现并行训练和定长状态自回归解码。在 1.3B 参数语言模型上,长上下文 Recall-Retrieval 等任务优于 SOTA SSM,证明该近似不仅数学可行,而且工程上可扩展。
方法
输入与整体设计
- 输入序列经过嵌入后进入 FRAC 层,层内以选择性状态空间机制处理。
关键模块
- 有限 SoE 核到记忆库:FRAC 用对数间隔的一组指数衰减模态之和逼近分数阶动力学的重尾核(幂律衰减)。每个模态对应一个记忆槽位,构成有限的递归状态,避免无限维表示。
- Frac 状态转移:在每个时间步,各记忆槽位按自身时间常数更新,并通过输入依赖的选择性门控(类似 Mamba)调节写入强度。状态转移不再单一指数遗忘,而是混合不同衰减速率,实现跨时间尺度的信息保留。
- Frac 层:将上述状态转移封装为可并行训练的模块。训练时利用卷积或关联扫描展开多个指数模态,推理时以有界状态自回归解码,计算成本与状态数线性相关。
输出
- 输出为状态经线性投影后的序列表示,可用于下一层或预测头。
与同类方法的差异:标准 SSM(如 Mamba)源自常微分方程,记忆核为单一指数衰减;FRAC 通过分数阶动力学的多指数和近似实现幂律长记忆,以可控的状态维度获得更丰富的时域覆盖。
实验
实验设计
FRAC 的验证覆盖三层:
- 合成基准:Heavy Tail Probing 与 MADLab,直接检验模型对幂律长记忆 / 长距离依赖的建模能力。
- 语言建模:在 1.3B 参数 规模上进行预训练与评估,使用 LM Harness 和 Recall-Retrieval 任务考察长上下文性能。
- DNA 建模:在长基因序列上验证跨领域泛化。
关键发现
- FRAC 在长上下文任务上 一致优于 SOTA SSM 基线,同时短上下文保持竞争力。
- 将 heavy-tailed 核近似为有限状态、log-spaced 指数模态和,使 FRAC 具备并行训练 / 预填与有界状态自回归解码,无需牺牲效率。
- 1.3B 实验表明分数阶动力学的记忆先验可转化为实际长上下文提升。
与基线对比解读
传统 SSM 基于 ODE 的指数遗忘,导致记忆窗口受限;FRAC 用分数阶微分方程引入 幂律衰减,记忆范围更广。实现上,FRAC 不是直接数值求解分数阶 ODE,而是通过 有限 SoE 近似 将 heavy-tailed kernel 变为可训练的 recurrent 模块,与 Mamba 等选择性 SSM 保持相同计算形式,但记忆性质不同。这种“先验改进 + 工程可部署”的组合,是 FRAC 相比纯架构改动更具实用价值的原因。
行业影响
落地场景
FRAC 的核心是 power-law 长记忆 替代 指数遗忘,天然适合以下产品与业务:
- 长文档理解:法律合同、财报、技术手册的摘要与问答,需要跨越数万 token 的上下文关联。
- 长视频分析:内容平台对几小时视频做章节划分、事件检索,要求对早期画面保持有效记忆。
- 生物序列建模:DNA / 蛋白质序列的 motif 发现与功能预测,长程依赖是关键。
- 金融时间序列:高频交易或宏观指标预测中,历史极远事件仍可能产生幂律影响。
商业价值
主要落在 降本 与 体验提升 两条线:
- 降本:FRAC 保持 bounded-state 循环解码,相比 Transformer 的 KV-cache 随序列线性增长,推理内存与延迟显著降低;1.3B 规模实验证明可替代现有 SSM 基线,无需重构训练栈。
- 体验提升:长上下文任务上一致优于 SOTA SSM(如 Mamba),能让产品回答更精准、召回更完整,直接提升用户留存与付费意愿。
与现有产品/工作流的接口
FRAC 以 selective SSM 层 形式提供,可无缝嵌入主流序列模型栈:
- 替换 Mamba 层:在相同框架(如
mamba.py、transformers的 SSM 实现)中仅改变状态转移核,训练与推理代码改动小。 - 与 Transformer 混合:作为局部或全局记忆模块,接在 attention 之后或替代部分 attention head,适用于已有 Transformer 架构的产品。
- 并行训练兼容:采用 log-spaced sum-of-exponentials 近似,支持并行 scan 与 prefill,可直接接入现有分布式训练流水线。
具体落地 use case
- 电商平台长评论分析:用户对商品的详细评价常包含多段历史描述与对比,FRAC 可提升情感分类与关键属性抽取的准确率,尤其在数千字长评论上。
- 企业服务中的合同审查:法律科技产品需要定位合同中的关键条款并追溯其上下文,FRAC 的长记忆特性可减少漏检,同时降低推理成本,使大规模合同批处理成为可能。
总体而言,FRAC 为长上下文建模提供了一个 即插即用的先验,对现有 SSM 产品线是低成本高回报的升级。
局限
- 有限状态指数和近似引入长时程误差:FRAC 将幂律核近似为有限个对数间隔的指数模态,虽然保证了有界状态和高效计算,但这种近似在极长上下文下可能偏离真实分数阶核,尤其是大于预设时间范围的记忆衰减行为。论文未系统分析近似误差随状态数、对数间隔和上下文长度的变化阈值,实际部署时可能需要针对不同序列长度重新校准模态数量,增加了超参数敏感性和调优成本。
- 实验规模与任务覆盖有限:语言建模实验最大仅 1.3B 参数,未验证更大规模(如 7B+)下分数阶动态的扩展性和稳定性;同时任务集中在语言建模和 DNA 建模,缺乏多模态、长文档问答等更广泛的长上下文基准。与 Mamba 等成熟 SSM 相比,FRAC 在短上下文上的竞争力虽被提及,但未展示在强基线(如 Mamba-2、RWKV-6)上的全面对比,可能高估其相对优势。
- 选择性机制与分数阶动态的耦合复杂度未充分量化:FRAC 在选择性 SSM 中引入分数阶状态转移,虽然保留了并行训练和线性推理,但额外的对数间隔指数模态和对应的状态更新可能增加内存占用和计算开销,尤其是模态数量较多时。论文没有与标准 Mamba 在相同硬件下的 wall-clock 时间或峰值显存进行系统对比,工程可行性尚需进一步验证。