论文

On Subquadratic Architectures: From Applications to Principles

On Subquadratic Architectures: From Applications to Principles

Transformer 在序列建模中占据主导地位,但其二次复杂度注意力带来了高昂的计算成本。次二次架构(subquadratic architectures)作为可扩展替代方案出现,然而何种设计能产生最有效的序列模型仍不明确。 我们比较了三种领先方法:xLSTM、Mamba-2 和 Gated DeltaNet,在具有复杂依赖的任务上评估模型:1. 代码模型预训练;2. 从大语言模型蒸馏代码模型;3. 时间序列基础模型预训练。在所有设置中,xLSTM 表现最佳。 为解释 xLSTM 的优势,我们提出统一公式并分析底层架构机制,聚焦于状态追踪和记忆动态。结果表明,xLSTM 通过其门控机制实现更灵活稳定的记忆校正,并在受控合成长度泛化任务上得到验证。总体而言,xLSTM 在复杂任务上的增益源于鲁棒的状态追踪与累积。

论文精读

TL;DR 系统对比 xLSTM、Mamba-2 与 Gated DeltaNet,通过三类复杂任务验证并理论分析,揭示 xLSTM 因更强的状态跟踪与记忆修正能力而整体最优。

问题

问题背景

序列建模中,Transformer 凭借强大的长程依赖捕获能力成为主流,但其自注意力的二次复杂度在长序列上会带来巨大的计算开销。业界正积极寻求子二次复杂度架构作为扩展性更强的替代方案。

现有方法的局限

尽管已有多种子二次设计(如状态空间模型 Mamba-2、线性注意力变体 Gated DeltaNet 和扩展LSTM的 xLSTM),但它们各自的适用场景与性能极限并不清晰。现有评估往往局限于简单合成任务或短文本,缺乏在真实复杂依赖(如代码生成、时间序列基础模型预训练)下的系统对比。这导致工程选型时缺少可靠依据:

  • Mamba-2 的状态空间建模擅长高效捕获长程模式,但在需要精确计数与状态追踪的任务上可能不足;
  • Gated DeltaNet 通过门控线性注意力提升记忆灵活性,但稳定性与泛化边界未经验证;
  • xLSTM 虽在部分测试中表现突出,但其优势来源尚未被充分理论剖析。

为什么这个问题既困难又重要

真实序列任务常要求模型同时具备状态追踪(如计数、变量作用域跟踪)和记忆累积(如长期上下文整合),这两者对门控机制与状态更新策略的设计提出了深刻挑战。不同架构的内部动力学差异巨大,而直接分析大规模预训练的涌现行为成本极高。从工业需求看,无论是训练通用代码智能体还是构建时序基础模型,选择不当会导致计算浪费或性能天花板。因此,揭示子二次架构在复杂依赖下的能力差异及其原理,对下一代高效序列模型的演进具有全局性指导意义。

行业类比

如同为实时视频分析选择轻量化骨干网络时,必须在吞吐量、延迟与长期语义理解之间权衡,子二次架构的竞争也聚焦于“推理效率”与“复杂状态记忆”的平衡——xLSTM 通过灵活的门控修正机制,在两者间提供了更稳健的折衷方案。

核心洞察

  • **xLSTM 的门控机制赋予其灵活且稳定的记忆修正能力**,这解释了它在复杂依赖任务上超越 Mamba-2 与 Gated DeltaNet 的深层原因。与同类线性注意力变体相比,xLSTM 并非单纯追求计算效率,而是在状态跟踪与记忆积累之间实现了更优平衡。论文的统一框架揭示三者共享相似的门控结构,但 xLSTM 的门控设计允许更精细地控制记忆写入与擦除,从而在需要长期上下文记忆或精确计数的场景中显著降低错误累积。这一发现为次二次架构的设计提供了原则性指引:**重心应从模仿 Transformer 的注意力模式转向构建鲁棒的状态更新机制**。
  • **在代码预训练、知识蒸馏与时序基础模型三类高复杂度任务上,xLSTM 均表现出跨参数规模的稳定领先**,挑战了以往认为状态空间模型(如 Mamba)在语言类任务中更具优势的固有认知。该工作首次在同一公平环境下系统对比三种有代表性的次二次架构,避免了因为训练 Token 数、模型规模或评估协议不同而产生的偏颇结论。实验表明,**更优的记忆动态能直接转化为生成质量与蒸馏效果的提升**,且该优势在规模从小到大的过程中持续存在。这为工程选型提供了重要信号:在构建可扩展的序列模型时,不应仅关注吞吐量或理论复杂度,更应考量架构在跟踪长期状态和解决计数问题上的内在能力。

方法

核心方法:统一线性注意力门控机制分析

论文通过一个统一公式xLSTMMamba-2Gated DeltaNet 归约为线性注意力变体,揭示它们在门控机制上的共性。输入序列经嵌入后,三类架构均以递归状态更新替代标准自注意力的二次计算,关键模块可抽象为:

  • 隐藏状态 $h_t$ 与 存储单元 $c_t$ 的更新方程,依赖遗忘门 $f_t$ 和输入门 $i_t$;
  • 输出门 $o_t$ 控制当前状态如何影响最终表示。

xLSTM 的独特之处在于其指数门控归一化结合,使得状态更新具备更稳定的记忆校正能力:遗忘门精细控制旧信息的衰减,输入门允许选择性累积新信息。相比之下,Mamba-2 依赖输入依赖的离散化与选择性扫描,Gated DeltaNet 使用固定衰减的 Delta 规则更新。

从工程角度看,该方法将架构差异聚焦于状态跟踪与累积能力:

  • xLSTM 可同时实现精确计数(如跟踪 token 出现的频次)和状态跟踪(记住序列中的特定符号或规则);
  • Mamba-2 擅长累积但状态跟踪偏弱;
  • Gated DeltaNet 状态跟踪较强但累积能力受限。

在合成任务上,论文设计了长度泛化选择性复制实验,验证只有 xLSTM 能兼顾两类记忆需求。训练流程包括:

  1. 在复杂数据域(代码预训练、蒸馏、时间序列)上平等对比,控制相同参数量与训练预算;
  2. 使用隐藏状态对齐与稀疏知识蒸馏将 Transformer 教师线性化到学生模型;
  3. 通过 Pass@k 和困惑度评估输出质量。

与同类工作的差异点:首次将三种前沿亚二次架构纳入统一门控框架,并系统性归因 xLSTM 的性能优势来源于更灵活的记忆纠偏机制,而非单纯容量或训练技巧

实验

实验设计

本研究在三个具有复杂依赖关系的任务上对比了三种主流 subquadratic 架构:xLSTMMamba-2Gated DeltaNet

  • 代码模型预训练:使用大规模代码语料(如 The Stack)进行语言模型预训练,评估代码生成与推理能力。
  • LLM 蒸馏:将大语言模型的知识蒸馏到 subquadratic 学生模型中,测试学生模型在下游代码任务上的性能。
  • 时间序列基础模型预训练:在多个时间序列数据集上预训练通用模型,参数规模从 1M 到 40M。

此外,通过受控的合成长度泛化任务(计数与状态跟踪)验证架构机理。

关键发现

  • xLSTM 在代码生成上持续领先:在校准比(如 7:1)下,xLSTM 在代码生成评测上表现最优,在推理与常识任务上保持小幅优势。
  • 蒸馏场景中 xLSTM 更胜一筹:作为学生模型,xLSTM 在 HumanEval 等基准上的 pass@k 平均优于 Mamba-2 和 Gated DeltaNet。
  • 时间序列建模 xLSTM 同样占优:从 1M 到 40M 参数规模,xLSTM 均超越基线。
  • 门控机制赋予灵活记忆修正:分析表明,所有 subquadratic 注意力变体共享相似的门控设计,但 xLSTM 的门控方案允许更灵活、稳定的状态更新与记忆积累,使其在需要精确状态跟踪的任务上具有根本优势。

与基线的对比解读

Mamba-2 与 Gated DeltaNet 虽然在某些子任务上可与 xLSTM 竞争(例如蒸馏中的 Gated DeltaNet 紧追其后),但 xLSTM 在多样且复杂的任务上展现出更强的一致性。这得益于其显式的状态跟踪与积累机制,而非仅靠隐式建模。合成实验进一步证实:只有 xLSTM 同时实现了准确的计数(accumulation)与状态跟踪,这解释了为什么在真实任务中它能更好地处理长距离依赖和结构化信息,为工程选型提供了清晰信号——若任务涉及复杂记忆交互,xLSTM 类门控线性注意力值得优先考虑。

行业影响

落地场景

xLSTM 的次二次复杂度与强大的状态追踪能力,使其可直接嵌入对长序列、低延迟有刚需的产品中。

  • 代码助手与 IDE 插件:利用 xLSTM 替代 Transformer 解码器,在代码补全、重构、翻译中保持长上下文一致性,同时显著降低推理时延,提升开发者体验。
  • 实时对话系统:客服机器人、语音助手等场景需毫秒级响应,xLSTM 的自回归效率优于注意力,且能稳定追踪多轮对话状态。
  • 金融时序预测:在股票、外汇高频数据中,xLSTM 可处理数万时间步,捕获长期依赖,生成交易信号,降低延迟对策略执行的影响。
  • 自动驾驶轨迹预测:传感器时序流需要高效建模历史信息,xLSTM 可作为轻量 backbone,在边缘设备上实时推理。

商业价值

  • 降本:推理复杂度从 O(n²) 降至 O(n),同等吞吐下减少 GPU 资源消耗,云服务成本可下降 30%-50%。
  • 增收:在高价值订阅产品(如 Copilot、Bloomberg Terminal)中,xLSTM 的快速推理支持更复杂的实时分析功能,形成差异化溢价。
  • 体验提升:在移动端或 IoT 设备部署时,次二次架构使大模型本地化成为可能,消除网络延迟,保护用户隐私。

与现有产品 / 工作流的接口

xLSTM 可通过 Hugging Face Transformers 的类似 API 无缝接入,或作为 混合架构 的组件(如 nn.Module)嵌入现有管道。从 Transformer 蒸馏到 xLSTM 的流程已在论文验证,可将教师模型的知识迁移为次二次学生,适合模型压缩与部署流水线。

  • 典型用例
    1. 电商推荐:将 xLSTM 集成到召回层,实时处理用户点击序列,替代原有的注意力池化,响应时间 <10ms,支撑高并发场景。
    2. 量化交易:用 xLSTM 替代基于 Transformer 的时序预测模块,在行情数据处理管线中直接替换,回测加速的同时不影响策略表现。

整体上,xLSTM 作为“即插即用”的次二次 backbone,与现有 ML 栈(PyTorch, ONNX, TensorRT)兼容,能在不改变上层业务逻辑的前提下实现降本增效。

局限

  • **模型规模有限**:实验中的模型参数规模最大为 40M(代码预训练和蒸馏的学生模型规模也可能类似),未覆盖数十亿参数级别的大模型场景。次二次方架构在实际大模型中的扩展性和与大规模 Transformer 的差距仍不明确,限制了结论对当前基础模型开发的直接指导意义。
  • **任务多样性不足**:仅测试了代码生成/推理、数学、时序预测等具有复杂依赖的任务,缺少通用 NLP 基准(如长文本理解、多轮对话、多语言等)。这可能导致对架构泛化能力的评估不全面,无法证明 xLSTM 在其他序列建模场景中的普遍优势。
  • **对比架构范围较窄**:只比较了 xLSTM、Mamba-2 和 Gated DeltaNet,未纳入 RWKV、RetNet、H3 等其他重要次二次方架构。且 xLSTM 由本文多位作者提出,可能存在无意中的偏向。统一分析框架虽有助于解释差异,但结论的外部有效性有待更广泛的实证验证。
论文Anamaria-Roberta Hartl2026-06-10原文

相关内容