论文

Intern-S2-Mobius: 解耦知识与推理的基础模型

Intern-S2-Mobius: 解耦知识与推理的基础模型

我们提出 Mobius-v0 架构,该架构包含全局共享的 Memory (FFN)(存储知识向量)和多个 Reasoners (Self-Attn)(迭代实现组合推理)。以隐藏状态为缓存和载体,reasoner 反复查询记忆以获取所需的知识向量,并将知识回传给推理算子。通过这种 knowledge-reasoning-separation 架构,Mobius 实现了更好的知识压缩和推理效率。 基于 Mobius-v0 架构:1) 我们从头训练的 7B 模型 在仅使用基线 62.6% 训练数据的情况下,取得了与 7B Transformer 基线相当的下游得分;2) 从 Qwen3.5-35B 持续预训练的 Intern-S2-Mobius 在获得相似下游得分的同时,实现了近 4 倍 的端到端推理加速。

论文精读

TL;DR Mobius-v0 解耦知识存储(全局共享 FFN)与推理计算(多个 Self-Attn Reasoners),用隐藏状态迭代查询知识向量,仅需 62.6% 训练数据达到同等性能,并实现近 4 倍端到端推理加速。

问题

问题背景

当前基础模型能力提升主要依赖 参数规模、训练数据 和 推理链长度 的扩展,但推理成本和延迟成为部署瓶颈。

现有方法局限

主流 Transformer 架构将知识存储和推理运算耦合在交替的 FFN 和 Self-Attention 层中:

  • 知识冗余:每个 token 都激活整个 FFN,存储的知识向量无法按需检索,导致大量无效计算。
  • 推理重复:Self-Attention 在每次前向中都要处理完整上下文,无法复用中间推理状态,长链推理时计算量线性增长。
  • 扩展方式低效:MoE 增加专家容量但总计算量仍随激活参数上升;潜推理(如 Coconut)增加隐式思考步骤但仍在同一网络内耦合存储与推理。

为什么难/重要

解耦知识与推理需要从架构层面重新设计信息流:既要保证 知识压缩(共享 Memory 避免复制)又要维持 组合推理(多个 Reasoner 迭代查询)。业界对 推理效率 和 端侧部署 关注度极高,4× 推理加速意味着同等精度下成本显著下降,这是大模型走向实时应用的关键。

行业类比

类似 数据库 将存储引擎与查询引擎分离,Mobius 把“知识库”和“推理器”解耦,可按需检索知识向量,降低每次推理的计算开销。

核心洞察

  • Mobius-v0 将 FFN 作为全局共享的知识 Memory,与多个 Self-Attn Reasoner 分离,实现知识与推理的架构解耦。 与标准 Transformer 每层同时包含 FFN 和 Self-Attn、知识参数随层数线性增长不同,Mobius 仅保留单份 FFN Memory 被所有 Reasoner 共享,大幅压缩知识冗余;隐藏状态在 Memory 与 Reasoner 之间传递查询结果,使知识获取与组合推理成为两个独立可优化环节。这直接体现为 7B 模型仅用 baseline 62.6% 训练数据即可达到同等下游分数。
  • Mobius 利用隐藏状态作为 cache 与 carrier,使多个 Reasoner 在 latent space 中迭代执行组合推理,无需生成显式推理 token。 与显式 Chain-of-Thought 增加可见 token、或 Concise CoT / Speculative Decoding 压缩或加速 token 生成不同,Mobius 的推理循环发生在隐藏表示内部,不改变生成 token 总数;因此增加 reasoning step 不会线性增加解码长度。在 Qwen3.5-35B 基础上继续预训练后,端到端推理速度提升近 4 倍,同时保持相似下游分数,证明 latent reasoning 可作为独立于 token 路径的效率杠杆。

方法

Mobius-v0 架构方法

输入为 token 序列,经嵌入层后进入 Mobius-v0 的核心模块。与 Transformer 不同,Mobius-v0 将知识存储与推理计算解耦:一个全局共享 Memory (FFN) 存储知识向量,多个Reasoners (Self-Attn) 负责组合推理。隐藏状态充当缓存与传输载体:在推理循环中,Reasoners 多次查询 Memory,按需取回知识向量,并将知识注入后续推理步骤,形成动态潜在推理(Dynamic Latent Reasoning)。同时,后向残差连接(Backward Residual Connection)允许高层信息回流,支撑隐藏状态内的迭代计算,避免每层 FFN 重复存储知识,也无需生成显式中间 token。

训练层面,7B 模型从零开始仅使用 Transformer baseline 62.6% 的训练数据即达到相当下游分数;35B 模型从 Qwen3.5-35B 继续预训练,在保持性能的同时实现近 4 倍端到端推理加速。工程视角下,知识-推理分离让 FFN 参数可独立扩展且全局共享,适合高效服务部署;潜在循环推理大幅减少自回归解码步数,直接降低延迟。

与同类方法的差异点在于:Mobius-v0 不是简单堆叠 Transformer 层或引入外部记忆,而是将 FFN 作为全局知识存储器、Self-Attn 作为独立推理器,通过隐藏状态作为知识查询与回传通道,实现结构性的知识压缩与推理效率统一。

实验

实验设计

论文提出 Mobius-v0 架构,核心是将全局共享的 Memory(FFN) 与多个迭代工作的 Reasoner(Self-Attention) 解耦。实验分两条路线:

  1. 7B 从零训练:对比同规模 Transformer 基线,在相同下游任务上评估数据效率。
  2. Intern-S2-Mobius:从 Qwen3.5-35B 持续预训练,对比端到端推理速度。

论文未在摘要/摘录中列出具体 benchmark 名称,仅报告 downstream score 相对值。

关键发现

  • 7B 模型使用 62.6% 的基线训练数据,即可达到相似下游得分。
  • Intern-S2-Mobius 达到相似下游得分的同时,端到端推理速度提升约 4×。
  • 架构层面的关键在于 hidden states 作为缓存与载体,Reasoner 反复查询 Memory 获取知识向量,知识传输回推理算子,实现知识压缩与推理效率分离。

与基线对比解读

与标准 Transformer 相比,Mobius-v0 不是简单增加参数或链长,而是把知识存储从推理算符中剥离。工程启示在于:

  • 数据效率:共享 FFN 存放知识向量,减少冗余参数更新,因此能在大幅降低训练 token 情况下保持能力。
  • 推理效率:多个 Reasoner 共享 Memory,避免每层重复前向大 FFN,从而在长序列/复杂推理任务中放大速度收益。
  • 需注意:论文报道“similar downstream score”而非全面超分,说明该架构在部分基准上只是追平;但结合数据与推理双重增益,对资源受限场景有显著价值。

行业影响

落地场景

Mobius 的解耦架构尤其适合长链推理密集型任务,例如代码生成与审校、金融分析报告撰写、数学题求解等。在内容平台的实时评论审核与意图分析中,其 4x 推理加速可支撑更大并发;在企业知识管理场景,全局 Memory 只需存储一次通用知识向量,多个 Reasoner 轮流查询,降低多租户重复存储开销。

具体 use case:

  • 电商平台的智能客服系统:高峰时段需同时处理大量用户询问,Mobius 可将单次回复延迟降低约 75%,相同 GPU 成本下服务更多并发会话。
  • 在线教育自适应解题助手:学生输入题目后需多步推理(理解题意→调用公式→分步计算→解释),解耦设计允许 Memory 集中更新课程知识库,不影响推理模块效率,实现快速迭代。

商业价值

最直接收益是推理成本下降:端到端 4x 加速意味着同等吞吐下 GPU 服务器数量或按 token 计费成本可缩减约 3/4,对 API 服务商或内部大规模推理负载有显著利润改善。数据效率提升(7B 用 62.6% 数据达到基线)可缩短新领域模型训练周期,降低数据采集与标注成本。用户体验方面,更低首 token 延迟和更高并发能力可直接提升留存与转化率。

与现有产品/工作流的接口

Mobius 架构保留 hidden states 作为传递载体,与现有 Transformer 生态部分兼容:可从 Qwen3.5-35B 继续预训练,说明 embedding、输出层、tokenizer 等无需改动。集成进现有 stack 的关键路径是推理引擎适配:需要在 vLLM、TensorRT-LLM 等框架中实现 Memory(FFN)与 Reasoner(Attention)交替调度的自定义层,以及新的显存管理策略。可先将 Mobius 作为优化后端部署于已有 LLM 服务之后,通过模型转换工具导出权重,前端 API 保持不变,实现无缝替换。

局限

  • **实验规模与任务覆盖有限**:论文仅在 7B(从头训练)和 35B(持续预训练)两个规模上验证 Mobius-v0,缺乏更大参数量(如 70B+)的扩展性证据;同时下游任务以“相似 downstream score”概括,未详细列出具体基准与分数,难以判断架构在不同类型任务(如数学、代码、长文本)上的鲁棒性。与主流 Transformer 基线对比时,仅强调数据效率和推理加速,未报告知识密集型任务上的绝对性能优势,可能掩盖某些能力短板。
  • **架构解耦带来工程落地成本**:Memory(FFN)与 Reasoners(Self-Attn)分离,虽提升推理效率,但破坏了标准 Transformer 层的统一结构,导致与现有预训练权重、推理框架(如 vLLM、TensorRT-LLM)、分布式训练策略(如张量并行、流水线并行)不完全兼容,需要定制适配或重写算子。论文未提供与主流工具链集成的方案,实际部署时可能面临较大的迁移与维护成本,影响快速采用。
  • **推理加速的适用条件不明**:论文宣称近 4× 端到端推理加速,但未明确该加速是否依赖特定解码场景(如长序列生成、迭代 latent reasoning)。在短文本生成或非迭代推理任务中,由于 Reasoners 需要反复查询全局 Memory,可能引入额外通信或缓存开销,加速效果可能大幅缩水。此外,“相似 downstream score”暗示并未超越 Transformer 基线,知识压缩可能导致部分细粒度知识丢失,论文未对此进行消融分析。
论文Kai Chen2026-08-14原文

相关内容