行业新闻

上海AI实验室提出Mobius架构,分离知识与推理以突破Transformer上限

本文介绍Mobius架构,通过分离知识与推理,解决Transformer的三大缺陷,为下一代模型架构提供新思路。

Transformer 架构正接近能力上限,其分层记忆与推理机制导致三大缺陷:检索效率低、持续学习成本高、组合泛化能力弱。上海人工智能实验室的 Mobius 系列架构将知识从各层抽取为共享记忆池,让每层注意力都能访问,从而提升知识读取效率、降低新增知识的耦合成本,并增加不同知识被同时激活的机会。该设计有望在持续学习和科学发现等场景带来更高能力上限。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/014124bd-f04f-469f-bf5b-0edaad198412/07(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) Transformer 的上限在哪里?这个问题从 2022 年 ChatGPT 问世起,就开始被广泛讨论。 最近一两个月,这个问题的答案初见端倪。前 OpenAI 推理负责人 Jerry Tworek 与前 Google Gemini 预训练负责人 Rohan Anil 公开表态,Transformer 已经走到尽头,并成为走向 AGI 的最大瓶颈[1]。 国内头部基础大模型也在积极尝试改进版的 Transformer 架构,但进行这些改进的一部分原因是算力瓶颈,并不完全是为了提升架构的能力上限。通过稀疏/线性注意力来降低架构复杂度,这些方案大幅提升了训推效率,在资源受限的情况下成功实现了更大的参数规模,并让模型能力逐渐趋近国外闭源模型。然而,半年后,这些复杂度更低的架构是否同样会碰壁,还需要打一个问号。 那么,随着 Transformer 上限触顶,AI 的下一代模型架构应该具备哪些特质?来自上海人工智能实验室的书生 Mobius 团队给出了一条可能的路径——通过知识与推理分离,探索在持续学习、组合泛化等方向上能力上限更高的架构,并顺带用更高的能力上限倒逼训推效率的提升。 在这个思路下,团队提出的 Mobius 系列架构,有望在未来赋能商用落地、持续自进化、科学发现等多个关键问题或领域。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-05原文

相关内容