循环 Loopies!
我们介绍了 Loopie,这是迄今为止最强大的循环 Transformer。Loopie 系列包含两个混合专家(MoE)模型:一个 200 亿参数模型(20B,2B 活跃参数)和一个 60 亿参数模型(6B,0.6B 活跃参数)。 循环 Transformer 长期面临一个挑战:给定预训练计算量增加 N 倍,将参数数量增加 N 倍通常优于将模型循环 N 次。Loopie 通过新颖的设计解决了这一挑战。 广泛的消融实验,包括与 vanilla 30B-A3B 模型的比较,表明 Loopie 在使用相同计算预算的情况下显著优于 vanilla Transformer 基线。 我们新颖的训练后 pipeline 赋予 Loopie 强大的推理能力。在 2025 年 IMO 和 IPhO 中,Loopie 在没有工具的情况下取得了 金牌水平 的表现。
论文精读
TL;DR Loopie 通过 MoE 架构与循环机制,在相同训练算力下明显优于传统 Transformer,结合新型后训练流程,在 IMO/IPhO 上无工具达到金牌水平。
问题
问题背景
大规模 Transformer 的预训练成本随模型参数量与训练 token 数同步增长,如何在固定计算预算下最大化模型能力成为效率优化的核心命题。循环 Transformer (Looped Transformer) 通过重复执行同一组层来实现深度扩展,从参数效率角度提供了吸引人的替代方案。
现有方法局限
早期循环架构(如 Universal Transformer、ALBERT 的跨层参数共享)虽能减少参数,但在预训练 scaling law 中表现乏力:若计算预算提升 (N) 倍,直接将参数量扩大 (N) 倍的常规模型通常显著优于将小模型循环 (N) 次的方案。根源在于:
- 循环中的表示塌缩 (representation collapse):多次重用相同参数容易导致特征多样性丧失,模型难以学习层次化抽象。
- 梯度流退化:深层循环等效于极深网络,梯度消失/爆炸问题加剧,标准归一化或残差连接不足以完全缓解。
- 缺乏针对循环结构的专家混合 (MoE) 设计:循环与条件计算结合时,路由策略若未专门调优,活跃参数增加带来的增益会被循环损耗抵消。
为何难且重要
突破这一限制意味着打破“参数规模与计算预算强绑定”的固有范式,使得用更少参数达到同等甚至更强性能成为可能。这对边缘部署、快速实验迭代、绿色 AI 等有直接工程价值。技术挑战在于需重新设计架构以适配循环特性:如何让 MoE 在每次循环中动态不同,从而避免表示僵化?如何设计后训练流程让循环模型掌握复杂推理?Loopie 正是在此背景下提出,在同等计算量下超越常规 Transformer,并在 IMO、IPhO 等任务中达到金牌水平,验证了路线可行性。
行业类比
这类似于在模型压缩中,通过权重复用(如 ALBERT)降低内存,但需仔细设计跨层交互以避免性能崩塌——循环 Transformer 的本质是将“参数共享”推向极致,同时靠动态计算保持表达能力。
核心洞察
- Loopie 通过 MoE 架构与循环 Transformer 的结合,打破了“增加计算量时,扩展参数量优于多次循环”的固有认知。**以往循环模型** 面临的核心瓶颈是:同等预训练计算预算下,重复使用相同参数的收益远低于直接扩大模型规模。**Loopie** 利用专家混合(MoE)在循环中动态激活不同参数子集,实现了参数总量大、活跃参数少的高效配置,在消融实验中显著超越同等计算量的密集型 Transformer 基线,证明了循环与稀疏激活的结合是一条可行的算力最优路径。
- **后训练阶段专项注入推理能力**,使 Loopie 无需外部工具即可在 2025 年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中取得金牌级表现。这不同于依赖代码执行或搜索增强的方案,表明模型可以将复杂的多步推理过程完全内化在权重中。**对工程实践**的启示是:精心设计的后训练流程(可能包含合成推理链数据或强化学习)能够大幅提升基础模型的竞技水平,为追求通用人工智能(AGI)的高效推理提供了一条无需推理时大量采样的路径。
方法
架构设计思路
Loopie 模型的核心原理是将 循环机制 与 混合专家(MoE)深度融合,以实现在给定计算预算下超越传统非循环 Transformer 的性能。其架构遵循“输入 → 循环 MoE 层 → 输出”的流程,通过在深度上多次重复使用同一组 Transformer 层(或其参数子集)来等效增加模型容量,但不按比例增加参数总量。
关键模块
- 循环 Transformer 主干:基础模块由若干标准 Transformer 层组成,这些层在每一轮循环中被重复应用。与传统循环 Transformer 不同,Loopie 在不同循环迭代间保持隐藏状态的联系,并可能引入 逐轮自适应计算分配(如位置相关的循环次数),避免固定次数循环带来的性能饱和。
- 混合专家(MoE)组件:在循环层的前馈子层中嵌入 MoE,使得每次前向计算仅激活部分参数。以 Loopie-20B-A2B 为例,总参数 20B,每次仅激活 2B,大幅压缩推理成本。MoE 与循环的结合产生了一种双重条件计算:纵向通过多次循环深化表示,横向通过专家选择扩宽表示能力。
- 训练与推理解耦的循环策略:预训练阶段可能使用可变循环深度(例如根据 token 难度动态决定循环次数),并在后训练阶段通过 蒸馏或强化学习 进一步对齐推理能力。后训练流程(post-training pipeline)专门针对数学、物理等推理任务设计,可能包含逐步推理的课程学习与过程奖励模型,最终使模型在无工具辅助的 IMO、IPhO 等竞赛中达到金牌水平。
与同类方法的差异
相比以往循环 Transformer(如 Universal Transformer 或 ALBERT 的跨层参数共享),Loopie 解决了“循环 N 次不如直接扩大 N 倍参数”的痼疾,其关键在于 MoE 赋予了循环更大的参数效率,同时通过精细的动态计算分配避免冗余计算。这使得 Loopie 在同等训练计算量下显著超越 vanilla Transformer 基线,重新论证了循环架构在大模型时代的竞争力。
行业影响
落地场景:Loopie 系列模型凭借高推理性能与低活跃参数比,在多个行业有直接应用前景。
- 在线教育与智能辅导:其在国际数学与物理奥林匹克(IMO/IPhO)达到金牌水平,无需外部工具即可完成复杂推理,适合嵌入教育科技产品作为解题引擎,为学生提供分步解析与自适应辅导。
- 企业知识管理与客服:面对需要逻辑推导的技术问答(如 IT 支持、合规咨询),Loopie 能以较小计算开销提供高质量答案。
- 代码与科研助手:在编程辅助、科学计算场景中,作为廉价推理后端提升开发效率。
商业价值:Loopie 通过循环机制令活跃参数仅为 2B 或 0.6B,但性能优于同等训练算力下的稠密模型,带来显著降本优势。
- 推理成本大幅优化:单位请求 GPU 消耗降低,可支撑更高并发,直接减少云服务开支。
- 增收与体验提升:低成本高性能允许更多免费额度或低价套餐,拉动用户增长;高准确率回答提升用户粘性与付费转化。
- 边缘部署潜力:活跃参数规模小,适合资源受限环境,拓展离线与实时业务。
与现有产品/工作流的接口:Loopie 可快速融入现有 LLMOps 栈。
- API 集成:封装为标准 OpenAI-compatible API,通过 LangChain、LlamaIndex 等框架接入,替换当前模型只需修改端点。
- 推理引擎适配:循环计算需要引擎支持参数共享,可在 vLLM 或 TensorRT-LLM 基础上扩展,或通过模型重写为多层重复结构实现兼容。
- 后训练流程复用:其推理后训练方案可导出,用于微调客户私有数据,适应垂直领域。
具体落地 use case:
- 某国际数学辅导平台将 Loopie 作为智能导师,实时提供竞赛级难题的逐步推理,大幅减少人工答疑成本。
- 大型金融机构部署 Loopie 于风控报告分析,快速提取复杂监管条款间的逻辑关系,提高审核效率。
局限
- **推理计算开销未被量化**。循环 Transformer 通过迭代深度而非增加参数来利用算力,但摘要未提及循环步骤带来的序列化计算开销与延迟。实际部署中,N 次循环可能意味着 N 倍前向传播时间,而同等计算预算下增加参数量的模型能利用并行加速,导致 Loopie 在低延迟场景可能不如非循环模型。论文未与参数更多但批处理更高效的模型对比推理吞吐量。
- **后训练推理能力的泛化边界不明**。Loopie 在后训练后展现出强推理能力,并在特定竞赛(IMO、IPhO)中取得金牌,但这些竞赛的题型和分布可能恰好匹配其训练数据或后训练套路。摘要未说明模型在开放域推理任务(如 GPQA、BIG-bench reasoning)上的表现,也未讨论后训练方法对原始预训练知识的保持度,存在过拟合竞赛格式的风险。