阿里布局循环 Transformer,两篇论文获 ICLR 与 EMNLP 接收
循环 Transformer 被视为新 Scaling 方向,阿里两篇论文从信息流和计算粒度入手,使其更实用,获顶会认可。
循环 Transformer 让同一组参数反复运行,在不大幅增加参数的情况下加深计算。阿里团队的两篇论文 MeSH 和 SpiralFormer 分别被 ICLR 2026 与 EMNLP 2026 接收,前者解决循环中的信息管理问题,后者通过动态调节序列长度降低计算成本,并在下游任务上超越普通 Transformer。
正文摘录
让同一组 Transformer 层反复运行,在不增加同等规模参数的情况下,把计算做得更深。 由于循环发生在 hidden state 里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测? OpenAI 也由此被 AI 安全专家集体讨伐,甚至一度逼得首席科学家 Jakub Pachocki 亲自下场回应。 一篇 SpiralFormer,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。 循环 Transformer 之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。 过去 Scaling 靠堆参数,24 层就得 24 套参数,现在 8 层参数跑 3 遍,也能完成 24 层深度的计算。 在 GraphWalks BFS 的 256K 至 1M 上下文测试中,Mythos Preview 拿到了 80.0%,GPT-5.4 是 21.4%,自家的 Opus 4.6 则是 38.7%。 这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。 横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是 core loop。 论文首版在 2025 年 10 月公开,等于 11 个月前,他们就在给循环 Transformer 做「体检」了。 在 Pythia-1.4B 级别的实验中,循环结构通过权重共享,减少了约 33% 的非嵌入参数。加入 MeSH 后,零样本下游平均准确率反而从普通 Transformer 的 49.50% 提高到 50.56%,领先 1.06 个百分点。 而 MeSH 新增的路由器参数,仅相当于普通 Transformer 非嵌入参数的约 0.005%。 团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。