行业新闻

清华与字节Seed:同等预算下Looped Transformer更优

清华和字节Seed公平对比发现,循环Transformer在同等预算下普遍优于普通Transformer,且下游任务有额外收益。

在同等算力、参数量和KV cache(控制可服务上下文长度的缓存)预算下,循环Transformer(让部分层重复执行以加深计算、不增参数)是否更强?清华与字节Seed的论文SMELT首次正面回答:他们在多个模型规模上严格匹配预算,结果循环架构普遍取得更低验证损失,且计算最优前沿持续占优。

正文摘录

在同等算力、参数量和 KV cache 预算下,Looped Transformer(循环 Transformer,一种让部分层重复执行以获得更深的计算、而不增加参数量的架构) 会比普通 Transformer 更强吗?清华大学与字节跳动 Seed 等机构的研究团队通过论文 SMELT 首次正面回答了这一问题。 在大模型的发展中,提升能力的主要手段一直是 "做大"—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层再跑一遍。这就是 Looped Transformer。普通 Transformer 的每一层只执行一次,而 Looped Transformer 会把其中一部分层重复执行,让模型在不增加参数的情况下获得更深的计算 。 这个想法在推理和数学等任务上已经展现出不小的潜力,但一个关键问题始终没有被正面回答:Looped Transformer 的收益,究竟是循环架构本身的优势,还是因为多算了几遍、实际上用了更多的算力?清华大学、字节跳动 Seed 等机构的研究团队在论文 SMELT 中正面回答了这个问题。他们 同时对齐算力、参数量和 KV cache,首次在多个模型尺度上进行了公平比较 。 - 论文链接:https://arxiv.org/abs/2609.01343 本文的第一作者为清华大学博士生王少文,师从李建教授,研究方向为大语言模型预训练,曾在 ICML、NeurIPS、ACL、EMNLP 等国际会议上发表多篇论文,并获 LIT@ICLR 2026 最佳论文奖。 预算匹配框架 公平比较需要同时控制三个变量:决定训练和推理成本的每 token FLOPs 、约束知识容量的总参数量、以及限制可服务上下文长度的 KV cache。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-08原文

相关内容