单层 RL 训练可匹敌全参数训练,跨模型算法任务验证
RL后训练收益仅依赖于少数中间层,单层训练即可超越全参数,为高效微调指明方向。
研究发现强化学习对模型的收益高度集中在中间层(40-60%深度),仅训练一个Transformer层就能恢复甚至超越全参数训练的效果,且这一规律在7个模型、3种算法、3个任务领域上成立。
正文摘录
.jpg)  本文第一作者为明尼苏达大学博士生张子健,指导老师为洪明毅教授。其他作者包括北京大学的胡日臻,Amazon 的 Hongzhou Lin,明尼苏达大学的 Athanasios Glentis、Dawei Li、Chung-Yiu Yau。 现有的 RL 后训练方法统一更新所有 Transformer 层,隐含假设 每一层对 RL 收益的贡献是均等的 。来自明尼苏达大学、北京大学和亚马逊的团队挑战了这一假设:通过对 7 个模型、跨越 2 个模型家族、3 种 RL 算法、3 个任务领域的系统性逐层研究,发现 RL 收益高度集中在一小部分中间层 ,而非均匀分布。更令人惊讶的是, 训练单个 Transformer 层即可匹敌甚至超越全参数 RL 训练 ,而基于这一发现的策略可以持续超越标准全参数 RL 训练。