ISO: 一个 RLVR 原生的优化栈
基于可验证奖励的强化学习(RLVR)正快速提升语言模型的推理能力,但将奖励反馈转化为权重空间更新的优化层仍缺乏理解。本文在前期分析(Zhu et al., 2025)基础上,通过模型权重的奇异结构研究这一缺失的优化层,并识别出光谱继承现象:RLVR 可复用基础模型的权重谱,同时通过与谱关联的输入/输出奇异帧的变化获取新行为。 我们将光谱继承操作化为等谱优化(ISO),这是一个 RLVR 原生的固定谱优化框架,包含离线和在线两种实例。离线方面,ISO-Merger 将共享基座专家的帧变化合并到单个固定谱模型中,无需合并后数据、 rollout、梯度更新或在策略蒸馏(OPD),即可恢复互补专家能力,在无数据合并方法中取得最强聚合性能。在线方面,ISO-Optimizer 对帧变量应用基础优化器(包括 AdamW 和 Muon),同时保持基谱固定。在 1.5B 至 8B 参数规模的推理与编程任务中,ISO-Optimizer 在报告运行中提升准确率,并以更少训练步数达到匹配分数。例如,在 Qwen3-8B-Base 上,AdamW 经 270 步训练达到 0.495 聚合准确率,而 ISO-AdamW 仅 100 步即达相同准确率,210 步后进一步提升至 0.509。 综上,ISO 为 RLVR 缺失的优化层提供了具体答案:不应全盘继承预训练优化,而应围绕奖励驱动适应的结构设计后训练——继承谱,优化帧。
论文精读
TL;DR ISO 基于 RLVR 中权重谱几乎不变的现象,固定频谱而仅优化奇异帧,提出无数据模型合并与更高效的在线训练,显著提升训练速度与模型聚合性能。
问题
问题背景
Reinforcement learning with verifiable rewards (RLVR) 正快速提升语言模型的推理能力,但优化层——将奖励信号转化为权值更新的组件——仍是一个未被充分理解的“黑箱”。现有实践大多照搬预训练的标准优化器,缺乏对 RLVR 特有奖励结构和更新动力学的针对性设计。
现有方法局限
近期研究揭示,RLVR 过程中权重矩阵的奇异值谱几乎不变(近等谱性质),学习主要发生在奇异向量(帧)的方向上。然而,传统的全参数优化器(如 AdamW)同时扰动谱和帧,不仅浪费计算,还可能破坏基础模型已学到的结构化知识。此外,离线合并多个 RL 微调专家时,现有方法(如模型平均或基于梯度的融合)通常需要额外数据、重放采样或 on-policy 蒸馏,资源开销大且难以保证合并后的泛化能力。缺乏一个原生支持“固定谱、优化帧”的优化框架,使得 RLVR 训练效率低下,且难以组合异构能力。
技术挑战与重要性
将优化约束在等谱流形上,需处理矩阵几何约束(如 Stiefel 流形),梯度投影和重参数化会引入额外计算开销,且需确保与任意 base optimizer 兼容。更重要的是,固定谱是否能覆盖 RLVR 所需的全部适应容量,此前缺乏系统验证。在算力成本高昂的大模型时代,若能在不损害性能的条件下显著减少训练步数(如论文中 ISO-AdamW 仅需 100 步即可达到 AdamW 270 步的精度),将直接降低迭代实验的门槛,加速推理模型的后训练研发。
行业类比
这类似于计算机视觉中冻结卷积主干、仅微调轻量头部的迁移学习策略,但应用于语言模型权重矩阵的谱分解层面:冻结奇异值,只学习奇异向量,从而在保留预训练表征的基础上高效适配新任务。
核心洞察
- 谱继承(spectral inheritance)揭示RLVR微调中模型权重谱保持预训练结构几乎不变,而行为变化主要由左、右奇异帧驱动。这一观测挑战了将预训练优化器(如AdamW)及全参数更新直接迁移到RLVR的惯性做法,指出后训练优化应围绕RLVR自身的适配特性重新设计,而非简单复用预训练阶段的优化配置。
- ISO框架将RLVR优化分解为“固定谱、优化帧”,形成与谱继承对齐的原生优化栈。在线优化器ISO-AdamW在Qwen3-8B上仅用100步即达到AdamW需270步的同等精度(聚合分0.495),并进一步推高至0.509;离线合并器ISO-Merger无需任何后合并数据或梯度回传即可组合共享基座专家的能力。该范式为RLVR提供了结构化的优化层答案:继承谱,优化帧,既加速训练又解锁免数据模型融合的新场景。
方法
核心思想:谱继承与等谱优化(ISO)
该方法源自一个关键观察:在 RLVR(可验证奖励强化学习) 微调过程中,模型权重矩阵的奇异值谱几乎不变(near-isospectral),而学习主要发生在左右奇异向量(帧) 的变化上。ISO 将这一现象形式化为谱继承(spectral inheritance):保留预训练基座模型的奇异值谱,仅优化奇异向量空间,形成一套固定谱的 RLVR 原生优化栈。
输入与参数化
给定任意预训练模型(如 Qwen3-8B),ISO 对模型的全连接层权重矩阵执行 SVD 分解:W = U Σ V^⊤,其中 Σ 为对角奇异值矩阵,U 和 V 为(半)正交矩阵。固定 Σ 不变,将 U 和 V 作为可优化变量,从而将优化域从整个权重空间限制到 Stiefel 流形 上的帧变量。
关键模块一:ISO-Merger(离线合并)
输入:多个共享同一基座、分别在不同 RL 任务上微调后的专家模型。流程:
- 对每个专家权重做 SVD,提取其相对于基座模型的帧变化(通过右乘对应的正交变换)。
- 将各专家的帧变化投影到 Stiefel 切空间,再进行组合(如平均),得到合并后的帧增量。
- 通过重投影和回缩(retraction) 确保帧变量保持正交,最后与固定谱重构模型权重。 输出:一个融合多专家能力且保持原始谱结构的单模型,无需任何数据、rollout、梯度回传或策略蒸馏。
关键模块二:ISO-Optimizer(在线训练)
输入:基座模型与标准优化器(如 AdamW、Muon)。流程:
- 前向传播仍使用原始权重
W,但反向传播时仅计算相对于帧变量的梯度。具体地,通过矩阵链式法则将权重梯度转换为对U和V的梯度因子。 - 使用指定优化器更新帧变量,但更新方向需投射到 Stiefel 切空间,然后沿测地线回缩以维持正交性。
- 权重衰减、动量等标准技巧也可直接作用于帧变量。 输出:一个在固定谱约束下完成 RLVR 训练的新模型。实验显示,ISO-AdamW 在 Qwen3-8B-Base 上仅需 100 步即可达到常规 AdamW 270 步的精度,且最终提升至 0.509。
与同类方法的差异
不同于 LoRA 等低秩适配器(新增参数改变隐式谱)或基于梯度的模型融合(依赖数据/蒸馏),ISO 首次将 RLVR 中谱不变性转化为显式的硬件级优化约束,直接在预训练权重的奇异系上进行无数据合并与加速训练,计算开销极低(仅引入 SVD 与少量流形投影)。
实验
实验设计
- ISO-Merger:离线的 RL 专家融合,仅需模型权重,无需数据、rollout 或梯度更新。
- ISO-Optimizer:在线固定谱训练,冻结基座谱,优化左右奇异向量帧,可与 AdamW、Muon 等标准优化器组合。
- 评估覆盖推理与编程任务,模型参数 1.5B 到 8B。
关键发现
- ISO-AdamW (Qwen3-8B-Base):仅 100 步达到 AdamW 270 步的 0.495 总准确率,210 步提升至 0.509。
- ISO-Merger:能无损融合互补专家能力,在无数据合并方法中取得最强综合性能。
与基线对比深度解读
- 收敛大幅提速:谱继承使优化更高效,同等准确率下训练步数减少约 63%(100 vs 270)。
- 最终性能更优:额外帧优化带来 +0.014 准确率增益,验证“继承谱,优化帧”原则在 RLVR 后训练的有效性。
- 合并方法革新:ISO-Merger 无需任何后训练数据即超越现有无数据合并技术,凸显谱结构在专家组合中的先天优势。
行业影响
落地场景
ISO 提供的 固定谱优化 与 数据无关的模型合并 能力,可直接应用于需要快速迭代推理模型(如逻辑推理、代码生成)的线上服务。典型场景包括:
- AI 编程助手:通过 ISO-Merger 合并多个专项代码专家(如 Python、Rust 专家),无需额外数据或梯度更新,即获得多语言支持能力,降低多模型部署成本。
- 智能客服与知识库问答:将同一基座模型上微调的多个领域适配分支(如金融、医疗)合并为一个通用模型,避免在线切换模型带来的延迟与一致性风险。
- 内容审核与安全过滤:ISO-Optimizer 在固定谱下训练,收敛速度更快,可显著减少强化学习验证奖励(RLVR)阶段的 GPU 小时消耗,加速策略上线。
商业价值
- 降本:ISO-Merger 实现“零数据、零 rollout”的模型合并,省去传统融合所需的标注数据、蒸馏计算和人工调参成本。ISO-Optimizer 在 RLVR 训练中只需原优化器 1/3 的步数即可达到同等精度(如 Qwen3-8B-Base 上 AdamW 需 270 步,ISO-AdamW 仅 100 步),直接降低训练算力开支。
- 体验提升:固定谱参数化使模型行为更可控,合并后模型不会出现灾难性遗忘,且能保留多个专家的互补能力,提升模型输出的一致性与可靠性,尤其适用于对稳定性要求高的企业级应用。
- 增收:更快的模型迭代速度意味着可更频繁地推出定制化模型服务,提升客户留存与增值服务收入。
与现有产品/工作流的接口
ISO 可作为现有 MLOps 流水线中的一个后处理插件,无需替换底层优化器或训练框架:
- 在线训练:将 ISO-Optimizer 作为轻量封装层包裹原有优化器(如 AdamW、Muon),仅对权重矩阵的奇异向量帧进行更新,而保持奇异值不变。该变换可通过几行代码集成到现有 PyTorch 训练脚本中,模型保存格式与原始模型完全兼容,即插即用。
- 离线合并:ISO-Merger 接受多个共享基座的 LoRA/全量微调权重,通过 Stiefel 切线投影与重投影实现固定谱合并,可嵌入模型版本管理平台(如 HuggingFace Model Hub 的合并流程),作为无数据合并的标准化算子。
- 部署:合并或训练后的模型仍为标准 Transformer 结构,无需定制推理引擎,可直接部署在 vLLM、TGI 等推理服务中。
具体用例
- 电商多语言商品搜索:平台拥有英语、日语、西班牙语三个基座模型上分别微调的搜索排序专家,使用 ISO-Merger 将其合并为一个多语言排序模型,直接部署到在线服务,节省维护三个模型实例的算力与工程开销。
- 医疗诊断辅助多任务系统:同一基座模型上训练了影像报告生成(使用 RLVR 优化)和病历结构化提取(监督微调)两个分支,通过 ISO-Merger 合并,在保证各自性能不掉点的前提下,提供统一 API 接口,降低集成复杂度。
局限
- **谱继承假设的泛化性尚未在大规模模型上验证**。论文在 1.5B–8B 参数规模上观察到谱的近等性,并据此提出固定谱优化框架。然而,在更大规模模型(如 30B+)或更复杂的 RLVR 任务中,谱的稳定性可能减弱,强制固定谱可能限制模型的学习容量。作者尚未提供理论或实验说明该假设的适用边界,这会影响 ISO 方法在工业级大模型中的可靠性。
- **在线优化器的额外计算开销与合并方法的专家同源要求**。ISO-Optimizer 每次更新需计算因子梯度并在 Stiefel 流形上进行重投影,虽然作者声称开销可控,但在极端训练吞吐要求下可能仍构成负担。ISO-Merger 则依赖专家模型共享同一基础模型,无法直接合并不同初始化或异架构的专家,限制了其在分布式、异构训练环境中的直接应用。