N-GRPO: 嵌入级邻居混合用于增强策略优化
大型语言模型在数学推理中的成功高度依赖于生成多样化且有效的解题路径。然而,当前的展开技术面临一个根本性权衡:token级采样往往产生仅措辞不同的冗余轨迹,而利用随机噪声的嵌入级方法则经常破坏语义一致性。 为解决此问题,我们提出N-GRPO,一种集成在Group Relative Policy Optimization (GRPO)框架中的新型探索策略。与依赖token级采样或原生嵌入级噪声不同,我们的方法利用语义邻居混合 (Semantic Neighbor Mixing)。该机制通过混合锚点token及其最近语义邻居的嵌入来动态构建输入表示,从而在严格遵循局部语义流形的同时注入多样性。 在DeepSeek-R1-Distill-Qwen模型不同规模上的实验表明,N-GRPO不仅在数学推理基准上相较于强基线实现了一致改进,而且在分布外任务上展现出强大的泛化能力。
论文精读
TL;DR N-GRPO 通过嵌入层语义邻居混合,在保持语义一致性的前提下注入多样性,解决 GRPO rollout 的冗余与噪声权衡,提升数学推理并稳健泛化。
问题
问题背景
强化学习(RL)微调已成为提升大型语言模型(LLM)数学推理能力的关键范式。主流方法如 Group Relative Policy Optimization (GRPO) 通过在 rollout 阶段生成多条解路径构建相对奖励信号,其性能高度依赖于探索的多样性与有效性。
现有方法的局限性
目前 rollout 探索策略面临根本性权衡:
- Token 级采样(如温度采样、top-p 采样)仅在语言表层扰动输出,常产生仅措辞不同、推理逻辑完全冗余的轨迹,导致有效探索空间被压缩,难以跳出模型的默认推理路径。
- 嵌入级噪声注入 在隐空间施加随机扰动,虽能增强多样性,但这种无引导的扰动频繁破坏语义一致性,产生不符合语法或逻辑断裂的序列,反而引入有害梯度信号。 两种方法均无法在局部语义流形内进行可控探索,限制了 RL 微调的上界。
为何该问题既困难又重要
- 技术挑战:多样性-语义一致性权衡的根源在于 LLM 的表示空间并非均匀流形,随机扰动极易越过语义边界。在数学推理这类需要严格逻辑链条的任务中,任何语义断裂都会导致解路径无效,而仅依赖表面多样性则无法驱动策略真正改进。
- 业界关注度:随着 DeepSeek-R1 等 RL 驱动模型在复杂推理任务上取得突破,如何在训练阶段注入高效、可控的探索成为进一步提升性能的焦点。该问题直接关系到 RL 微调的采样效率与泛化能力,尤其在分布外(OOD)任务上的鲁棒性。
工程类比
这一困境类似于代码补全模型的候选生成:简单的 token 级重排会产生大量语法重复但逻辑相似的补全项,直接向量量化扰动则可能生成 null 引用等语义错误;真正有效的探索需在逻辑意图层面保持连贯,如同基于语义邻居的代码片断合成,既新颖又符合规范。
核心洞察
- **语义一致的嵌入空间探索**:N-GRPO 在 GRPO 的训练展开阶段,通过「语义邻居混合」在 token 嵌入层面注入多样性,而非使用随机噪声或仅靠 token-level 采样。该方法利用预训练嵌入空间的局部语义流形,在锚点 token 与其最近邻之间插值生成新的表征,从而在严格维持语义合理性的前提下扩展探索范围。这直接解决了现有 rollout 技术的根本矛盾:token-level 采样往往只产生换表达不换实质的冗余轨迹,而嵌入层随机扰动又极易破坏语义连贯性,导致生成无效推理路径。
- **从 token 空间到语义流形的探索迁移**:该工作将策略探索的切入点从离散 token 序列上移到连续的语义嵌入空间,借助语言模型内部的语义距离度量(如余弦相似度)来指导探索方向。与以往在 logits 或概率分布上使用温度 scaling、top-k/p 采样的方式不同,N-GRPO 直接在输入 embedding 上构造语义合法的变体,使模型能在相近语义区域内采样出不同但均合理的思考路径。这不仅提高了数学推理中解法多样性,也为 RL for LLMs 提供了更精细的 exploration-exploitation 控制杠杆。
- **通用稳健性与分布外泛化**:N-GRPO 在数学推理基准上的提升并非孤例,其在分布外(OOD)任务上也展现出泛化能力,表明语义邻居混合带来的不再是局部过拟合,而是对语言模型策略表征的有效正则化。这一结果提示,在嵌入空间施加平滑性先验(即相邻语义点应具有相似的策略输出)可能成为强化学习阶段提升 LLM 稳定性与泛化性的通用原则,对需要跨领域迁移的 agent 训练具有直接工程价值。
方法
方法核心:从 Rollout 瓶颈到语义邻居混合
N-GRPO 在 GRPO 强化学习框架中引入 Semantic Neighbor Mixing,解决标准 rollout 阶段探索不足或语义破坏的 trade-off。其关键输入是问题的 token 化嵌入序列,输出是注入语义多样性且保持连贯性的 rollout 轨迹,用于策略优化。
输入 → 关键模块
- 嵌入检索:对序列中每个 token(锚点),在预先构建的语义邻居表(基于余弦距离,如用
cosine度量)中查找 top-k最近邻。邻居表离线构造,使用模型自身的嵌入矩阵,确保局部流形保真。 - 混合表示构造:按设定的混合比率
α(如 0.2),对锚点嵌入与其邻居做线性插值:h_mix = (1-α) h_anchor + α h_neighbor。此操作在嵌入层而非 token 层完成,使得输入表示在语义空间内平滑游走,避免脱离分布。 - GRPO 集成:混合后的嵌入序列直接送入 transformer 各层,产生更丰富的 rollout 轨迹。GRPO 利用这些轨迹计算组相对优势(group relative advantage),更新策略网络。混合仅在训练时的 rollout 阶段作用,推理阶段可关闭(可选:推理时开启以测试一致性,见原文 4.6 节)。
输出与优化
- 生成多条语义多样但有效的解题路径,消除 token 级采样的冗余改述。
- 保持局部语义连贯性,优于在嵌入空间注入高斯噪声(后者常导致无意义输出)。
- N-GRPO 在 DeepSeek-R1-Distill-Qwen 上训练,数学推理(如 MATH)与 OOD 任务(如科学推理)基准上均超越同等配置的 GRPO 基线。
与同类方法的差异点
不同于 token 级采样(温度调节、top-p)仅在输出分布上重排,N-GRPO 在输入嵌入空间进行确定性语义扰动,从而产生更深层次的推理路径变化;不同于 随机噪声注入(如 Noisy Embeddings),它严格沿语义邻居方向混合,避免破坏模型已学到的内部表征结构。
实验
实验设计
N-GRPO 基于 GRPO 框架,使用不同规模的 DeepSeek-R1-Distill-Qwen 模型进行验证。评估涵盖三类场景:
- 数学推理基准(如标准数学题集)检验生成轨迹质量与最终答案准确率。
- OOD 测试(分布外任务)评估方法的泛化鲁棒性。
- 消融分析:系统考察混合比率、混合机制、距离度量等因素的影响,并将方法迁移至 GSPO 以检验通用性。
基线包括:token‑level 采样(常生成仅措辞变化的冗余轨迹)和 embedding‑level 随机噪声(易破坏语义一致性)。
关键发现
- N-GRPO 在数学推理任务上一致超越强基线,尤其在多样性‑准确率 trade‑off 方面表现突出。
- OOD 任务上的稳定提升表明语义邻域混合没有过拟合到特定分布,而是捕获了更通用的推理模式。
- 消融证实:适当的混合比率、语义邻居选择及距离度量(如余弦相似度)是性能关键;结构化的探索比单纯增加计算量更有效。
- 推理阶段亦可应用语义邻居混合,但需权衡额外计算开销。
与基线的深度对比
与 token‑level 采样相比,N-GRPO 在 embedding 层即注入多样性,避免了因表面措辞变化导致的冗余,使探索更高效。相较于 embedding‑level 随机噪声,语义邻域约束确保变化沿局部流形进行,不会引入违法语法或常识的序列,因此候选解既丰富又可靠。该方法从根源上解决了 rollout 阶段“多样性 vs. 语义一致性”的长期矛盾,将增益归因于结构化的探索策略而非简单增加 compute。
行业影响
落地场景
N-GRPO 提出的 语义邻居混合 (Semantic Neighbor Mixing) 策略显著提升了大语言模型在数学推理中的探索效率与轨迹多样性,同时保持语义一致性。这直接利好以下产品与业务:
- 教育科技:自适应数学辅导系统可生成更多样且有效的解题路径,避免重复表述,提升答疑覆盖度。
- 代码助手:在代码生成与补全场景中,该方法能帮助模型探索语义相近但表达不同的代码片段,增强生成多样性。
- 科学计算与金融建模:需要严谨多步推理的领域(如量化策略开发、定理证明),N-GRPO 可生成更可靠的候选推理链,提升决策质量。
- 内容平台与电商搜索:复杂的多跳推理查询(如商品规格对比、合规审查)可受益于更鲁棒的推理路径生成。
商业价值
降本:N-GRPO 减少了大量无效采样(token-level sampling 的冗余轨迹),在同等计算资源下获得更高奖励信号密度,直接降低推理时 rollout 成本。 增收:更强的推理能力可直接作为增值功能出售(如教育平台的高阶解题会员、API 调用溢价),或通过提升核心业务指标(搜索准确率、风控召回)间接增收。 体验提升:更准确的解题和解释能力大幅改善用户信任与留存,尤其在需要透明推理的行业(医疗咨询、法律分析)。
与现有工作流的集成
N-GRPO 可直接嵌入基于 GRPO 或 PPO 的强化学习训练流水线,替换 rollout 阶段的采样策略:
- 训练阶段:在 RL 微调时,用 Semantic Neighbor Mixing 替代默认的 token 级随机采样或加噪方法,无需改动奖励模型和策略模型架构。
- 推理阶段:可作为推理增强插件,通过配置
mixing_rate和向量检索库(如 FAISS)动态生成混合嵌入,对现有 vLLM/TGI 等推理框架轻量适配。 - 数据合成:用于生成高质量多样化的推理数据,补充到 SFT 数据集,提升有监督微调效果。
具体 Use Case
- 在线数学家教应用:用户提交一道竞赛几何题,后端模型利用 N-GRPO 并行生成 5-10 条语义不同但均有效的解题思路,系统筛选正确路径并转为自然语言讲解,显著降低“答非所问”率。
- AI 量化交易研究:策略研究员用 LLM 辅助推导因子逻辑,N-GRPO 可在每个推导步骤生成多个语义合理但方向微调的备选公式,加速因子挖掘与回测迭代。
局限
- - **对预训练嵌入空间过度依赖**:语义邻居混合的质量完全取决于底层模型的嵌入空间是否能准确反映下游任务的语义关系。论文使用 DeepSeek-R1-Distill-Qwen 的固定嵌入层,未探索不同模型、不同层或微调后嵌入空间变化的影响。当任务分布偏移时(如数学符号、代码关键字),余弦相似度可能无法捕获领域特定的相似性,导致注入的邻居 token 破坏原始语义,反而增加无效轨迹。
- - **推理时计算开销尚未明确量化**:在 GRPO 的 rollout 阶段,每个 token 均需实时检索其语义最近邻(附录 G 仅简要提及开销,未给出具体吞吐量下降数据)。即使采用近似最近邻(ANN),该步骤仍会增加额外延迟,且开销随词表规模增长。对于需要高速采样的大规模在线 RL 训练,这可能导致训练时间显著延长,影响工程实用性。
- - **任务泛化范围较窄**:实验仅在数学推理(GSM8K、MATH 等)和少量科学推理 OOD 任务上验证,未涉及代码生成、多跳推理、多语言数学等其他需要严格 token 序列的领域。在这些任务中,嵌入混合可能破坏语法结构或关键逻辑 token(如缩进、括号),引入难以预料的退化。此外,所有实验均基于 Qwen 架构,方法的跨模型通用性尚未证实。