论文

Allspark:通过交替思维链实现弱到强迁移

Allspark:通过交替思维链实现弱到强迁移

前沿模型的进展重新点燃了对大规模 强化学习(RL)的兴趣,但大模型 rollout 的生成成本高昂,连测试 RL 配方都代价不菲。我们追问:小规模 弱模型 学到的推理改进,能否在不使用强模型 rollout 训练的前提下惠及更大更强的模型? 我们提出 Allspark,一个以 交替思维链 实现 弱到强迁移 的训练与推理框架。训练时,弱教师 与同一模型的冻结副本协同训练,二者交替生成推理片段,由冻结模型给出最终答案。推理时,更强的 学生 替换冻结的训练伙伴,两者均保持固定。由于二者以文本通信,教师可引导学生跨越不同模型家族与不同 tokenizer。 我们在两个尺度上研究 Allspark:受控的 Qwen 数学与推理实验,以及规模更大的 Inkling 实验(在 ARC-AGI-2 数据集上)。 Inkling 实验在同家族与跨家族设置中均取得准确率提升,包括迁移到 Kimi 与 Nemotron,且收益随推理设置而变化。这些发现支持复用已训练的弱教师来服务多个强学生,并考察由此产生的 准确率—token 权衡。

论文精读

TL;DR 训练弱模型作为教师,通过与冻结伙伴交替生成思维链段学习引导;推理时替换为更强学生,无需学生参与训练,即可跨模型家族提升 ARC-AGI-2 等推理准确率。

问题

领域现状

当前前沿模型在推理任务上的提升越来越依赖大规模强化学习(RL) 的迭代,但生成大模型 rollout 的训练成本极高,连验证 RL 配方都昂贵。

现有方法局限

  • 传统 weak-to-strong 通常需要训练强学生,或把弱模型输出作为监督信号继续训练目标强模型;这仍需强模型前向/反向计算,且可能破坏强模型原有能力。
  • 针对冻结强模型的 guidance 方法(如上下文提示、激活干预)往往只适配单一模型或相同 tokenizer,跨模型家族迁移能力有限。
  • 弱教师与强学生推理分布差异大,纯文本传递信息不够精确,难以稳定提升强模型的具体任务表现。

为什么难/重要

挑战在于:如何在不给强模型产生训练 rollout 的前提下,让弱模型学到的推理策略迁移到任意强模型(不同规模、不同家族、不同 tokenizer)。这直接影响 RL 成本结构:若一次训练的弱教师能服务多个强学生,推理成本与训练成本可解耦,对业界在大模型 RL 迭代中有重要现实意义。

行业类比

可将此类比为:用一个低成本的调度/提示策略模型去引导多个异构大模型完成复杂推理,类似 Kubernetes 中的通用控制面与异构节点。

核心洞察

  • Allspark 的核心价值在于证明弱模型可以通过交替思维链在推理阶段引导强模型,而不需要强模型参与训练 rollouts。与传统弱监督方法(如用弱模型生成伪标签微调强模型)不同,它不要求强模型在前向或反向中产生任何训练信号,且文本通信天然支持跨模型家族和 tokenizer,大幅降低大模型 RL 试错成本。
  • 论文展示了一个可复用的弱教师范式:训练时弱教师与自身冻结副本交替,学到的是通用的“推理介入”能力,而非针对特定强学生的适配。推理时替换为更强的学生,教师参数固定,即可对多个不同学生模型复用。这为 RL 资源受限场景提供了一种“一次训练、多次受益”的思路,与常见的一次性蒸馏或 RL fine-tuning 形成差异。

方法

输入

给定一个推理任务 prompt,以及两个模型:一个可训练的 弱教师(weak teacher)和一个冻结的 强学生(strong student)。训练阶段,弱教师与自身同参数的冻结副本交替生成思考片段;推理阶段,冻结副本被替换为更强的学生模型。

关键模块

  1. 交替链式思考
    教师与冻结伙伴按 teacher → frozen → teacher → ... 的顺序轮流输出推理段落(segment),最后一轮由冻结伙伴给出最终答案。双方通过自然语言文本交互,不共享隐藏状态,因此不受 tokenizer 或模型架构限制。

  2. 弱教师强化学习训练
    训练时冻结伙伴不更新,仅弱教师通过策略梯度类 RL 损失优化。奖励来自最终答案正确性(可能结合格式或长度约束)。训练协议包括异步 rollout、解耦的 solution advantage 估计、masked sampler-head centering 等技术,以稳定小模型 RL 训练。

  3. 跨模型与跨家族迁移
    由于通信依赖文本,教师可驱动完全不同 tokenizer 和家族的学生(如从 Qwen 教师迁移到 Kimi、Nemotron)。推理时两者均冻结,只消耗推理算力,不需要强模型任何训练 rollout。

输出

推理阶段,弱教师与强学生交替生成文本,最终答案由强学生输出。实验评估在数学推理和 ARC-AGI-2 上验证了准确率提升与 token 开销的权衡。

与同类方法的差异点:不同于将弱教师蒸馏到强学生或直接使用强模型自生成 rollout 训练,Allspark 通过文本级交替推理在推理时动态引导强学生,完全避免强模型训练数据产生成本。

实验

实验设计

Allspark 采用 弱教师-冻结学生交替推理 框架。训练时,弱教师与自身冻结副本轮流生成推理片段,冻结副本产生最终答案。推理时,更强学生替换冻结副本,两者均保持固定,仅通过文本交互。研究分两个尺度:受控 Qwen 实验覆盖数学与推理任务;更大规模的 Inkling 实验在 ARC-AGI-2 上评估,并包含跨家族迁移到 Kimi 和 Nemotron。

关键发现

Inkling 实验表明,在家族内与跨家族设置中均获得准确率提升,且收益因推理设置而异。具体提升幅度论文未给出数值,但作者强调:一个训练好的弱教师可复用于多个强学生,需进一步考察准确率与令牌消耗的权衡。

对比解读

相比大规模 RL 依赖强模型 rollout 的高昂成本,Allspark 在训练阶段完全不需要强模型参与,仅用弱模型学习推理改进。与直接微调强模型不同,它保持学生权重固定,通过文本 steering 实现迁移,可跨模型家族和不同 tokenizer 工作,为低成本提升大模型推理能力提供了新路径。

行业影响

落地场景

Allspark 适用于推理密集型产品:数学辅导、代码生成、复杂客服问答、企业知识库检索增强场景。小模型训出的 weak teacher 可在推理时引导更大的 frozen student,无需生成大模型 rollout 即可复用策略。例如电商平台的售后责任判定、教育产品的分步解题引导,均可部署 teacher-student 交替推理链路。

商业价值

主要价值在降本:训练阶段只用小模型生成 rollout,避免大模型采样开销;推理阶段由小模型承担部分思考,可降低 token 消耗与延迟。同时可能通过 teacher 引导提升 student 准确率,带来体验提升。相比直接对大模型做 RL,企业能以更低成本迭代推理策略,尤其适合算力预算有限的团队。

跟现有产品/工作流的接口

Allspark 通过文本消息在 teacher 与 student 间传递中间思考,天然兼容不同模型家族和 tokenizer,可封装为推理网关中的一个中间件:现有 LLM 服务收到复杂请求后,先由 teacher 生成推理片段,再交给 student 续写和作答。与 vLLM、Ray Serve 等 serving 栈集成时,只需增加 alternating handoff 协议;与 TRL、OpenRLHF 等 RL 框架配合,teacher 训练可复用现有 PPO/GRPO 实现。

具体 use case:

  • 电商平台售后仲裁:用 7B 模型训出 teacher 判断退货责任,推理时引导 70B 模型给出最终结论,降低 70B 模型调用成本,同时提升规则一致性。
  • 在线教育数学辅导:小模型 teacher 负责分步提示和错误诊断,大模型 student 生成完整解答,减少大模型重复推理 token,改善实时互动延迟。

局限

  • **论文承认的局限**:教师模型在与冻结副本交替训练的特定任务上表现良好,但当学生模型更强或属于不同家族时,迁移收益会随推理设置变化而不稳定,部分场景甚至无增益或负增益;此外,交替推理机制增加了推理链长度和 token 消耗,对低延迟、低成本场景不友好,训练阶段也需要额外的长度控制和终止策略。
  • **可推断的局限**:教师模型在训练时仅与同规模的冻结副本交互,从未见过更强学生的推理风格,因此面对能力远超教师的学生模型时,其引导策略可能不够鲁棒,容易产生误导或低效干预;同时学生模型完全冻结,无法适应教师的语言习惯和推理模式,可能因词汇或格式不匹配而影响最终答案质量。
  • **与同类工作对比**:相比利用强模型 rollout 或 weak-to-strong 联合训练的框架,Allspark 完全避免强模型数据,但可能牺牲了性能上限,因为学生没有机会根据自身能力调整推理路径;实验仅覆盖数学推理和 ARC-AGI-2,未在代码生成、开放域问答等更广泛任务上验证,跨家族迁移也只测试了 Kimi 和 Nemotron 两个外部模型,泛化性证据有限。
论文Kaizhao Liang2026-09-26原文

相关内容