SimpleOPD: 简单的分词器无关的在线策略蒸馏用于长上下文推理
在线策略蒸馏 (OPD) 为将推理能力从更强的教师模型迁移到学生模型提供了一种有前景的途径,但将其应用于长上下文推理教师和短上下文学生时,会带来实际挑战,包括分词器不匹配、师生分布不匹配、响应长度爆炸和训练不稳定。 在本工作中,我们通过将证明推理能力从长上下文推理模型 SU-01 迁移到短上下文学生模型来研究这一设置。为处理分词器差异,我们在共享文本空间中执行 OPD,并仅对齐在学生和教师分词器下占据相同文本跨度的 token。为缓解生成过长和频繁截断的问题,我们引入学生参考 KL 损失,并掩蔽特殊终止 token(如 </think 和 <|imend|)的优势。该策略约束学生不过度偏离其初始策略,从而缓解师生分布不匹配问题,并促进稳定的长度增长。 在同类和异类学生模型(包括 Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4)上的实验显示,在数学推理方面取得了一致的提升,尤其是在自然语言数学证明上。值得注意的是,Intern-S2-Preview 在 ProofBench 上提升了 21.2 分,达到 55.2,超过了 Gemini-2.5-Pro。在 HLE 和 HiPhO 等科学基准上也有提升,表明 OPD 迁移的推理能力能够泛化到数学训练领域之外。
论文精读
TL;DR SimpleOPD 通过跨 tokenizer 文本空间对齐、student reference KL 损失与特殊终止 token 掩码,将长上下文推理模型 SU-01 的证明能力稳定迁移到短上下文学生,在 ProofBench 上最高提升 21.2 分(Intern-S2-Preview 达 55.2,超越 Gemini-2.5-Pro)。
问题
问题背景
当前,on-policy distillation(OPD)已成为将强推理模型能力迁移到小模型的主流范式,尤其在数学、代码等推理密集型任务上效果显著。
现有方法局限
然而,直接把 OPD 应用于 long-context reasoning teacher(如 SU-01)与 short-context student 之间会遇到具体困难:
- tokenizer mismatch:教师与学生分词器不同,无法直接对齐 token 级 logits,传统 OPD 依赖同分词器或桥接映射,损失信息。
- response length explosion:长上下文教师倾向于生成极长证明链,短上下文学生模仿时长度失控,触发频繁截断,导致训练信号丢失。
- teacher-student distribution mismatch:学生初始策略与教师分布差异大,OPD 中的 on-policy 采样易使学生偏离过远,造成训练不稳定甚至崩溃。
为什么这个问题难/重要
- 长上下文推理模型能处理复杂证明、科学推理等长链任务,但这些能力向短上下文学生迁移具有高实用价值——能在有限上下文窗口内部署高效推理模型。
- 跨 tokenizer 蒸馏在业界普遍存在(不同模型家族分词器差异大),但现有方案多针对同 tokenizer,缺乏通用、鲁棒的跨分词器 OPD 方法。
- 长度控制与训练稳定性相互纠缠:单纯截断会丢失尾部推理步骤,不加约束则学生生成失控,需要在奖励塑形与策略约束之间精确平衡。
行业类比
这类似于将大型云端推理引擎的“长链思维”压缩到边缘设备时,上下文窗口和分词器不兼容导致的适配挑战,需同时解决表征对齐与行为约束。
核心洞察
- 跨分词器对齐不是通过重训或投影,而是在共享文本空间匹配相同文本跨度的 token,从而让任意教师-学生组合可直接进行 OPD。与常见做法(要求 tokenizer 一致、添加辅助投影层或训练时动态映射)相比,此方法完全绕过 tokenizer 差异,无需修改模型架构或额外参数,简单且通用。由于只对齐文本一致的 token,避免了因 tokenization 分歧导致的奖励信号错位,使得长上下文教师如 SU-01 的推理解码能无缝迁移到短上下文学生。
- 学生参考 KL 损失与特殊终止 token 优势屏蔽结合,构成双保险,专治长度爆炸与训练崩溃。传统 OPD 通常用教师分布或固定先验做 KL 约束,而这里用学生初始策略作为参考,防止策略过度偏离;同时屏蔽 </think> 和 <|im_end|> 的优势,避免学生学会过早终止或陷入重复输出。这有效抑制了 long-context 教师产生的长响应在短上下文学生中造成的截断和不稳定,使训练长度平稳增长。
- 训练域仅覆盖数学证明,却在 HLE 和 HiPhO 等科学基准上提升,说明 OPD 传递的是可泛化的推理过程而非领域记忆。与监督微调容易过拟合训练数据、蒸馏后仅在同分布任务上提升不同,SimpleOPD 通过在线采样和策略梯度保持探索性,学生学习的是逐步证明和自检能力。这暗示对于长上下文推理模型,OPD 是提取通用推理原语的有效途径,为构建短上下文但强推理的模型提供了低成本的可行路径。
方法
输入与流程
教师模型 SU-01 在数学证明任务上自采样生成长推理轨迹,作为 on-policy 蒸馏信号。学生模型(如 Qwen3、Intern-S2)接收相同文本提示,在共享文本空间中进行训练,而非各自的 token 序列。
关键模块
- 跨分词器对齐:学生与教师 tokenizer 不同,SimpleOPD 将文本按字符对齐,仅保留两个分词器下完全一致的 token span 用于蒸馏,从而避免 token 边界不一致带来的噪声。
- Student-Reference KL Loss:以学生初始策略为参考分布,计算 KL 散度,强制学生生成分布不要偏离初始策略太远,缓解教师-学生分布不匹配,并抑制长度爆炸。
- 特殊终止 token 屏蔽:对
</think>和<|im_end|>等终止 token 的优势值进行 mask,防止模型过早终止或产生异常循环,促进长度平缓增长。 - 训练目标:结合 PPO 风格的优势函数与上述 KL 惩罚,在已对齐的 token span 上计算损失,实现稳定的 on-policy 更新。
输出与效果
蒸馏后学生模型在 ProofBench 等数学证明基准上显著提升(如 Intern-S2-Preview +21.2 分),并泛化到 HLE、HiPhO 等科学基准。
与同类方法差异:常规 OPD 通常假设 tokenizer 一致,SimpleOPD 以 tokenizer-agnostic 的文本 span 对齐方式实现跨家族模型蒸馏,同时通过参考 KL 与终止 token 屏蔽解决长上下文蒸馏中的长度爆炸问题。
实验
实验设计
- 教师模型为长上下文推理模型 SU-01,向短上下文学生模型(Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4)进行 on-policy 蒸馏。
- 在共享文本空间进行 OPD,仅对齐学生/教师 tokenizer 下完全相同的文本 span;引入 student-reference KL loss 并 mask
</think>、<|im_end|>等终止 token 的优势,防止长度爆炸。 - 评测覆盖数学证明 ProofBench 与科学基准 HLE、HiPhO。
关键发现
- Intern-S2-Preview 在 ProofBench 上提升 21.2 分,达到 55.2,超过 Gemini-2.5-Pro。
- 同一家族与跨家族学生模型均有一致提升,尤其在自然语言数学证明任务上。
- 在 HLE、HiPhO 等科学基准上的提升表明 OPD 迁移的推理能力可泛化至训练领域之外。
与基线对比
- 标准 OPD 常出现长度爆炸与截断,导致训练不稳定;本文的 student-reference KL loss 约束学生不偏离初始策略过远,缓解了教师-学生分布不匹配。
- 特殊终止 token masking 抑制了无意义的终止行为,促进长度平稳增长;与普通 OPD 基线相比,本文方法在跨 tokenizer 与跨模型家族场景下更鲁棒。
行业影响
落地场景
SimpleOPD 可直接用于将长上下文推理教师模型(如数学证明、长文档推理)的能力迁移到短上下文学生模型,在资源受限或延迟敏感场景部署。例如:
- 在线数学教育:将证明题解答能力蒸馏到轻量模型,支撑实时解题辅导与自动批改。
- 企业合同/法律文档分析:长合同条款推理蒸馏到短模型,实现高并发、低延迟的合规审查。
- 科研文献辅助:长论文数学推导或科学推理能力压缩到端侧模型,供研究人员离线使用。
商业价值
- 降本:短上下文学生模型推理 token 消耗低、吞吐高,可大幅降低推理 API 成本。
- 增收:推理能力提升直接增强产品效果,如 ProofBench 上 Intern-S2-Preview 提升 21.2 分,可支撑更高定价或吸引付费用户。
- 体验提升:蒸馏后的短模型响应速度更快,同时保持长推理质量,改善交互体验;训练稳定性提升减少试错成本。
与现有产品/工作流的接口
SimpleOPD 可无缝集成进现有 RLHF/蒸馏 pipeline:
- 采用 shared text space 对齐不同 tokenizer 的 teacher/student,无需改变模型架构。
- 新增 student reference KL loss 与 special token masking 作为即插即用组件,兼容主流训练框架(如 HuggingFace、DeepSpeed)。
- 已验证跨模型家族(Qwen、Intern、GLM、Gemma),可迁移到企业自有多模型栈。
具体落地 Use Case
- 在线数学辅导:将长上下文证明推理模型蒸馏到短模型,部署在移动端 App,学生可即时获取分步证明解析,降低云端长推理成本。
- 金融合同审查:长合同条款的合规推理蒸馏到短模型,嵌入企业级文档处理流水线,实现批量低延迟分析,同时保持高准确率。
局限
- 论文主要验证在数学证明(ProofBench)上的蒸馏效果,虽然也测试了 HLE、HiPhO 等科学基准,但总体训练数据与评估仍偏重数学推理。对于更广泛的长上下文任务(如长文档问答、代码生成、多轮对话)能否保持增益尚不明确。此外,学生参考 KL 损失与特殊终止 token masking 的组合对超参数(如 KL 系数、mask 范围)可能敏感,论文未提供详细敏感性分析,实际调参可能需额外成本。
- 实验仅使用单一教师模型 SU-01,虽然学生覆盖多个家族,但教师能力的多样性不足,可能限制结论的普适性。跨 tokenizer 对齐方法假设存在共享文本空间,但当 tokenizer 差异过大(如多语言或特殊字符处理)时,能对齐的 token span 比例可能下降,影响蒸馏效率。另外,学生参考 KL 损失依赖初始策略质量,若基线学生模型较弱,可能抑制最终性能。
- 与现有 OPD 工作相比,本文提出的方案复杂度较低,但对比的基线相对有限,未与更先进的序列级蒸馏或动态规划方法全面比较。同时,论文未报告训练开销,对于大规模模型(如 long-context teacher)的在线采样成本可能较高,工程落地时需权衡。此外,特殊 token masking 可能引入偏差,对依赖终止 token 的任务(如代码生成)可能不适用。