论文

Compress-Distill: 推理轨迹压缩用于高效知识蒸馏

Compress-Distill: 推理轨迹压缩用于高效知识蒸馏

推理模型产生的长思维链条轨迹 (chain-of-thought traces) 蒸馏成本高,且鼓励学生输出冗长。本文研究知识蒸馏前对这些轨迹进行事后压缩 (post-hoc compression)。 两个教师模型 Qwen3.5-397B-A17B 和 gpt-oss-120B 各生成约 283k 正确轨迹;两个指令微调模型将其压缩至原始字符长度的 8.6%-21.0%。在包含 48 次运行的主网格和七次 Qwen 教师截断消融实验中,压缩轨迹将训练 token 减少至原始的 12%-30%,训练速度提升 2.0-7.6 倍,推理输出缩短 3-19 倍(在较短的 gpt-oss 教师下降低较小)。 然而,原始轨迹在所有规模和两个教师下保持最高的下游准确率。一个长度匹配的原始轨迹截断消融显示,压缩并非仅仅受益于较小的 token 预算:模型压缩的轨迹通常优于或持平于简单截断,尤其对于较小学生,同时保持更短的推理输出。 总体而言,推理轨迹压缩提供了准确率-效率的权衡 (accuracy-efficiency trade-off) 而非免费改进:学生保留高达 96% 的原始轨迹准确率,同时获得高达 18 倍 的单位 token 效率提升;在 0.8B 规模下使用 LoRA,压缩轨迹缩小了原始与压缩之间的差距但未超越原始。

论文精读

TL;DR 对推理模型的长思维链进行事后压缩再蒸馏,训练token降至12-30%,推理长度缩短3-19倍,以最高4%的精度损失换取高达18倍的每token效率,且模型压缩优于等长朴索截断,为知识蒸馏提供了清晰的精度-效率权衡方案。

问题

问题背景

推理模型(如 Qwen3.5-397B-A17Bgpt-oss-120B)通过生成长达数千 token 的 思维链轨迹(chains-of-thought traces) 取得高准确率,但将其知识蒸馏到小型学生模型时,原始长轨迹带来巨大挑战:训练计算开销高昂,且学生模型在推理时也倾向输出冗长响应,增加部署延迟和成本。

现有方法局限

  • 直接蒸馏原始轨迹:保留完整推理过程有利于学生学会深度推理,但训练 token 量膨胀数十倍,蒸馏时间和 GPU 成本陡增,且学生推理输出长度失控,不适合实时应用。
  • 仅用答案监督(Answer-only):成本极低,但完全丢弃思维链,学生无法学习中间推理步骤,下游任务精度显著下降,尤其复杂多步推理场景。
  • 简单长度截断(Naive Truncation):按预算粗暴裁剪轨迹尾部,未区分关键步骤与冗余描述,容易切断逻辑链,导致蒸馏效果不稳定,且仍可能保留大量冗余,压缩效率不高。

为什么这个问题难 / 重要

思维链 逻辑严密性与自然语言冗余性并存,压缩需在保持关键推理步骤的前提下移除解释性、重复性语句,这要求压缩模型具备 语义理解与推理结构建模 能力,而不仅是机械删减。此外,压缩质量的评估维度多元(训练效率、推理长度、下游准确率),三者间存在 精准权衡,难以同时最优。业界正积极将大推理模型部署到端侧或低时延场景,对 低冗余、高保真的知识蒸馏方法 需求迫切,直接决定推理能力迁移的可行性和性价比。

行业类比

类似在 代码辅助工具 中,将大型模型的长篇代码解释压缩为关键步骤注释,再用于微调小型编码助手,以在有限上下文窗口内保留核心推理逻辑。

核心洞察

  • **压缩推理轨迹不是免费午餐,而是精度与效率的清晰权衡**。本文首次系统论证了后验压缩在知识蒸馏中的成本-收益边界:原始完整轨迹始终保有最高下游准确率,压缩后可达原始96%精度,同时训练 token 量降至12-30%、训练加速2.0-7.6倍、推理输出缩短3-19倍。这一量化结果为工程决策提供了直接依据——团队可依据延迟/成本敏感度选择压缩比,而无需追求无损幻觉。与以往试图通过压缩提升准确率的工作不同,本文诚实揭示了压缩的本质是精度换效率的动态平衡。
  • **模型压缩优于朴素截断,揭示了语义压缩的独特价值**。在长度匹配的截断实验中,经指令微调模型压缩的轨迹在多数设置下优于直接截断原始轨迹,尤其是对小型学生模型效果更显著。这表明压缩并非简单削减 token 预算,而是通过模型理解任务关键步骤、剔除冗余与无关枝节,从而在相同长度下保留更高质量的监督信号。与仅依赖启发式截断的方法相比,这种语义级压缩为构造高效蒸馏数据提供了新的方法论,可有效避免截断导致的关键推理链丢失,对 miniaturization 场景具有重要工程指导意义。

方法

Compress-Distill 方法分为三个阶段,以 教师推理轨迹 → 压缩 → 学生蒸馏 为主线,将冗长的思维链压缩后再用于知识蒸馏。

1. 轨迹生成

给定一组训练查询,教师模型 Qwen3.5-397B-A17Bgpt-oss-120B 各自生成链式推理轨迹。每名教师对约 283k 个正确回答的样本产生完整原始轨迹,仅保留答案正确的样本以确保监督信号质量。

2. 轨迹压缩

引入两个指令微调的压缩器——Llama-3.3-70B-InstructMinistral-3-14B-Instruct-2512——对原始轨迹进行后处理压缩。使用统一、通用的压缩提示(single, generic compression prompt),不设计领域专用模板。压缩器将每条轨迹缩减至原始字符长度的 8.6–21.0%,同时尽量保留推理关键步骤。压缩过程完全离线、独立于教师与学生,避免了重新生成轨迹的高昂成本。

3. 学生训练

压缩后的轨迹被用于知识蒸馏,监督多种规模的学生模型(0.8B 到 20B 级)。蒸馏方式包括 LoRA 适配器全参数微调,并与原始轨迹蒸馏、长度匹配的朴素截断蒸馏进行对比。

输入:训练查询与原始推理轨迹 → 压缩器:指令微调 LLM → 输出:压缩轨迹 → 学生训练:监督微调。该方法的核心创新在于 后验压缩,而非在推理时隐式优化轨迹长度。与隐式长度控制或蒸馏中动态生成短轨迹的同类工作相比,Compress-Distill 提供了一个解耦的、可复用的压缩步骤,且通过消融实验表明,模型压缩优于简单截断,在缩短推理输出长度的同时保持了更高的准确率。

实验

实验设计

本工作采用两阶段流水线:先用两个大型教师模型(Qwen3.5-397B-A17Bgpt-oss-120B)在推理数据集上生成约 283k 条正确的链式思考(CoT)轨迹,再使用两个指令微调模型(Llama-3.3-70B-InstructMinistral-3-14B-Instruct-2512)对这些轨迹进行后压缩,压缩至原字符长度的 8.6–21.0%。压缩后的轨迹用于知识蒸馏,学生模型涵盖 0.8B 至 20B 参数规模,微调方式包括 LoRA 与全量微调。主实验网格包含 48 次运行,并增设基于 Qwen 教师轨迹的长度匹配截断消融实验,以区分压缩带来的额外增益。

关键发现

  • 原始长轨迹在所有学生尺度和教师类型上保持最高下游准确率,压缩轨迹无法超越,最高仅保留 96% 的原始准确性。
  • 但压缩带来巨大效率红利:训练 Token 量降至原始的 12–30%,训练加速 2.0–7.6 倍,推理输出长度缩短 3–19 倍(gpt-oss 教师下缩短幅度较小)。
  • 长度匹配的截断消融表明,模型压缩并非仅依靠减少 Token 预算获胜:尤其在小规模学生上,压缩轨迹通常优于或持平于朴素截断,同时保持更短的推理输出。
  • 压缩还能传递“简洁性”,学生模型生成的推理过程明显更短,有利于推理效率。

与基线深度对比

基线是未压缩的原始长轨迹蒸馏。压缩提供了一条准确率-效率权衡曲线,而非免费提升。在 0.8B + LoRA 场景下,压缩与原始的差距缩小但未超越。朴素截断虽也能减少训练成本,但模型压缩在同等长度下保留更多有效信息,说明压缩器学会抽取核心推理步骤而非简单丢弃。实际部署中,工程师可按需选择:若资源充裕且追求极致准确,仍推荐原始轨迹蒸馏;若需低成本快速迭代或约束学生模型输出长度,则压缩蒸馏是强有力替代方案,尤其在学生规模较小时,压缩的效率优势代价更小。

行业影响

落地场景

压缩推理链蒸馏(Compress-Distill)直接降低了将大型推理模型(如 Qwen3.5-397B)的知识迁移到小模型的成本,适用于对延迟和成本敏感的实时推理场景。例如:

  • 客服机器人:要求复杂问题推理(如多步退换货政策),但必须亚秒级响应。压缩链蒸馏出的 0.8B-8B 模型可部署在边缘或低成本 CPU 上。
  • 在线教育助教:需要逐步展示解题过程,但学生等待时间需短。压缩链使学生模型输出简洁,同时保留 90% 以上的正确率。

商业价值

  • 降本:训练令牌减少 70-88%,训练速度提升 2-7.6 倍,直接削减 GPU 小时成本;推理时输出长度缩短 3-19 倍,大幅降低 API 调用费用或硬件资源。
  • 增收:更低延迟带来更佳用户体验,可能提高客户留存与付费转化。
  • 体验提升:学生模型输出更简短,避免冗长思考链干扰最终答案,适合产品化交付。

与现有工作流集成

该方法作为知识蒸馏的即插即用预处理阶段:在教师生成链后,用一个指令调优模型(如 Llama-3.3-70B)压缩链,再送入标准蒸馏管线。无需改动原始教师或学生架构,可无缝接入 Hugging Face Trainer、DeepSpeed 等现有训练栈。压缩模型甚至可以采用 LoRA 以进一步降低成本。

具体案例

  1. 跨境电商订单争议处理:需依据多国法规推理,大型模型成本高昂。压缩链蒸馏出轻量模型,部署在客服终端,实时生成合规建议,每条查询成本仅为原来的 1/10,响应时间从 3 秒降至 0.3 秒。
  2. 金融研报摘要生成:需要长链推理解读复杂金融数据,但高频调用成本巨大。压缩链蒸馏的 7B 模型可运行在单卡 GPU 上,日处理万级请求,年节省云计算开支数十万美元。

总之,Compress-Distill 为推理能力民主化提供了精度-效率的实用权衡,工业界可依据自身精度要求选择压缩比例,从而在资源受限场景中释放推理模型价值。

局限

  • **准确率上限无法突破原始轨迹**:论文明确结论是‘raw traces retain the highest downstream accuracy at every scale and for both teachers’,压缩蒸馏本质上是在准确率与效率间做权衡,并不能同时兼顾。这限制了它在高精度敏感场景的适用性。压缩痕迹会丢失部分推理信息,导致学生模型在复杂任务上的表现弱于使用完整链式思考蒸馏的学生,即使通过长度匹配截断也未能完全弥补这一差距。
  • **压缩泛化性未充分验证**:方法仅使用固定通用压缩提示和两个指令微调模型(Llama-3.3-70B-Instruct 与 Ministral-3-14B-Instruct-2512)进行后处理压缩,未探索更精细的压缩策略(如分步骤、任务自适应压缩)在其他领域(编程、多语言推理)上的效果。此外,对压缩产物仅通过下游任务精度间接评估,缺少直接的忠实度(faithfulness)评估,可能导致错误步骤或幻觉被蒸馏给学生。
  • **压缩阶段引入额外计算与技术依赖**:压缩本身需大型语言模型推理,虽然降低了蒸馏训练 tokens 数量,但压缩过程的算力开销并未完全计入效率对比(论文主要关注训练加速)。更小的压缩模型(如 Ministral-14B)在准确率上不如大模型(Llama-70B),实际部署时需要在压缩模型规模、压缩质量与最终效益之间做取舍,存在潜在边际成本。
论文Maxime Griot2026-06-04原文

相关内容