从专有到开源:通过智能搜索中的多智能体协议蒸馏弥合分布差距
智能搜索使大语言模型能够通过交织多步推理与检索来解决知识密集型任务,但基于结果的强化学习仅提供稀疏监督。知识蒸馏可提供更密集的指导,而具有强大推理能力的先进专有模型是理想的教师。尽管从专有模型蒸馏可以增强监督信号,但传统logit匹配因隐藏logit和分词器不匹配而被排除,而原始自然语言轨迹模仿则传播表面风格伪影而非核心推理能力。 为解决异构蒸馏问题并弥合分布差距,我们提出多智能体协议蒸馏(MAPD),一种联合蒸馏与强化学习框架,使用结构化的、风格归一化的协议作为中间表示。离线多智能体系统(MAS)分解每个查询、检索支持证据、修复失败搜索,并将探索轨迹转换为JSON协议,包含任务类型、推理计划和可提取的 grounding 事实。训练时,协议仅提供给学生策略的特权分支,其 token 分布提供密集蒸馏信号与稀疏 RL 目标。 在七个 QA 基准上的广泛评估表明,MAPD 持续优于竞争性蒸馏和 RL 方法,在 Qwen3-1.7B 上平均成功率达 39.4%,在 Qwen3-4B 上达 44.4%。关键的是,该框架能稳健泛化到多种专有教师,同时有效缓解学生策略的风格漂移和冗长退化。
论文精读
TL;DR MAPD 用多智能体离线协作生成结构化 JSON 协议,将闭源教师的核心推理能力蒸馏给学生模型,结合 RL 解决从闭源到开源的分布鸿沟和风格漂移,在 agentic search 上显著超越基线。
问题
Agentic Search 将多步推理与检索交替执行,是当前解决知识密集型任务的关键范式。该领域普遍关注如何利用强化学习(RL)优化智能体搜索策略,但基于最终结果的 RL 奖励信号过于稀疏,导致样本效率低、收敛困难。
现有方法尝试通过知识蒸馏引入稠密监督,但面临严重局限:专有模型(如 GPT 系列)隐藏 logits 且 tokenizer 不匹配,无法使用传统的 logit-matching 蒸馏;直接模仿自然语言轨迹(trajectory imitation)又只能捕获表面的回答风格、冗长度等浅层特征,而非底层的推理规划、证据利用等核心能力,产生严重的 分布偏移(distribution gap)与风格污染。
该问题的难度在于,需在无法访问教师内部表征的条件下,剥离推理逻辑与文本表象,仅传递高层次的搜索策略与事实依据。这在 Agentic Search 中尤为突出:推理轨迹包含大量检索交互、错误修复等噪声,纯文本蒸馏极易引入虚假相关性。业界对“蒸馏专有模型推理能力”的需求强烈,但缺乏通用的异构本体对齐手段。MAPD 将其建模为协议蒸馏,类似于从复杂软件系统的众多交互日志中,提炼出与 UI 样式无关的 API 调用规范,让下游模块复用核心业务逻辑。
核心洞察
- **结构化协议蒸馏**: MAPD 将多智能体搜索轨迹转化为结构化 JSON 协议作为中间表示,解耦推理内容与语言风格,有效规避从专有模型蒸馏时常见的风格漂移与冗长退化。相比直接模仿自然语言轨迹或不可行的词元匹配,协议提供密集、语义明确的监督,使学生专注于学习推理规划与事实依据,而非表面文字。
- **多智能体协作信号转化**: 离线多智能体系统执行查询分解、证据检索、搜索修复等步骤,并将探索踪迹转换为包含任务类型、推理计划和提取事实的协议。这相当于将多步推理过程转化为密集训练信号,弥补了仅靠结果奖励的稀疏 RL 的不足,显著提升采样效率与学习稳定性;质量门控进一步确保协议可靠性。
- **联合训练与特权蒸馏**: MAPD 采用“特权分支”向学生策略透露协议,其词元分布提供密集蒸馏损失,与稀疏 GRPO 目标共同优化。该设计使模型训练时充分利用教师指导,推理时完全自主,无需协议,从而在开放域部署中兼顾监督密度与自主能力。框架可跨不同专有教师模型迁移,且成本可控。
方法
输入
给定自然语言查询 q,需要完成需要多跳推理与检索的知识密集型问答任务。训练阶段复用来自多个闭源教师模型(如 GPT‑4o、Claude、Gemini)的搜索轨迹作为隐式监督,同时外部工具(检索器)作为动作空间的一部分。
关键模块:多智能体协同搜索与协议生成
- 离线多智能体系统 (MAS):由多个专用智能体协作完成一次完整的 agentic search 探索。流程为:
- 分解与检索:将查询拆解为子问题,并行调用搜索 API 获取证据。
- 修复与合并:定位搜索失败步骤,重新规划检索,最终将探索路径整合为高质量搜索轨迹。
- 协议生成:将上述轨迹转换为风格归一化的 结构化 JSON 协议,包含:
task_type:任务分类(如比较、多跳推理等)reasoning_plan:逐步推理计划与子目标grounding_facts:提取的关键答案片段(extractive grounding),显式链接证据。 该协议剥离了原始输出中的冗余语言风格和 tokenizer 特异性,仅保留推理骨架与事实锚点。
- 质量门 (Quality Gate):对协议进行自动校验,过滤掉证据不完整或自相矛盾的样本,确保蒸馏数据的高信号密度。
输出
训练时,学生模型(如 Qwen3‑1.7B/4B)以双分支方式接收两种输入:
- 标准分支:仅接收查询
q,进行常规 agentic search 生成,受稀疏结果奖励(RL 目标,采用 GRPO 算法)驱动。 - 特权分支:额外接收离线生成的黄金协议
p,产生对应的词元分布。该分布作为密集蒸馏信号(通过 Online Policy Self‑Distillation (OPSD) 损失),与 GRPO 的稀疏奖励联合优化。
最终损失函数由 GRPO 策略梯度损失 和 OPSD 蒸馏损失 加权求和构成(原文 L = L_GRPO + λ * L_OPSD),使 student 既保持探索能力,又密集吸收教师的结构化推理模式。
与同类方法的差异:传统蒸馏要么依赖不可获取的 logits 或 tokenizer 对齐,要么直接模仿原始自然语言轨迹导致风格漂移与冗长退化;MAPD 通过风格解耦的 JSON 协议实现异质模型间的分布桥接,将“教师怎么思考”而非“教师怎么说”传递给学生。
实验
实验设计
实验在 7 个知识密集型 QA 基准上评估 MAPD,覆盖单跳与多跳推理。学生模型为 Qwen3-1.7B 与 Qwen3-4B,教师来自多种先进专有 LLM(API 调用)。基线包括纯 RL(GRPO)、在线自蒸馏(OPSD)及直接模仿专有输出轨迹。主指标为任务成功率,辅以消融(协议字段、多智能体组件)、蒸馏权重、跨教师迁移及成本分析。
关键发现
MAPD 在两个规模上均显著优于所有基线:Qwen3-1.7B 平均成功率 39.4%,Qwen3-4B 达 44.4%。结构化 JSON 协议成功传递推理能力,同时抑制了风格漂移和冗长退化。消融显示,移除多智能体协作或协议中的任务类型、推理计划、事实依据任一字段均导致性能明显下降。联合稀疏 RL 与稠密协议蒸馏比单独任一更有效。
与基线的对比解读
相比直接模仿专有输出(易学到表面风格而忽略推理内核),MAPD 通过协议归一化消除风格干扰,使学生聚焦任务分解与证据检索的决策逻辑。相比纯 RL 仅依赖稀疏结果奖励,协议蒸馏提供了逐步行为正则,加速收敛并提升最终效果。即使更换不同专有教师,MAPD 性能稳定性远超直接蒸馏,表明协议表征对模型异质性(tokenizer 不匹配、隐藏 logits)具有更强适应力,为利用黑盒专有模型提升开源 LLM 搜索能力提供了可泛化范式。
行业影响
落地场景
MAPD 框架通过 结构化 JSON 协议 将闭源大模型的推理能力迁移至轻量学生模型,直接赋能 检索增强的智能代理搜索 类产品。典型场景包括:
- 企业知识库问答:将 GPT-4 级 teachers 的长链推理与多轮检索能力蒸馏到 1.7B~4B 小模型,支撑企业内部私有化部署的文档问答助手。
- 电商智能导购:用户输入模糊购物需求,代理搜索系统自主拆分查询、检索商品、核对规格,最终输出精准推荐,MAPD 让端侧或低成本服务端模型也能执行此类多步任务。
- 教育自适应学习助手:通过离线多智能体协作生成层次化推理协议,学生模型可模仿优秀教师的解题路径,提供步骤清晰、论据可溯源的答疑服务。
商业价值
- 显著降本:利用离线 MAS 一次性生成蒸馏数据,即可将昂贵闭源 API 的 query 成本压缩为本地小模型推理成本(论文显示成本降低约 90%),尤其适合高并发调用场景。
- 体验提升:相比传统行为克隆,MAPD 通过
protocol-based distillation抑制了风格漂移和冗余输出,使小模型回答更简洁、可靠,提升用户满意度。 - 增收潜力:快速响应的多步推理能力可直接嵌入搜索推荐、客服自动应答等商业闭环,缩短用户决策链路,提高转化率。
与现有产品/工作流的接口
MAPD 的输出是 强化学习 + 离线蒸馏 后的标准对话模型权重,可无缝集成进现有的 LLM 推理服务框架(如 vLLM、TGI)。其核心组件 多智能体生成管道 作为离线数据工厂,能够与各类 闭源 teacher API(如 GPT-4、Claude)对接,生产结构化的 JSON protocol 数据集。部署时,仅需在学生模型侧增加一个 特权分支(训练时使用,推理时丢弃),辅助计算蒸馏损失,对线上推理零侵入。
具体用例:某全球电商平台利用 MAPD 将内部自研小模型(4B)与 GPT-4o 对齐,搭建商品对比问答机器人。离线阶段,MAS 模拟搜索-比对-总结流程,生成 {“task_type”: “compare”, “reasoning_plan”: [...], “facts”: [...]} 协议;在线阶段,学生模型直接执行对比推理,响应速度提升 3 倍,API 成本降低 95%,同时回答正确率与 teacher 持平。
局限
- - 多智能体离线生成协议的开销与质量风险:MAPD 依赖离线多智能体系统(MAS)生成结构化 JSON 协议,该过程涉及查询分解、证据检索、搜索修复等多个步骤,计算开销较大且设计复杂。尽管 MAS 可离线运行,但对于大规模训练数据或动态适应新领域,维护和更新 MAS 成本较高,可能限制实用范围。协议质量高度依赖 MAS 设计与 prompt 工程,若 MAS 生成的协议存在错误或不完整,蒸馏信号将引入噪声,影响学生模型性能,而论文未充分讨论这种风险对最终性能的鲁棒性。
- - 学生模型规模与泛化性局限:实验仅在 Qwen3-1.7B 和 Qwen3-4B 两个相对较小的模型上进行验证,未在更大规模(如 7B、13B)模型上评估。虽然小模型更能体现蒸馏收益,但业界实际部署常使用更大模型,MAPD 在更大模型上的扩展性及收益幅度尚不明确。蒸馏所使用的教师模型是私有 API,实验虽分析了跨教师迁移,但仅覆盖有限几种教师,对跨不同厂商、不同能力水平教师的泛化深度不足,且未验证真实多教师混合训练场景,弱化了其“桥接分布差异”主张的普适性。
- - 对超参数与训练不稳定性的潜在敏感性:MAPD 联合优化稀疏 RL 与密集蒸馏损失,引入 OPSD 损失权重等关键超参数。论文虽进行了权重消融,显示该参数对性能影响显著,但未讨论不同任务或模型规模下超参数的鲁棒性,以及两种损失竞争是否容易导致训练不稳定。此外,协议蒸馏仅通过“特权分支”提供信号,这种不对称架构可能增加训练复杂度,实际落地需精细调节 warm-up 和系数衰减,相关工程细节未充分披露,增加了复现与部署的难度。