面向小语言模型 agent 的 harness 感知蒸馏
语言模型 agent 总是与一个 harness 一同部署——harness 指模型周围负责管理上下文、工具与反馈的软件。当这样的 agent 被蒸馏到更小的模型时,harness 保持不变,因此学生模型主要需要的是 harness 无法提供的、教师特有的能力,例如如何正确地基于 harness 信息行动。然而标准的蒸馏方法会模仿教师的完整输出,并把 harness 当作输入的一部分。 为此我们提出 HAD(Harness-Aware Distillation),把蒸馏的重心放在「教师相对于 harness 额外贡献的部分」。HAD 在 on-policy distillation 的基础上加入两个组件: - action preference:在相同教师下对比「有/无 harness 信息」时的动作,并在学生自身推理之后进行打分; - validity check:丢弃那些偏好动作与 harness 记录相矛盾的偏好对。 我们表明,这种对比能为学生提供仅靠模仿教师无法获得的信息,且 HAD 不需要任务奖励、成功标签或未来信息。在多个 长时程 agent 基准 与模型上,HAD 在固定同一 harness 的设置下优于 on-policy distillation 基线。分析显示,HAD 进入无效循环的次数更少、从错误中恢复的频率更高,并表明它会自适应地把可学习的反馈保留在权重中,同时从 harness 读取状态信息。
论文精读
TL;DR Harness-Aware Distillation (HAD) 通过对比有无 harness 信息时教师的动作偏好并过滤无效动作,蒸馏小语言模型代理;在长程任务上超越标准蒸馏,无需任务奖励或成功标签。
问题
问题背景
当前智能体压缩趋势:大 LLM 智能体虽强大,但推理成本高,业界普遍探索将其蒸馏到小模型,以便在资源受限环境部署。智能体通常与 harness(管理上下文、工具调用、反馈的中间件)协同工作,harness 在蒸馏前后保持不变。
现有方法局限
标准 on-policy distillation 直接模仿教师完整输出,将 harness 状态视为普通输入 token。其缺陷:
- 教师输出中很大部分是对 harness 记录的机械反应(如依据历史动作选择下一步),这些学生通过 harness 接口即可获取,模仿它们浪费容量且易过拟合。
- 教师输出还包括与 harness 冲突的动作(如忽略已有失败记录),标准蒸馏照单全收,导致学生继承错误行为。
- 需要 task rewards 或成功标签来区分好坏,但在长时程智能体任务中这些信号稀疏且难以获得。
为什么这个问题难/重要
- 技术挑战:智能体动作空间离散且巨大,反馈仅出现在回合结束,教师行为中哪些是“智能”决策、哪些是 harness 本身的默认逻辑难以分离。
- 业界关注度:轻量级智能体在客服、代码助手、自动化办公等场景需求旺盛,但压缩后的代理常陷入无效循环,错误恢复能力差,直接损害用户体验。
行业类比
类似边缘端自动驾驶:车辆中间件已提供传感器融合与路径规划基础,蒸馏应聚焦模型基于实时传感器输入的决策增益,而非重新学习整个中间件逻辑。
核心洞察
- HAD的核心是将蒸馏目标从模仿教师完整输出改为捕捉教师相对harness的增量行为。标准蒸馏把harness上下文当作普通输入,导致学生可能过度内化harness中已可获取的状态信息,或错误模仿教师依赖harness的推理。HAD构造同一教师在有/无harness信息时的动作对比,只学习由harness信息引起的、教师特有的动作差异。这比传统on-policy蒸馏更明确地区分模型权重应编码什么、harness应提供什么,且无需任务奖励或成功标签,适合长程任务。
- HAD的validity check用harness记录验证偏好对,丢弃正偏好动作与事实矛盾的样本,同时仅在学生自身生成的推理前缀下对动作做偏好学习。前者弥补偏好标签可能错误的缺陷,把外部结构化状态当作可验证事实源;后者避免强迫学生模仿教师的推理风格,聚焦于可执行动作的正确性。两者共同降低噪声,使无奖励的偏好蒸馏在真实harness中可用,并解释了学生减少无效循环、提高错误恢复率的现象。
方法
方法核心:Harness-Aware Distillation (HAD) 针对部署在固定 harness(软件外壳,管理上下文、工具和反馈)中的语言模型智能体蒸馏问题。标准蒸馏将 harness 内容视为输入的一部分,并要求学生模仿教师完整输出;HAD 则显式分离教师超越 harness 的“增量能力”。
输入:教师模型、学生模型、固定 harness、交互轨迹数据集。训练时学生仅通过 harness 接收状态和反馈。
关键模块:
- 动作偏好学习:对同一训练样本,让教师模型分别在有无 harness 上下文条件下生成动作,构成动作对。若两种条件下动作不同,则该样本被纳入偏好学习:偏好有 harness 条件下的动作(视为更符合环境约束),但该偏好在学生自身推理输出之后计算,即比较学生对两个动作的概率,而非直接拟合教师输出。
- 有效性过滤:利用 harness 记录检查偏好动作是否与实际环境状态一致;若偏好动作与记录矛盾(例如已被记录为无效),则丢弃该偏好对,避免引入噪声监督。
- 蒸馏损失:保留基础的响应蒸馏,让学生模仿教师的部分输出,但 HAD 通过额外对比损失放大教师独有的推理信号。
输出:学生模型权重更新,使其在学习教师知识的同时,将可以从 harness 读取的状态信息留在外部,而非内化到参数中。
跟同类方法差异:HAD 无需任何任务奖励、成功标签或未来信息,仅通过对比教师自身在不同上下文下的行为来提取“超越 harness”的知识,这是与依赖外部信号或完整模仿的蒸馏方法的根本不同。
实验
实验设计
在 ALFWorld、WebShop、ScienceWorld 三个长程智能体基准上,对比 HAD 与多个 on-policy 蒸馏基线(如标准 teacher-forcing 蒸馏),所有方法使用相同的固定 harness。评估指标包括任务成功率与动作正确性,另分析了智能体的无效循环次数与错误恢复率。
关键发现
HAD 在这三个基准上均优于基线蒸馏方法。定性分析显示,HAD 训练的智能体进入更少的无效循环,并能更频繁地从错误中恢复。进一步分析表明,HAD 自适应地将可学习的反馈保留在模型权重中,同时从 harness 读取状态信息,从而实现了更高效的“记忆-感知”分工。
与基线对比
标准 on-policy 蒸馏模仿教师的完整输出,隐式地把 harness 当作输入的一部分,导致学生过度依赖教师表面行为。HAD 仅蒸馏教师相对 harness 新增的信息:通过动作偏好对比(有/无 harness 信息时教师动作的差异)和有效性过滤(丢弃与 harness 记录矛盾的动作对),学生能学习到更本质的策略。这一差异解释了 HAD 在长程任务上更稳健的表现:学生不再单纯模仿教师每个 token,而是掌握了何时信任 harness、何时依赖自身推理。
行业影响
落地场景
- 长程 Agent 任务 蒸馏:适用于电商客服、企业自动化流程、内容审核等场景。例如,电商退货处理 Agent 中,harness 提供订单状态、退货政策和用户历史;小模型只需根据 harness 信息输出动作(如批准/拒绝)。HAD 蒸馏聚焦教师对 harness 信息的利用能力,而非完整输出,让 7B 级小模型也能胜任原本需要大模型的复杂流程。
- 工具调用型 Agent:在需要频繁调用外部 API 或数据库的场景,harness 记录工具返回结果,HAD 通过动作偏好对比强化学生模型对关键状态信息的响应,减少无效调用。
商业价值
- 降本:小模型推理成本远低于大模型,可支撑大规模并发(如客服高峰期);同时 HAD 无需额外任务奖励或成功标签,降低了数据标注和奖励模型训练成本。
- 增效:对比标准 on-policy 蒸馏,HAD 在多轮长程任务中成功率更高,减少无效循环和错误恢复次数,直接降低人工介入率,提升用户体验和任务完成速度。
- 体验提升:小模型延迟更低,agent 响应更实时,尤其适合交互式服务。
与现有产品/工作流的接口
- HAD 不改变推理时的 harness 架构,可直接嵌入现有 agent 框架(如 LangChain、AutoGen、自研 harness)。蒸馏阶段只需在标准 on-policy distillation 损失上增加 harness-aware action preference loss,可复用现有教师模型采样和训练管道。
- 与 PEFT/LoRA 等技术兼容,部署时小模型权重替换即可上线;harness 状态管理逻辑不变,业务方无需重构工具链或上下文管理模块。
- 适合作为大模型 agent 产品化中的能力压缩层:团队可先用大模型跑通流程,积累 harness 交互数据,再用 HAD 蒸馏出专用小模型,稳定上线。
局限
- - **依赖 harness 信息质量**:HAD 的有效性高度依赖 harness 提供的信息是否足够结构化且与任务相关。在真实部署中,harness 可能包含大量噪声、冗余或不完整的状态记录,此时构造的动作偏好对可能无法捕捉教师行为中的关键差异,导致对比信号微弱。此外,有效性检查 `validity check` 会过滤掉偏好动作与 harness 记录矛盾的对,这在 harness 记录本身不可靠时可能误删有用样本,降低数据效率。
- - **任务范围与评估局限**:实验主要在 ALFWorld、WebShop、ScienceWorld 等文本交互环境上进行,未覆盖更复杂的 GUI 操作、多模态工具调用或真实世界 API 场景。这些场景中 harness 的结构和反馈形式差异很大,方法的泛化性存疑。同时,动作偏好仅针对动作 token 而非完整响应,可能忽略推理链中与 harness 相关的关键信息,学生模型可能在推理阶段出现偏差。
- - **教师模型依赖性强**:HAD 的核心是对比同一教师在有/无 harness 信息时的动作差异,这要求教师模型本身对 harness 信息有足够敏感且正确的利用。若教师在某些状态下未利用 harness 信息或对 harness 信息的利用不稳定,构造的偏好对将缺乏指导意义,方法可能退化为普通 on-policy 蒸馏。论文未讨论教师模型质量下限,也未提供教师敏感度的诊断方法。