WHALE: 一种联合权重-操控优化的简单方法
Agent 性能同时取决于模型参数与可执行的操控(harness)代码,后者管理上下文和控制流。若仅优化其中一方,系统可能受限于冻结的另一方:权重更新可能改变有效的操控,而操控更新也可能改变暴露的模型能力。现有的联合适应方法优化权重和文本提示,但将更广泛的操控固定不变。 我们提出 Weight-Harness Alternating LEarning (WHALE),一种简单方法,交替进行两个阶段:在当前操控下更新模型,然后在更新后的模型下搜索更优操控。两个阶段分别基于 在线拒绝采样微调 与 Meta-Harness。何时切换是关键设计选择:为避免过度优化变化中的另一方,WHALE 使用固定阶段时长或基于训练信号的自适应耐心规则。 在三个领域(搜索问答、数学推理、国际象棋谜题)中使用 Qwen3.5-2B/4B agent 的实验中,WHALE 相较纯权重、纯操控及 Fast-Slow Training,最佳 mean@8 准确率提升 4.15–24.38 个百分点。任一组件都可能成为瓶颈:操控搜索在 SearchQA 中以远少 rollout 达到纯权重最优准确率,但在数学任务中仅在权重更新后提升准确率。小规模交错更新在准确率和 rollout 成本上均优于阶段式先权重后操控的优化。代码见 https://github.com/krafton-ai/WHALE。
论文精读
TL;DR WHALE 通过交替更新模型权重与可执行 harness 代码,解决单独优化任一组件导致的瓶颈,在三个推理任务上较仅优化权重或 harness 的方法提升 4.15-24.38 个百分点。
问题
问题背景
Agent 系统性能由模型参数(权重)与可执行 harness 代码(上下文管理与控制流)共同决定,当前研究逐渐关注二者的联合优化而非单独调整。
现有方法局限
- Weight-only:在固定 harness 下微调模型,权重更新会改变有效 harness 分布,但 harness 不随之适配,系统可能被冻结的 harness 拖累;且微调易过拟合当前 harness 的 rollout 分布。
- Harness-only:固定权重搜索 harness,受限于模型已有能力,无法触及需要权重更新才能解锁的 harness 设计,尤其在数学推理等需要模型能力跃迁的任务中效果差。
- Prompt-level 联合适应:已有方法联合优化权重与文本提示,但执行器控制流、工具调用等 broader harness 保持固定,未覆盖 agent 的实际执行逻辑。
- 阶段式调度:如 Fast-Slow Training 先权重后 harness 或反之,忽略交替迭代中的互相增益,且 rollout 成本高。
为什么这个问题难/重要
难点在于两个组件相互依赖且评价信号噪声大:权重更新改变有效 harness 分布,harness 更新改变暴露的模型能力,切换时机需区分真实改进与噪声,避免对动态变化的对方过优化。工程上,权重微调与 harness 搜索的采样成本不同(weight update 需要大量 rollout,harness search 需要多次试错),联合调度需平衡精度与推理开销。业界对可复现、低成本的 agent 优化 recipe 需求强烈,联合优化能同时提升 best mean@8 accuracy 并减少 rollouts(如 SearchQA 上 harness search 以更少 rollouts 匹配 weight-only 峰值),对产品化 agent 有直接价值。
行业类比
类似 RAG 系统 中检索器策略与生成器权重的交替调优:只微调生成器而固定检索策略,系统容易被检索质量卡住;反之仅优化检索器也无法弥补生成推理能力的不足。
核心洞察
- **联合瓶颈视角**:WHALE 将 model weights 和 harness code 视为共同决定 agent 性能的两个可优化组件,单独优化任一都可能被另一个冻结组件限制。这与以往只优化 weights 和 textual prompts 的 joint-adaptation 方法不同,后者把 harness 视为固定环境。WHALE 的交替优化显式处理了两个组件间的相互依赖:weight 更新会改变有效 harness 空间,harness 更新则暴露新的模型能力,因此需要交错迭代而非一次性优化。
- **非平稳联合搜索的调度机制**:WHALE 的关键工程贡献在于切换时机设计——用 fixed phase durations 或 adaptive patience rule 区分真实改进与噪声,避免对持续变化的 counterpart 过拟合。在 SearchQA 中 harness search 能以更少 rollouts 达到 weight-only 峰值精度,但在数学推理中必须经过 weight 更新后才能提升,表明自适应切换能识别瓶颈并分配算力,优于 stagewise 的 weight-then-harness 流程。
方法
输入与目标
输入包括基座模型权重(如 Qwen3.5-2B/4B)、初始可执行 harness 代码(管理上下文与控制流)、任务域数据和二元 verifier。目标是联合优化权重与 harness,提升 agent 在推理任务中的 mean@8 准确率。
关键模块
Phase A:权重更新(在线拒绝采样微调)
在当前 harness 下采样多条轨迹,利用 verifier 筛选正确解,仅对正确轨迹进行监督微调。该阶段改变模型参数,可能使原 harness 不再最优。
Phase B:harness 搜索(Meta-Harness)
在更新后的模型上搜索更好的 harness 代码,搜索空间由各领域的手工设计原语构成。搜索过程以验证准确率或 rollout 成本为信号,产出适配当前权重的可执行 harness。
切换策略
采用固定 phase 时长或自适应 patience 规则:当训练信号(如近期准确率增益)不再显著时切换阶段,避免对不断变化的对手过度优化。
输出与效果
输出联合优化后的模型权重与 harness 代码。在 SearchQA、数学推理、国际象棋谜题上,WHALE 相比 weight-only、harness-only 及 Fast-Slow Training 提升 4.15–24.38 个百分点;小步交错更新在准确率和 rollout 成本上均优于先权重后 harness 的分阶段优化。
差异点
与 Fast-Slow Training 仅优化文本提示不同,WHALE 直接交替搜索可执行 harness 代码,捕捉权重变化与 harness 结构的深层交互,而非固定 harness 外壳下的提示级适配。
实验
实验设计
WHALE 在 Qwen3.5-2B/4B 智能体上评估,覆盖 SearchQA、数学推理和国际象棋谜题三个领域。权重阶段使用 在线拒绝采样微调,harness 阶段使用 Meta-Harness 搜索,阶段切换采用固定时长或自适应耐心规则;基线包括 weight-only、harness-only 和 Fast-Slow Training。
关键发现
- WHALE 在
best mean@8 accuracy上比所有基线高 4.15–24.38 个百分点。 - 瓶颈可来自任一侧:SearchQA 上 harness 搜索以极少的 rollout 即追平 weight-only 峰值,但数学推理需先做一次权重更新才能提升。
- 小步交替更新在精度和 rollout 成本上均优于先权重后 harness 的分阶段优化。
基线对比解读
仅优化权重或 harness 会被冻结的另一组件限制;Fast-Slow Training 虽分阶段优化,但缺少交替调度容易过拟合当前对手。WHALE 用交替与耐心规则区分真实提升和噪声,避免对变化中的组件过度优化,因此取得一致且显著增益。
行业影响
落地场景
WHALE 适用于需要同时优化模型参数与 agent 控制流的场景,如搜索问答、数学推理、棋类谜题等。实际用例:电商智能客服(商品咨询 agent 检索产品知识库并生成回答,交替优化模型与检索/验证 harness,降低轮次、提高准确率);企业知识库问答(优化多步推理与文档调取逻辑)。当 harness 或模型任一成为瓶颈时,WHALE 能通过交错更新突破单边优化的上限。
商业价值
核心收益是降本增效:论文显示 harness 搜索在 SearchQA 上以远少 rollout 匹配纯权重优化峰值精度,意味着可用更少推理调用达到同等效果,降低 token 成本。对高准确性要求的业务(金融分析、医疗问答),减少错误输出可降低人工复核成本,提升用户信任与体验。开源代码(WHALE)便于快速试用。
与现有产品/工作流接口
现有 LLM 应用通常分离模型微调与 agent 编排代码。可将 WHALE 作为优化层集成:在 MLOps 流水线中,将权重更新阶段替换为 online rejection-sampling fine-tuning,并引入 Meta-Harness 做 harness 搜索,用 adaptive patience rule 控制切换。该过程不需要重构推理栈,只需将 harness 参数化并提供评估信号;可与现有 agent 框架(如 LangGraph)和实验跟踪系统(如 MLflow)对接,周期性运行产出优化后的 checkpoint 与 harness 配置,再部署。
局限
- 论文未详细讨论 WHALE 在真实生产环境中的可扩展性。实验中 harness 搜索空间是预定义的离散候选集(例如不同推理循环结构和工具调用顺序),Meta-Harness 在该空间内搜索最优配置。但实际 agent 系统的 harness 代码可能包含更复杂的控制流、错误处理、多步规划等,预定义搜索空间可能无法覆盖所有有效实现。此外,搜索成本随空间增大而快速增长,限制了其在大规模代码库或动态变化环境中的应用。
- 实验仅使用 Qwen3.5-2B 和 4B 两个较小规模的模型,并在三个特定领域(SearchQA、数学推理、国际象棋谜题)上验证。虽然这些任务涵盖不同推理类型,但模型规模和任务多样性仍有限。对于更大模型(如 7B、13B 或更大)以及更多样的 agent 任务(如代码生成、多轮工具调用、开放域对话),WHALE 的效果是否保持或是否需要调整交替策略尚无验证。此外,模型基线和 harness 搜索空间的设计细节可能对结果有较大影响,需要更多消融研究。
- WHALE 的交替优化引入了额外的调度复杂度:需要决定何时从权重更新切换到 harness 搜索,以及每个阶段的持续时间。虽然提出了固定时长和自适应耐心规则两种方案,但自适应规则依赖于训练信号(如验证集准确率),可能引入新的超参数,并且不同任务间的最优设置可能差异显著。与单一的 weight-only 或 harness-only 优化相比,WHALE 需要同时维护两个优化循环,实现和调试成本更高。此外,与 Fast-Slow Training 等已有联合优化方法相比,WHALE 虽然性能更优,但可能对初始 harness 和初始权重更敏感。