论文

Task-CoEvolve: 通过自适应验证任务选择实现高效 Harness 优化

Task-CoEvolve: 通过自适应验证任务选择实现高效 Harness 优化

现有 LLM harness 优化方法在每一轮迭代中都会在固定验证集上全量评估,导致即使某些任务随 harness 演化逐渐失去区分度,仍要承担高昂的评估成本。为此,我们提出 Task-CoEvolve,一种自适应验证任务选择方法,使验证任务与 harness 协同演化。 Task-CoEvolve 核心在于两个挑战:选择信息量大的任务 与 从部分评估中估计全量性能。方法基于一个关键观察:候选 harness 之间存在分歧的任务,比那些始终被解决或失败的任务更具区分度。它采用 方差加权采样,依据历史结果将评估集中在能力前沿附近的任务上,采样分布随 harness 演化而自适应调整。随后,通过考虑采样概率估计全量分数,从而在评估不同子集的情况下仍能进行跨迭代的一致比较。 在在线文本分类与 Terminal-Bench 2.1 上的实验表明,Task-CoEvolve 始终优于基于子集的基线,并能匹配全量搜索的最终性能,同时将优化过程中的评估次数减少 80%。代码将发布于 https://github.com/Agent4Science-UTokyo/Task-CoEvolve。

论文精读

TL;DR Task-CoEvolve 通过方差加权采样让验证任务与 harness 共同演化,聚焦高判别力样本,将 LLM harness 优化评估成本降低 80% 且性能不降。

问题

背景

LLM harness optimization 领域正从静态适配走向动态改写 harness code 来提升下游任务表现,无需更新模型权重。该方法能以较低成本释放已有模型潜力,成为近期研究热点。

现有方法局限

现有方法(如 Meta-Harness)在每轮迭代中全量评估固定验证集,成本高昂。更重要的是,随着 harness 演化,部分任务对候选 harness 的区分度下降:那些被所有候选一致解决或一致失败的任务,对指导改写几乎无信息量,却仍占用全量评估的计算预算,导致优化后期大量评估浪费在非判别性任务上。

为什么难/重要

核心挑战在于验证任务与 harness 存在耦合:哪些任务最能暴露候选 harness 的差异并不固定,需要根据当前 harness 种群动态调整评估子集。同时,从部分采样结果估计全量分数会引入偏差,必须设计无偏或低偏估计量,否则跨迭代比较会失真。业界对降低 LLM 评估成本的诉求强烈,因为全量评估在多任务基准(如 Terminal-Bench)上可能耗时数小时甚至数天,而优化过程通常需要数十轮迭代。这直接关系到 harness 优化能否在实际工程中落地。

行业类比

这种方法与主动学习中的不确定性采样类似:优先评测那些模型处在能力边界、容易出错的样本,而不是均匀评测整个数据集,从而以更低成本找到更优的 harness 配置。

核心洞察

  • Task-CoEvolve 的核心是把验证任务选择本身作为优化变量,与 harness 协同演化。不同于以往每轮都全量评估固定验证集的范式,它基于历史结果对每个任务做方差加权采样,优先评测那些候选 harness 分歧大、接近能力边界的任务。这样,每轮评估的信息密度显著提升,减少了对已稳定解决或一致失败任务的重复开销。
  • 论文通过采样概率矫正的全集分数估计(如 Hájek estimator),解决了不同迭代轮次评估不同子集情况下模型分数不可比的问题。这使搜索过程在只观察部分任务时,仍能近似还原全集表现,从而保证 harness 优化的收敛方向不因随机子集偏差而漂移。相比简单随机子集或固定子集基线,该估计器在成本与保真度之间取得平衡,是 80% 评估削减得以成立的关键组件。

方法

输入与问题定义

Task-CoEvolve 的目标是在 harness 优化(迭代改写提示词或代码包装以提升 LLM 在特定任务上的表现)过程中,减少验证集全量评估带来的计算开销。输入包括:

  • 一组候选 harness(每轮迭代产生的新 harness);
  • 一个固定的验证任务池(原始全量集);
  • 历史评估记录(每个 harness 在每个任务上的成功/失败结果)。

关键模块

  1. 自适应任务选择(variance-weighted sampling)
    方法观察到:在能区分 harness 质量的任务上,不同候选 harness 的表现往往分歧较大;而在过易或过难的任务上,所有 harness 表现一致,信息量低。因此,Task-CoEvolve 根据历史结果计算每个任务上的响应方差(或分歧度),并构建采样分布,优先选择方差大的任务。采样概率与任务上的历史分歧度成比例,使得优化过程始终聚焦于“能力前沿”附近的任务。

  2. 全量集分数估计(Hájek 估计器)
    每轮仅对采样出的部分任务进行评估,但需要估计如果在全量验证集上评估时的得分,以便跨轮比较。Task-CoEvolve 使用 Hájek 估计器:将每个被采样任务的得分除以其采样概率(即逆概率加权),再归一化得到全量集得分的无偏估计。这样,即使不同轮次采样不同子集,估计结果仍具备可比性。

  3. 协同演化机制
    随着 harness 不断改进,任务上的分歧分布也会变化:原本高分歧的任务可能被所有新 harness 稳定解决,不再有区分度。因此,采样分布会基于最新的评估结果动态更新,实现验证任务与 harness 的共同演化。

输出

每轮输出:

  • 当前 harness 在全量集上的估计得分;
  • 新采样得到的部分任务评估结果(用于下一轮采样概率更新)。 最终输出:经过多轮优化后性能最好的 harness。

与同类方法的差异

相比固定验证集全量评估(如 Meta-Harness)或随机子集采样的 baseline,Task-CoEvolve 让验证任务随 harness 演化而自适应调整,同时用逆概率加权校正估计偏差,在保持最终性能可比的前提下将评估次数降低约 80%。

实验

实验设计

论文在 Online Text Classification 与 Terminal-Bench 2.1 两个基准上评估 Task-CoEvolve。对比方法包括全量评估搜索、基于子集的基线以及本文方法,核心考察在优化过程中达到相近最终性能时所需评估次数的减少幅度。

关键发现

Task-CoEvolve 在两个任务上均匹配全量搜索的最终性能,同时将评估次数降低 80%。其自适应任务选择机制明显优于随机或固定子集基线,验证了基于候选 harness 分歧进行 方差加权采样 的有效性:将评估集中在能力边界任务上,避免在已稳定解决或失败的任务上浪费计算。

与基线对比解读

与每次迭代全量评估的固定验证集方案相比,Task-CoEvolve 通过动态调整验证子集,有效降低了迭代优化中的验证成本,且不牺牲最终优化质量。对于工程实践,当 harness 或 prompt 优化需要大量候选评估时,该方法可显著节省 API 调用或推理算力,尤其适合长周期迭代搜索场景。

行业影响

落地场景

Task-CoEvolve 主要适用于需要反复优化 harness(提示模板、工具封装、Few-shot 示例等)的 LLM 应用,例如:

  • 电商场景:商品评论情感分类中,通过调整分类提示词或示例选择提升准确率,Task-CoEvolve 可动态挑选最具区分度的验证样本,减少每次迭代的评估成本。
  • 内容平台:自动化内容审核的规则/示例优化,避免固定验证集造成的冗余评估。
  • 企业服务:RAG 系统中检索参数与 prompt 模板的联合调优。

商业价值

直接降低 模型优化成本:减少 80% 评估量意味着更低的 GPU 时间和更快的迭代周期。对于需要持续维护的动态任务(如垃圾邮件过滤、舆情分析),能显著节省长期运维开销,同时不牺牲最终性能(匹配全量搜索的最终表现)。这属于典型的 降本增效,让团队以更小代价获得同等模型能力提升。

与现有工作流集成

Task-CoEvolve 可作为 评估层组件 嵌入现有 MLOps 管道:

  • 替换传统固定验证集评估,通过 API 接口接收候选 harness 列表,输出采样任务子集及全量分数估计。
  • 与 LangSmith、W&B 等实验跟踪工具配合,记录每次迭代的采样策略和估计分数,便于对比分析。
  • 在 持续集成(CI) 中,用于每次代码提交后的快速回归评估,避免全量测试造成的延迟。

局限

  • **任务泛化性有限**:方法目前仅在在线文本分类和 Terminal-Bench 2.1 上验证,二者均为结构相对明确的任务(分类和终端命令执行)。对于开放式生成、多模态或需要复杂 harness 代码的场景,自适应任务选择能否保持高效尚未可知。此外,harness optimization 本身依赖代码重写,对大型复杂 harness 的每轮生成成本依然较高,任务选择带来的节省比例可能下降。与全量搜索相比,估计分数引入的误差可能让个别迭代选到非最优 harness,影响最终收敛质量。实际部署前需在目标场景做小规模校准,并保留部分全量评估作为参考。
  • **对初始候选质量敏感**:variance-weighted sampling 依赖候选 harness 之间的历史分歧信号,早期迭代候选差异过小或过大时,采样分布可能无法聚焦真正有区分度的任务,导致估计偏差。估计器假设采样概率已知且采样独立同分布,但真实评估可能存在批次效应、模型随机性或在线环境的数据漂移,破坏无偏性。与固定子集方法相比,该方法需要维护自适应采样状态并调整额外超参数(如采样温度、估计器类型),工程实现与调参成本更高,对于简单场景的收益可能不足以覆盖额外复杂度。
  • **缺乏代码开源与绝对性能数据**:论文摘要承诺代码将发布,但当前 GitHub 仓库只有 7 个 star,代码尚未公开,研究者难以快速复现验证。同时,摘要只报告了“节省 80% 评估且匹配全量搜索性能”,没有给出绝对精度提升幅度或与其他 cost-aware 基线的详细对比,容易让人高估其实际价值。在计算资源相对充足的环境下,直接采用全量搜索可能更简单可靠,该方法的省时收益不具绝对优势。以上局限表明,Task-CoEvolve 更适合计算受限、任务相对稳定的 harness optimization 场景。
论文Atsuyuki Miyai2026-08-24原文

相关内容