论文

有品味的 Agent:长时程任务中品味的度量与提升

有品味的 Agent:长时程任务中品味的度量与提升

LLM agents 正越来越多地承担长时程任务,而它们沿途做出的决策——测试哪个假设、基于哪个实现继续开发——决定了整轮运行的成败。这种决策能力正成为工程与研究型 agent 的核心能力,作者将其称为 agent 的 taste。现有 benchmark 只度量端到端成功率,无法衡量 taste。 为此,作者构建了 Taste-Bench,一个由 agent 在工程与研究任务轨迹中自动构造的 taste 问答基准。每道题给出一个 decision fork(决策分叉点):轨迹中存在多个可行方向,其中一条通往更优结果;被测模型在看不到分叉之后发生什么的前提下做出选择。分叉从同一任务的多次并行尝试和单条轨迹内部的绕路中自动挖掘,无需人工标注。 在前沿模型上评测 Taste-Bench,最好的模型仅答对 59.7%。作者进一步发现,决定性证据出现在轨迹更靠后位置的分叉对所有模型都明显更难,且增大 reasoning budget 并不能提升准确率。 最后,作者证明 taste 可以被训练:将见过最终结果的 teacher 的判断蒸馏进 student 模型后,student 在未见任务上做出更好的决策,并在留出的 SWE-bench Pro 任务上提升了端到端成功率。

论文精读

TL;DR 提出 Taste-Bench,自动从长期任务轨迹中挖掘决策分叉,度量 agent 的 taste(决策品味);发现前沿模型正确率仅 59.7% 且推理预算无效,但 taste 可蒸馏提升端到端成功率。

问题

问题背景

当前 LLM agent 在长时任务(如代码生成、科研实验)中的自主执行越来越普遍,其过程中每一步的决策——例如选择验证哪个假设、基于哪个实现继续构建——直接决定最终任务成败。业界开始关注 agent 的 taste(品味),即做出高质量长程决策的能力。

现有方法局限

  • 现有基准(如 SWE-bench、AgentBench)主要评估端到端成功率,无法定位失败发生在哪个决策点。
  • 缺少对中间决策质量的直接度量:最终失败可能源于关键分叉处选错方向,而最终成功也可能掩盖早期决策的低质量。
  • 人工标注决策分叉成本高、难以扩展,且长时轨迹中有效分叉点稀疏,难以规模化构建评测集。

为什么这个问题难/重要

  • 技术挑战:决策质量需要在未看到未来结果的情况下判断,证据可能延迟出现,模型难以正确归因;论文发现 Taste-Bench 上最佳模型准确率仅 59.7%,且分叉点越靠后难度越高。
  • 业界关注度:工程和研究 agent 的自主性提高后,决策可靠性成为部署瓶颈;好的 taste 可以减少无效探索、节省计算资源,直接影响 agent 的实用价值。

行业类比

类似于自动驾驶规划中的行为决策:需要在长时路径上做出多个选择,任一错误选择都可能导致整体失败,而仅看最终是否到达目的地无法评估中间决策质量。

核心洞察

  • 论文将长时程任务中的中间决策质量定义为 taste,并构建 `Taste-Bench` 直接测量模型在决策分叉点的判断能力。这不同于现有端到端成功率基准:后者无法区分正确决策但执行失败与错误决策但偶然成功,而 `Taste-Bench` 隔离了决策与执行,使评估更聚焦于规划与判断。
  • Taste-Bench 的决策分叉挖掘完全自动化,基于同一任务的平行轨迹和单轨迹内的绕行,无需人工标注。这突破了过程评估依赖人工设计中间步骤或专家评审的扩展性瓶颈,能够从大规模真实智能体轨迹中高效提取高质量决策样本,且分叉难度与证据出现时间密切相关,揭示了长程决策中的核心困难。
  • 论文展示 taste 可通过蒸馏训练提升:让见过结果后的教师模型指导学生模型,在未见过任务上决策准确率提高,并提升 held-out `SWE-bench Pro` 端到端成功率。这表明 taste 是一种可迁移的内部判断能力,可将长期结果信号压缩进模型权重,为训练更擅长规划的智能体提供了实用路径。

方法

Taste-Bench 以 LLM agent 在长程任务中的执行轨迹 为输入,自动构建决策叉问题,无需人工标注。核心流程如下:

  • 并行轨迹 fork 挖掘:对同一任务采样多条不同尝试轨迹,定位执行路径分叉点——在这些点上 agent 选择了不同方向,且后续产出出现显著质量差异。将分叉前的上下文作为题干,不同方向作为选项,其中产生更好结果的方向为正确答案。
  • 绕路轨迹 fork 挖掘:在单条轨迹内部,定位 agent 先误入低效方向、后发现并回退修正的转折点;把“绕路方向”与“直接有效方向”组合成决策题,用于捕捉 agent 对判断时机的把握。
  • 自动过滤与题目合成:用规则或模型初步筛选,去除歧义、噪声过大的候选 fork,平衡工程与科研任务来源,得到可评测的多选题集合。

输出为 Taste-Bench,由一组决策 fork 题构成;被测模型只看到 fork 之前的状态,选择后续方向,不接触未来信息。评测指标为 accuracy(选对更优方向的比例)。后续还通过 蒸馏 teacher 判断 将“已见结果”的决策能力迁移给学生模型,在 held-out SWE-bench Pro 上提升端到端成功率。

与现有只衡量端到端成败的 agent benchmark 不同,该方法直接隔离并量化中途决策质量,为长程任务提供可训练的过程级信号。

实验

实验设计

Taste-Bench 的构建基于挖掘并行尝试的轨迹和单条轨迹中的绕行,自动提取决策分叉。评估时,模型只看到分叉前的上下文,选择其中一个方向。实验覆盖工程和研究任务,并标注了分叉点之后决定证据出现的时间距离。蒸馏实验使用“见过结局”的教师模型判断,蒸馏到学生模型,再在未见任务和 SWE-bench Pro 上进行迁移评估。

关键发现

  • 最佳模型 在 Taste-Bench 上仅答对 59.7% 的问题,凸显长程决策的难度。
  • 决定证据出现越晚的分叉,所有模型表现越差,说明时间距离是关键难点。
  • 增大推理预算(例如更多采样或更长思考)并未提升准确率,单纯的算力堆叠不是解法。
  • 蒸馏教师判断能有效提升学生模型的决策质量,并在 held-out SWE-bench Pro 任务上提高端到端成功率。

与基线对比

与现有端到端基准相比,Taste-Bench 首次专门度量 agent 的“品味”——即决策质量,而非最终任务是否完成。这个区分很重要:端到端成功可能包含运气或重试,而品味直接考察决策点的选择。实验表明当前前沿模型在品味上仍有巨大提升空间,且简单的推理增强不能弥补判断力的不足;蒸馏提供了一条通过过程监督提升决策能力的路径。这与近期过程奖励模型的研究方向一致,但 Taste-Bench 提供了更直接、可扩展的评估手段。

行业影响

落地场景

Taste-Bench 定义的 taste 能力可直接应用于各类长程 LLM agent 产品:

  • 软件工程智能体:在 Copilot/Devin 类工具中,重构方案或实现路径分叉时提前过滤低质量分支,减少无效 rollout。
  • 科研 / 数据分析 agent:在假设选择、实验配置、消融设计等决策点,判断哪个方向更可能产出正向结果。
  • 企业级 workflow automation:多步工具调用、数据库查询或文件处理流程中,在中间步骤拦截高风险决策。

商业价值

核心收益在 降本:长程 agent 大量 token/GPU 消耗在错误分支,taste 模型早期丢弃坏方向可显著减少重试与推理成本。同时带来 体验提升:面向开发者的 agent 产品若降低任务失败率、缩短完成时间,可提高订阅付费意愿;内部研发平台则表现为更高任务吞吐与更少返工。

跟现有产品/工作流的接口

可插入 agent 训练与评估管线的三个环节:

  1. 离线评估:将 Taste-Bench 或自建 taste 分叉题集加入 CI,替代完整长程任务评测。
  2. 蒸馏微调:从看过结果的 teacher 蒸馏 taste 判断到 student,再嵌入策略模型或 router。
  3. 在线 gate:当分叉点 taste_score 低于阈值时触发 human-in-the-loop 或保守回退。

具体落地 use case:

  • 电商搜索/推荐 agent:多步商品筛选、比价、购物指南生成中,taste 筛选更优查询重写或排序策略,减少对话轮次和搜索 API 调用。
  • 金融投研 agent:读取财报/研报并生成投资备忘录时,在“选择哪组财务指标做回归”或“采用哪种估值模型”分叉点,用 taste 避免稀疏数据或薄弱逻辑路径,提升报告质量与合规通过率。

局限

  • 自动构造的 **Taste-Bench** 依赖已有 agent 产生的轨迹来挖掘决策分叉,可能导致 benchmark 分布偏向于这些被挖掘 agent 的行为模式和已尝试过的路径。若源 agent 在长期任务中存在系统性偏差或探索不充分,则挖掘出的 forks 可能遗漏关键但未被尝试的决策方向,或仅反映次优选项之间的对比,无法覆盖更广泛、更具挑战性的 taste 场景。此外,自动 pipeline 中的过滤和验证步骤缺乏人工标注校准,其误判率可能影响问题质量,但目前论文未提供充分的错误分析。
  • 评估协议中,模型只看到 fork 之前的状态并从预定义选项中做选择,而真实 long-horizon 决策往往是在信息高度不完整且选项并非预先枚举的情况下做出的。这种简化可能高估模型的 taste,因为实际 agent 还需要自行生成候选方向,生成质量本身也是 taste 的核心组成部分。论文仅测量了对给定选项的判别能力,未衡量模型自行提出有希望的决策方向的能力,因此 **Taste-Bench** 的分数可能无法完全代表真实 agent 在长期任务中的决策水平。
  • 蒸馏实验仅在特定模型组合和 **SWE-bench Pro** 子集上验证,未充分展示跨任务类型、跨模型规模的泛化性。最佳模型在 **Taste-Bench** 上仅达到 59.7% 正确率,且增大 reasoning budget 未带来提升,说明当前模型在 taste 上的能力仍有限,也暗示 benchmark 中部分题目可能无法通过简单扩展推理解决,其难度来源与可学习性之间的关系尚不明确。此外,GitHub 仓库目前仅有 1 个 star,缺乏外部社区验证,这也限制了将 “taste 可训练” 结论推广到更广泛 agent 系统的可靠性。
论文Wenbo Pan2026-09-22原文

相关内容