论文

当智能体放慢脚步:通过 Elo-per-token 分析理解 LLM 智能体的测试时策略

当智能体放慢脚步:通过 Elo-per-token 分析理解 LLM 智能体的测试时策略

大语言模型(LLM)智能体在测试时会自适应地分配计算量:修改解答、调用工具、探索备选方案并决定何时停止。这种测试时策略让智能体的性能扩展难以度量。我们研究可对中间提交给出连续评分的开放式任务,使长轨迹中的进展全程可见。 我们提出 Elo-per-token 分析,追踪每个 token 预算下找到的最优解,并用 Bradley-Terry 模型 将任务内排序聚合为跨任务的 Elo 评分,从而兼容不同任务的分数尺度。 我们将该方法用于四个通用智能体在四个开放式 benchmark 上的实验(单次会话最长 100M tokens),以及三个反馈驱动的 LLM 优化框架的受控单任务干预。独立采样 提供有理论刻画的参照,其 Elo 随 log 计算量线性增长。相比之下,智能体初期把 token 转化为 Elo 的速度快于独立采样,但边际收益递减并最终低于参照;而最强的历史人类选手在共享的 AtCoder Heuristic Contest 任务上随比赛时间超线性提升,说明存在持续学习与可观的提升空间。 我们定义 scaling inflection point 为边际 Elo 增益与独立采样参照相等的单会话预算。以此作为单会话预算、将 100M tokens 拆分到并行会话,在 FrontierCS Polyomino Packing 上比单个长会话高出 +264 Elo,比十个短会话高出 +355 Elo。

论文精读

TL;DR 提出 Elo-per-token 分析,量化 LLM agent 测试期计算缩放:初期 token 换 Elo 快于独立采样,后期减速,并行短会话优于单次长会话,为推理预算分配提供依据。

问题

问题背景:大语言模型 agent 在测试时通过修改答案、调用工具、探索备选方案等方式动态分配计算,如何衡量其性能随计算量的 scaling 已成为当前研究热点。

现有方法局限:传统 scaling law 分析主要基于独立采样或固定 token 预算,无法刻画 agent 内部的自适应策略;不同开放任务的连续评分尺度各异,难以直接比较;缺少统一的理论基线来判断 agent 是否高效利用 token。这些方法通常只关注最终答案,忽略了轨迹中间的改进过程。

为什么这个问题难/重要:test-time compute 正成为提升模型能力的关键杠杆,但 agent 的 token 消耗与性能提升之间并非线性关系,边际收益会递减,需要找到合适的预算分配策略。论文通过 Elo-per-token 和 Bradley-Terry 模型聚合跨任务排序,发现 agent 起初快于独立采样但后期低于独立采样,并定义 scaling inflection point 指导并行会话切分。

行业类比:类似于推理服务中 adaptive early exit 或 speculative decoding 的 latency-quality tradeoff,需要动态决定每个请求何时停止生成以平衡成本与质量。

核心洞察

  • Elo-per-token analysis 将不同任务、不同分数尺度的测试时计算效率统一到一个可比较的 Elo 度量上,并以独立采样为解析参考,从而量化 LLM 代理从 token 到性能增益的边际转换率。与以往只看最终得分或单任务曲线不同,该方法通过 Bradley-Terry 模型聚合跨任务排序,明确刻画了代理策略在何时从优于独立采样转为低于参考,定义了 scaling inflection point,为评估和优化 agent 推理策略提供了新的基准。
  • 该研究发现并行短会话在同等总 token 预算下显著优于单长会话(+264 与 +355 Elo),而最强人类选手在同一任务上随时间呈超线性提升,说明当前 LLM 代理的测试时策略存在明显改进空间。与多数工作仅关注延长单次推理不同,这一结果突出了会话级并行与预算分配的重要性,并提示通过借鉴人类持续学习或更优 stop/revise 策略,可进一步提升代理在开放任务中的长期性能。

方法

输入

对每个 open-ended 任务,输入是 agent 完整的一次运行轨迹(session),包含每一步产生的中间解及对应连续分数(如 FrontierCS 的 packing 得分),单次 session 最多可消耗 100M tokens。

关键模块

Elo-per-token 分析

  1. 对每个 token 预算 $t$,记录该预算内 agent 找到的最佳解分数;
  2. 在单个任务内部,不同 token 预算对应的最佳解构成一组排序关系;
  3. 使用 Bradley-Terry 模型将各任务内的排序聚合成统一的 Elo 评分,从而跨任务比较不同分数尺度的表现。

独立采样基准

  • 独立采样作为理论参考:每次从候选解分布中独立抽样,其 Elo 随 $\log$(计算量)线性增长;
  • 该基准用于衡量 agent 将 token 转化为有效探索的效率。

scaling inflection point

  • 定义为边际 Elo 增益与独立采样基准相等的 per-session token 预算;
  • 在该点之后,agent 的边际收益低于独立采样,继续单 session 加长不再划算。

输出

输出每个 agent 在不同 token 预算下的 Elo 曲线、边际增益曲线及 inflection point。利用 inflection point 将总预算拆分为多个并行 session,例如在 FrontierCS Polyomino Packing 上拆分 100M tokens 得到 +264 Elo(对比单 session)和 +355 Elo(对比十个短 session)。

与同类方法的差异

不同于只关注最终性能的 scaling law 分析,本方法通过 token 级别的 Elo 追踪,揭示 agent 测试时策略从超线性收益到减速的完整过程,并给出可操作的并行预算分割点。

实验

实验设计

作者在四个开放型基准(open-ended benchmarks)上评估四个通用 LLM agent,会话长度最高达 100M tokens。提出 Elo-per-token 分析:跟踪每个 token 预算下获得的最佳解,使用 Bradley-Terry 模型 将任务内排序聚合为跨任务 Elo 评分,解决不同任务分数尺度不可比的问题。独立采样(independent sampling)作为理论参考,其 Elo 随 log compute 线性增长。另在三个反馈驱动的 LLM 优化框架上进行单任务对照实验,并分析 AtCoder Heuristic Contest 历史最强人类选手表现。

关键发现

  • Agent 初期将 token 转化为 Elo 的速率高于独立采样,但边际收益递减,最终低于独立采样参考。
  • 人类选手在 AtCoder Heuristic Contest 上随比赛时间呈超线性提升,表明 agent 仍有大幅 headroom。
  • 定义 scaling inflection point 为边际 Elo 增益与独立采样参考相等的单会话预算。
  • 使用该点作为单会话预算,将 100M tokens 拆分到并行会话,在 FrontierCS Polyomino Packing 上获得 +264 Elo(vs 单个长会话)和 +355(vs 十个短会话)。

与基线对比解读

独立采样参考提供了理论下界:agent 虽早期高效,但未能维持,说明其修订/工具使用等策略在长轨迹中逐渐低效。并行短会话优于单次长会话,证明按 inflection point 拆分预算比盲目堆叠单次推理更有效。该分析区别于仅看最终得分的传统评估,为测试时扩展策略的量化比较提供了新工具。

行业影响

落地场景

Elo-per-token 分析 可嵌入需要 LLM agent 进行开放式长程任务的产品,如 代码生成与修复、数据分析报告生成、个性化内容创作。它能实时量化 agent 在每个 token 预算下的性能边际收益,从而识别何时应停止单次运行、启动并行分支或切换策略。例如,在自动代码评审工具中,agent 可不断修改代码,该方法可判断继续修改是否还值得。

商业价值

核心价值是 推理成本优化:通过找到 scaling inflection point(边际收益等于独立采样的临界点),企业可避免在收益递减区消耗大量 token,显著降低 API 推理费用。同时,论文证明并行短会话比单次长会话提高 +264/+355 Elo,这意味着相同预算下可获得更高质量输出,直接提升产品体验与客户满意度,适用于按结果付费的场景。

与现有产品/工作流接口

可作为 监控与调度中间件 集成进现有 LLM agent 框架(如 LangGraph、AutoGen、Semantic Kernel)。在每次 agent 迭代后,计算当前轨迹的 Elo-per-token,与参考曲线对比,触发 终止、分叉或新会话。也可作为 CI/CD 中的回归指标,比较不同 agent 版本在固定 token 预算下的效率。对自研推理服务,可在网关层实现令牌预算动态路由。

具体 use case:在 电商商品文案生成 中,agent 可迭代优化描述,系统用 Elo-per-token 判断继续优化是否 ROI 为正,超阈值则停止或并行生成多个变体供 A/B 测试。在 教育自适应练习生成 中,agent 多轮修改题目难度、解析,用该分析控制每道题的 token 消耗,平衡质量与成本。

局限

  • **适用任务类型受限**:Elo-per-token 分析依赖开放式任务中可观测的连续中间分数,以追踪每个 token 预算下的最优解。对于仅有最终离散反馈(如成功/失败)或缺乏可量化的中间状态的任务,该方法难以直接应用。此外,Bradley-Terry 模型假设成对比较的传递性,在任务间分数尺度差异极大或存在非传递性偏好时,聚合出的 Elo 评级可能失真。
  • **资源开销与参考基准的现实性**:论文中的会话长达 1 亿 token,这在实际部署中成本极高,且独立采样参考是基于理论推导的理想化基准,实际实现时受限于采样策略、硬件并行度等因素,难以完全复现。实验仅覆盖四个通用 agent 和四个开放式 benchmark,以及三个反馈驱动 harness 的单一任务干预,泛化到其他 agent 架构或任务类型的证据仍不充分。
  • **分析多于改进,缺乏直接优化策略**:论文揭示了 agent 测试时扩展的减速现象,并与人类参赛者的超线性提升对比指出了 headroom,但并未给出具体算法或机制来推动 agent 突破其扩展瓶颈。如何在实际系统中将分析结论转化为可操作的 test-time compute 分配策略(如动态决定何时并行、何时继续单线程探索)仍是一个开放问题。
论文Kaiyuan Liu2026-09-14原文

相关内容