论文

R^3-Bench: 大语言模型在共享预算下的资源理性推理中挣扎

R^3-Bench: 大语言模型在共享预算下的资源理性推理中挣扎

资源理性 关注智能体如何分配有限计算资源以最大化预期价值。现有基准大多使用独立的每任务预算,而共享预算研究未校准同一模型的单问题能力。 我们提出 R³-Bench,在数学、竞争性编程和抽象推理中,以共享预算评估六问题套件,覆盖无工具和智能体设置。匹配单问题响应曲线定义离线经验 oracle。 实验结果: - 72 个主表单元格中,oracle 均值 在全 72 个单元格匹配或超过竞赛均值,71 个严格更高。 - 适度无工具压力下,四个模型等分配重放超过竞赛表现。 - 轨迹诊断显示策略更新有限且失败模式依赖压力。 - 强智能体压力下,固定调度器在九单元格中六个超过竞赛均值,但无策略全域占优。 结论:共享预算下存在能力展示与实现之间的持续差距。

论文精读

TL;DR R³-Bench 用共享预算评测发现:LLM 在多题间分配推理资源的能力明显低于其单题上限,六模型 72 项对比中 71 项 oracle 均值更高。

问题

问题背景

在推理与 agent 评测中,研究者越来越关注资源理性(resource rationality):智能体如何分配有限计算预算以最大化期望价值。现有多数 benchmark 为每道题独立设置预算,而真实部署往往是多个问题共享同一固定预算。

现有方法局限

  • 独立每任务预算掩盖了跨任务资源竞争,无法反映共享预算下的策略退化。
  • 少数共享预算评测没有用同一模型在单问题上的响应曲线校准套件性能。这导致无法判断劣势来自模型本身能力不足,还是预算分配策略低效。
  • 缺少基于单问题成功率的离线经验 oracle,无法量化 allocation gap,也就无法评估调度策略的上限。

为什么这个问题难/重要

构建共享预算评估要求:

  1. 对问题难度分层,保证套件内难度组合有代表性;
  2. 针对每个模型做预算校准,使共享预算压力适度;
  3. 在工具无关与 agentic 两种设定下,匹配单问题响应曲线作为 oracle 基线。

这大幅增加实验成本与设计复杂度。同时,业界对 LLM agent 在多任务并发时的 token 花费与成功率权衡高度关注:如果共享预算下实际成功率显著低于单问题能力所预示的水平,说明现有调度与策略更新远未达到资源理性。R³-Bench 在 72 个主表单元中发现 oracle 均值全部不低于 contest 均值,其中 71 个严格更高,暴露了 demonstrated competence 与 shared-budget realization 之间的持续落差。

行业类比

类似云端多租户 GPU 集群上同时调度多个推理请求:若每个请求只按峰值算力预估,不基于单请求延迟-精度曲线做全局调度,整体吞吐与成功率会系统性低于最优。

核心洞察

  • 共享预算下的分配能力与单问题能力之间存在系统性 gap,传统逐题评估掩盖了这一短板。R^3-Bench 用同一模型在单问题上的响应曲线构建离线 empirical oracle,作为该模型在共享预算下的理论上界。实验显示,在 72 个主表 cell 中,oracle 均值全部不差于实际 contest 均值,其中 71 个严格更高;在中等工具型压力下,equal-allocation replay 也在 6 个模型中的 4 个上超过 contest 表现。这表明 LLM 无法将有限计算资源有效分配到高价值问题,而非单纯能力不足。
  • 固定资源调度器在特定压力条件下可以超越模型在线自管理,但缺少跨领域通用策略。在强 agentic 压力诊断中,至少一个固定调度器在 9 个 cell 的 6 个里超过 contest 均值,但没有任何调度策略在所有领域都占优。轨迹分析显示 LLM 在线策略更新有限,失败模式随预算压力变化。这说明针对共享预算的分配策略必须按任务域和压力水平定制;实际工程中,离线标定好的调度规则可能比模型临时决策更可靠,benchmark 应同时报告单能力和共享预算表现。

方法

输入

R³-Bench 从数学、竞争编程、抽象推理三个领域的问题池中按长度难度分层抽取题目,组成每套六题的竞赛套件。每个模型先通过单问题评估获得响应曲线,据此校准共享预算规模,使压力适中。

关键模块

  • 任务套件构建:每个领域按题面长度或步骤数分层,确保难易混合;竞赛由六题组成,模型需在一个共享预算内完成所有题。
  • 预算核算:工具无关场景下按输出 token 或推理步数计费;代理场景下进一步引入行动会计,每个工具调用(执行代码、搜索等)消耗预算,并维护问题簿记状态。
  • 离线经验预言机:用单问题成功率与成本拟合响应曲线,在相同预算下通过背包算法选择问题子集的最优组合,得到理论上限(oracle mean)。
  • 指标设计:除竞赛得分外,计算 oracle gap(oracle 均值与 contest 均值的差),并通过轨迹标注分析策略更新频率、失败模式随预算压力的变化。

输出

输出模型在共享预算下的实际竞赛表现、与单问题能力上限的差距,以及调度策略诊断。

与同类工作的差异:现有共享预算研究未将套件表现与同一模型已展示的单问题能力对齐,R³-Bench 通过匹配的响应曲线定义离线经验 oracle,显式度量分配差距。

实验

实验设计

R^3-Bench 评估六个 LLM 在共享预算约束下解决六题套件的能力,覆盖数学、竞争性编程和抽象推理,分为工具自由和代理两种设置。通过单问题响应曲线构建经验预言机,提供给定预算下的最优离线分配基准。竞赛中模型需自行分配预算,与 oracle、等分配回放和固定调度器等策略对比。

关键发现

  • oracle 均值在所有 72 个主表单元中不低于竞赛均值,其中 71 个严格更高,表明模型实时分配显著劣于最优离线分配。
  • 中等工具自由压力下,等分配回放在 6 个模型中的 4 个上超过竞赛性能,说明简单均匀策略可能优于模型自身复杂分配。
  • 轨迹诊断显示策略更新有限、失败模式随预算压力变化;强代理压力下,至少一个固定调度器在 9 个单元格中的 6 个超过竞赛均值,但无跨域通用最优策略。

与基线对比解读

传统推理基准为每道题提供独立预算,无法暴露资源分配缺陷。R^3-Bench 将单问题能力(oracle 上界)与共享预算实现直接对比,揭示资源理性差距。等分配回放优于实时竞赛表明模型存在过度自信或无效调度问题,而非能力不足。该基准为后续在线调度、元认知策略研究提供严格测试平台。

行业影响

落地场景

共享预算推理 直接影响多租户 LLM 平台与复杂 agent 工作流。例如:

  • 批量代码审查 / 修复 agent:同一 deadline 内处理多个 issue,需决定哪些深度调试、哪些快速打补丁。
  • 企业知识库回答:并发工单共享 token 预算,高价值工单应获得更多推理。
  • 内容流水线:批量摘要 / 翻译长文档,按优先级分配生成长度。

商业价值

  • 降本:对齐 oracle 分配可减少低价值任务上的冗余推理,降低平均 token 成本。
  • 增收 / 体验:提高高优先级任务成功率,减少人工兜底与 SLA 违约;稳定延迟提升用户留存。

与现有产品 / 工作流接口

  • 将 response curve 校准作为 LLM 网关(如 OpenRouter、自建代理)的离线环节,为每个模型生成预算-成功率表。
  • 在生产调度器(如 LangGraph、AutoGen)中集成离线 knapsack 重放逻辑,替代简单均分或先到先得。
  • 监控 contest mean 与 oracle mean 的 gap,作为资源浪费告警指标。

具体用例

  • 电商智能客服:大促高峰数千并发会话,agent 需共享 token 预算。基于 R³-Bench 校准,对退款争议类会话分配更多推理,对物流咨询快速回复,整体问题解决率提升且成本可控。
  • 医疗文档分析:批量处理病历摘要,不同紧急程度任务共享计算,确保高紧急病历获得充分推理,低紧急快速生成。

局限

  • **评估规模与领域覆盖有限**:R³-Bench 目前仅覆盖数学、竞争编程、抽象推理三个领域、六个问题套件,且主实验仅纳入六个模型。这一规模虽然提供了跨领域的对比证据,但不足以充分代表 LLM 在共享预算下资源分配行为的全貌;问题池来自公开数据集,存在潜在的数据污染风险,且未覆盖多模态、开放域或更长 horizon 的真实任务。未来扩大问题池、模型数量和领域类型才能得到更稳健的结论。
  • **预算校准与单问题 oracle 依赖高成本采样**:构建经验 oracle 需要在每个问题上对每个模型进行多档预算下的响应采样,以拟合单问题响应曲线。这一过程计算开销大,且在模型更新或新任务出现时需重新校准,实际部署成本高。此外,oracle 基于单问题独立预算,不一定能代表多问题并发时的最优分配,因为推理时的上下文切换、KV cache 复用等因素会改变实际成本-收益关系。
  • **在线调度策略过于简单**:诊断实验主要采用固定调度器或简单启发式,轨迹显示模型在线策略更新有限,但本文未探索更复杂的资源分配策略(如强化学习训练、元控制器或基于置信度的动态调整)。这限制了评估对真实 agentic 场景的指导意义,也无法区分性能缺口是来自模型能力还是调度器设计不足。与更先进的自适应调度 baseline 对比缺失,削弱了结论的普适性。
论文Peisong Wang2026-08-17原文

相关内容