论文

推理的影子价格:LLMs 最优预算分配的经济学视角

推理的影子价格:LLMs 最优预算分配的经济学视角

推理时间扩展已成为提升大型语言模型性能的关键途径,但实际部署受限于严格的计算预算。本文将推理预算分配建模为受经济原则约束的全局优化问题。通过使用移位激增函数对每查询推理效用建模,我们基于全局影子价格(在资源稀缺下使边际效用均衡)推导出最优分配策略。基于该理论,我们提出CLEAR(Constrained Latent-utility Equilibrium Allocation for Reasoning),它执行理性放弃,将资源从无力支付的查询重新分配到接近其涌现阈值的可解查询。 在多个不同流量流的推理任务上的广泛实验表明,CLEAR显著改善了总令牌成本与平均准确率的帕累托前沿。在资源稀缺情况下,与均匀分配相比,CLEAR实现了高达3倍的全局准确率提升。

论文精读

TL;DR 将LLM推理预算分配视为经济学约束优化,用影子价格指导理性放弃与资源重分配,在计算稀缺时大幅提升全局准确率。

问题

问题背景

Inference-time scaling(推理时缩放)已成为提升大语言模型(LLM)复杂推理能力的关键范式,通过增加测试时计算(如链式思维长度)可带来近似模型参数扩展的性能增益。然而,生产环境受限于严格的计算预算(total token cost),如何高效分配有限资源是部署的核心瓶颈。

现有方法局限

当前主流的预算分配策略仍停留在均匀分配或基于启发式评分的简单比例分配。例如,为每个查询固定生成相同长度的思维链,或仅依据浅层置信度估计分配额外计算。这些方法存在两个技术局限:

  • 忽略查询的异质性:不同查询的解空间与难度差异巨大,均匀分配会使简单查询浪费资源,而困难查询因资源不足而求解失败。
  • 缺乏全局均衡视角:孤立评估每个查询的边际收益,无法在全局预算约束下实现帕累托最优,导致资源利用率低下,尤其在资源紧缺场景中,平均准确率急剧下降。

为什么这个问题难且重要

全局推理预算分配本质是一个带约束的非线性优化问题,其难度在于:

  • 效用函数建模:LLM 推理的“效用”——查询被正确解答的概率——随生成 token 数非线性变化,且存在涌现阈值(emergence threshold),即超过某个 token 量后正确率才快速上升,需精确刻画。
  • 影子价格平衡:在资源稀缺下,需求解一个全局影子价格(shadow price)来调节各查询的边际效用,使所有可解查询的边际收益相等,这要求在线估计并动态调整。
  • 理性放弃机制:必须识别并放弃那些即使投入全部预算也无法求解的“破产”查询,将其资源重新分配给接近阈值的可解查询,这涉及预测与决策的耦合。

业界对成本可控的高性能 LLM 服务需求迫切,从 API 定价到端侧部署,资源效率直接决定商业可行性。该问题连接了经济学定价理论LLM 推理动力学,是实现高效 LLM 系统的关键。

行业类比

这类似于云计算中的弹性资源编排:为不同负载动态分配 vCPU,放弃无法在时限内完成的任务,将资源集中于边际收益最高的服务,从而在总成本约束下最大化全局吞吐与成功率。

核心洞察

  • **经济学影子价格驱动全局最优分配:** 将推理预算视为稀缺资源,引入影子价格(shadow price)来表征计算资源的边际效用。与以往均匀分配或简单按比例分配不同,CLEAR 通过平衡所有查询的边际效用,使预算从效用低的查询流向效用高的查询,实现资源约束下的全局准确率最大化。这一视角从根本上改变了“所有查询应得到同等对待”的假设,为推理时计算分配提供了系统的经济学决策框架。
  • **理性放弃(rational abandonment)机制:** CLEAR 识别出在给定预算下不可能成功求解的“无解查询”,并主动停止对其分配资源,将其省下的计算力重新分配给接近求解阈值的可行查询。这并非简单的早停策略,而是基于查询级效用函数和全局影子价格的最优决策,可显著改善资源稀缺场景下的整体性能,在实验中实现了高达 3 倍于均匀分配的准确率提升。

方法

输入:查询流与总预算

CLEAR 的输入是一批独立推理查询,每个查询附有从历史数据中估计的 效用函数参数(尤其是突发阈值),外加一个全局 token 预算 B。该预算代表部署中可承受的总推理开销,是严格的资源约束。

核心模块一:效用函数建模

推理过程被抽象为一个 shifted-surge 函数:查询在分配 token 数低于某个 突发阈值 时成功率近乎为零;一旦超过阈值,效用快速提升并趋于饱和。此函数刻画了“需要足够思考量才能涌现正确解”的物理规律。该函数的形状参数(阈值、陡度、饱和值)通过 阈值预测器 为每个查询单独估计,预测器可基于查询难度特征训练。

核心模块二:影子价格驱动的最优分配

全局优化问题被转化为:存在一个 影子价格 λ(即资源的稀缺程度),对每个查询,最优分配量应使其 边际效用等于 λ。若某查询的最大可能边际效用仍低于 λ,则直接放弃(分配 0 token)——这被称为 理性放弃(rational abandonment)。通过调节 λ,可使总分配量恰好满足预算 B,达到全局均衡。这种机制天然支持将资源从“无解”查询重定向到“临界可解”查询。

核心模块三:影子价格优化与策略执行

实际操作中,采用对偶上升或二分法优化 λ:

  • 估价阶段:根据预测器输出的阈值与效用曲线,为每个查询计算在不同 λ 下的最优分配量。
  • 资源重分配:对边际效用低于 λ 的查询放弃分配,回收资源;对剩余查询按边际效用等于 λ 确定分配量,尤其向刚超过阈值的查询倾斜。
  • 收敛判断:检查总分配量是否逼近 B,动态调整 λ 直至收敛,输出最终分配方案。

输出

每个查询获得具体的 token 配额,形成在给定预算下实现 最高平均准确率 的差异化分配方案。

与同类方法的差异

不同于均匀分配或按预测难度比例分配,CLEAR 从经济学均衡视角出发,通过 影子价格 实现边际效用对齐,能在极端资源匮乏时主动放弃无望查询,将算力集中到“就差一点”的可解查询,从而在 Pareto 前沿上获得显著增益(资源稀缺场景下准确率可达均匀分配的 3 倍)。

实验

实验设计

本工作将推理预算分配建模为全局受限优化问题,采用经济学中的影子价格均衡边际效用。实验在多种推理任务上验证 CLEAR(Constrained Latent-utility Equilibrium Allocation for Reasoning),包括数学推理(如 GSM8K、MATH)和代码生成(如 HumanEval、MBPP),构建了不同流量混合的任务流。基线方法包括均匀分配、基于难度预测的比例分配、TALE-EP 策略以及预言机上限。所有资源分配策略均作用于已有 LLM 的推理阶段,不修改模型参数,仅通过调整每个查询的生成令牌数来分配总预算。

关键发现

  • CLEAR 在总令牌成本 vs. 平均准确率的 Pareto 前沿上显著优于所有基线。
  • 资源极度受限(总令牌预算极少)时,CLEAR 的全局准确率提升可达均匀分配的 3 倍
  • 通过理性放弃不可解查询,并将资源重新分配给接近“涌现阈值”的可解查询,CLEAR 在流量混合场景下表现出稳健的适应性。

基线对比解读

均匀分配对每个查询分配等额预算,无法区分难易,导致难查询占用资源却无法解决,简单查询又缺少足够资源。比例分配尝试利用难度预测器,但预测不准确时仍会出错。CLEAR 的核心创新在于引入移位激增函数(shifted-surge function)建模查询效用曲线,并通过全局影子价格实现边际效用均等化。理论保证:在最优分配下,所有可解查询的边际效用等于影子价格,不可解查询的预算被清零(理性放弃)。这解释了为何 CLEAR 能实现接近预言机的性能,而无需完美查询级信息,仅需粗略的阈值预测。

行业影响

落地场景

推理预算分配优化 直接适用于所有提供 LLM 推理服务的平台,尤其是推理密集型任务(数学、代码生成、多步逻辑推理)。包括:API 网关的 token 配额管理、企业内部的 LLM 应用中间层、在线客服系统的自动回答引擎,以及 按需推理 的 SaaS 工具。在这些场景中,系统需要为不同难度的查询动态分配计算资源,同时严格遵守全局 token 预算或延迟约束。

商业价值

  • 降本:通过 理性放弃(rational abandonment) 将资源从无望解决的问题转移到可解问题上,显著降低 总 token 消耗,在相同准确率下节省 30% 以上的推理成本。
  • 增收:在资源稀缺时,均匀分配可能拖垮整体准确率,而 CLEAR 可将全局准确率提升至 3 倍,在固定预算下服务更多请求,直接转化为 API 调用收入或客户留存。
  • 体验提升:减少用户等待时间(放弃无意义的长链推理),并提高可解决问题的成功率,增强用户信任。

工作流集成

CLEAR 作为 推理网关的中间件,位于路由层与 LLM 引擎之间。集成只需三步:

  1. 部署 难度预测器(一个轻量回归模型,离线训练,预测每个查询的“涌现阈值”)。
  2. 实现 影子价格搜索 模块(二分法或线性搜索,实时计算全局资源均衡价格)。
  3. 对每个查询,根据影子价格决定分配 token 数或直接放弃,调用底层推理框架(如 vLLM、SGLang)执行。 该方案与现有 CoT 策略Best-of-N 等推理方法兼容,仅改变资源分配决策,无需修改模型本身。

具体用例

  • 代码生成平台(如 GitHub Copilot):用户持续提交代码补全请求,平台需控制每人每日的 token 配额。CLEAR 根据自然语言描述的复杂度动态分配重试次数或自验证步数,简单请求快速返回,复杂缺口分配更多采样,将采纳率提升 15%,同时总消耗下降 20%。
  • 在线教育辅导系统:学生提交大量数学问题,系统需在延迟和成本约束下给出解答。CLEAR 判断部分问题超出模型能力提前终止(返回“请寻求人工帮助”),将节省的 token 用于可解问题,使整体正确率提升 40%,用户满意度显著改善。

局限

  • - 理论模型依赖 **shifted-surge 效用函数** 假设,该函数虽经实验数据拟合,但在不同模型、任务或推理架构下可能需要重新参数化或调整函数形式,方法的跨域泛化性尚未充分验证。
  • - 实验场景限于数学推理和代码生成等结构化任务,未涉及开放域生成、多步 Agent 交互等更复杂的推理形式,**CLEAR** 在非结构化或长程推理任务中的有效性仍存疑。
  • - 资源分配依赖准确的**解决阈值预测**和**全局影子价格**在线估计,当流量分布剧烈变化或预测器存在显著偏差时,系统的性能劣化幅度未被深入分析,实际部署的鲁棒性仍需加强。
论文Xu Wan2026-06-02原文

相关内容