论文

Agentic Chain-of-Thought Steering 用于高效可控的大语言模型推理

Agentic Chain-of-Thought Steering 用于高效可控的大语言模型推理

大语言模型通过扩展思维链推理提升了最终答案的准确性,但往往在 token 使用上效率低下,且推理时难以控制。现有的高效推理方法通过缩短、提前停止或压缩推理过程来控制思考长度,却未能显式控制模型如何思考。 本文提出 Agentic Chain-of-Thought Steering (ACTS),将推理引导形式化为一个 马尔可夫决策过程。其中,一个控制器智能体在推理过程中自适应地引导一个冻结的推理模型。每一步,控制器观察推理轨迹及剩余思考预算,然后发出一个引导动作,包含一个推理策略和一个引导短语,以启动推理模型的下一步生成。这使得能够在保持推理模型生成连续性的同时,实现预算感知的策略控制以提高推理效率。 控制器智能体基于我们构建的合成引导轨迹(含多预算增强)进行初始化,并通过强化学习结合预算条件奖励塑造进一步优化。在多个基准上的实验表明,ACTS 在实现显著 token 节省的同时,达到了与完整思考相当的性能,并在不同推理器和任务上实现了可控的准确率-效率权衡。代码已开源。

论文精读

TL;DR ACTS 将 CoT 推理转为 MDP,通过控制器代理动态引导推理步骤,实现预算感知的 token 节省与可控准确性权衡。

问题

问题背景

大语言模型(LLM)通过扩展思维链推理(Chain-of-Thought)显著提升了最终答案的准确率,但这一过程往往伴随不必要的 token 消耗,且缺乏推理时的可控性,无法根据实际需求(如有限预算或低延迟)动态调整推理策略。

现有方法局限

当前主流的效率优化方法(如缩短思维链早停机制压缩推理轨迹)存在明显不足:

  • 控制维度单一:仅关注“思考多长”,而忽略“如何思考”,无法显式引导推理的中间步骤方向。
  • 静态干预:通常预先设定固定规则或一次性压缩,难以适应任务难度或剩余预算的动态变化。
  • 破坏生成连贯性:直接截断或压缩可能中断推理流的自然展开,导致信息丢失,影响最终性能。 这些方法本质上是一种隐式的、被动的推理调控,缺乏对推理过程的显式建模。

难点与重要性

推理效率优化的核心挑战在于:如何在维持高精度的同时,实现细粒度的、预算感知的动态控制。推理过程本身是一个顺序决策问题,每个步骤的收益(信息增量)与成本(token 消耗)需实时权衡。传统方法(如固定长度的推理策略)无法根据中间状态自适应调整,导致“该深入时浅尝辄止,该浅出时空耗资源”。这在工程上直接导致两大痛点:

  • API 调用成本:大量冗余 token 推高每次请求的费用;
  • 响应延迟:过长的生成影响用户体验。 因此,动态推理调控已成为 LLM 省本增效的关键瓶颈,受到业界广泛关注。

行业类比

类似于云服务中的自动扩缩容(Auto-scaling)——根据实时负载动态分配计算资源,在服务质量(SLA)与成本间取得平衡,推理预算的意识与控制正是这种自适应策略在推理层面的延伸。

核心洞察

  • - **将推理引导形式化为 MDP 实现推理时决策连续性**:与早停、压缩轨迹或事后修剪不同,ACTS 把延长链式思维看作一个序列决策过程,在每一推理步由控制器代理根据当前轨迹和剩余预算动态选择**推理策略**和**引导短语**,既不破坏冻结推理器的生成连续性,也不修改模型权重。这为黑盒 LLM 的推理效率优化提供了一种基于强化学习的通用元控制范式,相比固定压缩比或硬截断,能更精细地适应不同查询的难度分布。
  • - **预算条件化奖励塑形实现单模型可控效率-精度权衡**:通过构造多预算合成轨迹并采用 RL 优化,控制器学会将剩余 token 预算作为条件信号,自动调节推理深度和风格。这意味着部署时无需重新训练或切换模型,仅改变输入预算参数即可在相同控制器下获得从激进压缩到全量思考的系列行为,对成本敏感的在线服务、层级化推理架构具有直接工程价值。

方法

ACTS 将推理操控形式化为一个 马尔可夫决策过程 (MDP),核心是一个 控制器代理 (controller agent) 在推理时自适应地指导一个冻结的 推理器 (reasoner)

输入与状态

给定一个推理任务和推理器,推理过程被分解为多个步骤。在每个步骤,MDP 状态由当前推理轨迹剩余思考预算(剩余 token 数)构成。控制器观测该状态,决定下一步的动作。

关键模块:控制器代理与操控动作

  • 动作空间:控制器输出一个操控动作 (steering action),包含两个部分:
    • 推理策略 (reasoning strategy):选择下一步推理应采用的策略(例如“拆解子问题”“回顾已得信息”等)。
    • 操控短语 (steering phrase):一段自然语言文本,被注入到推理器的输入中,引导其按所选策略生成下一个推理步骤。
  • 控制器实现:控制器基于语言模型,通过合成操控轨迹进行初始化。这些轨迹从预先构造的推理范例中抽取,并经过多预算增强 (multi-budget augmentation) 以覆盖不同预算场景。
  • 强化学习优化:控制器进一步通过 RL 微调,奖励函数结合了预算条件奖励塑造 (budget-conditioned reward shaping),在奖励正确答案的同时,惩罚超出预算的 token 消耗,从而学习在不同预算约束下做出最优操控决策。

输出与推理流程

推理开始后,控制器在每个步骤观察状态、发出操控动作,推理器基于当前上下文和操控短语生成下一步推理,直到推理器输出最终答案或预算耗尽。整个过程在保持推理器生成连续性的前提下,实现了预算感知的策略控制,无需修改推理器本身。

与同类方法的差异

与现有的缩短、提前终止或压缩推理轨迹的方法不同,ACTS 显式地操控推理过程,通过 MDP 让控制器选择策略,而非隐式地压缩或截断,从而在节省 token 的同时维持推理器的完整思考能力,并且允许用户通过预算实现可控的精度 - 效率权衡

实验

实验设计

ACTS 将推理引导形式化为马尔可夫决策过程,控制器在每步观察推理轨迹与剩余预算,输出推理策略+引导短语的联合动作,以维持推理器生成连贯性。控制器初始化基于合成引导轨迹(含多预算增强),再通过预算条件奖励塑形的强化学习进一步优化。评估覆盖多个推理基准,涉及不同推理器与任务,重点考察准确率与 token 效率的权衡。

关键发现

ACTS 在显著节省 token 的前提下,准确率匹配全思维链推理;控制器可根据剩余预算动态调整推理策略,避免冗余思考。在跨推理器、跨任务的设置中,ACTS 均表现出可控的准确率-效率帕累托前沿。

基线对比

相较于缩短/早停/压缩 token 的现有高效推理方法,ACTS 首次将推理策略选择建模为显式 Markov 决策,在保持生成流畅性的同时,赋予推理过程预算感知策略控制能力,避免了隐式修改推理路径带来的不稳定性。这种 agentic 框架为部署阶段提供了一种即插即用的推理成本控制方案,实用性更强。

行业影响

落地场景

Agentic Chain-of-Thought Steering (ACTS) 可直接嵌入任何依赖长链推理的 LLM 应用,例如 AI 编程助手、客服对话系统、教育辅导工具和金融数据分析平台。在这些场景中,模型需要多步思考来提升答案质量,但长推理带来的延迟和 token 成本影响用户体验和运营开支。ACTS 通过控制器智能体在推理过程中动态选择策略和注入引导短语,在保持最终准确率的同时大幅压缩推理长度,适合需要实时响应的交互式产品和大规模批处理的后台服务。

商业价值

ACTS 直接降低推理 token 消耗,为企业节省 LLM API 调用成本。同时,推理长度缩短意味着更低的端到端延迟,提升用户留存和满意度。更重要的是,它实现了预算感知的策略控制——服务商可以根据用户套餐或任务复杂度设定 thinking budget,提供差异化的服务水平(如免费版快速回答、付费版深度推理),从而创造新的盈利模式。这种精确的精度-效率权衡能力,使 LLM 产品能够覆盖更广的市场层级,从价格敏感型客户到追求最高质量的高端用户。

与现有产品/工作流的集成

ACTS 设计为控制器 + 冻结推理器的解耦架构,易于集成到现有 LLM 技术栈。控制器可以是一个轻量级模型或基于规则的策略模块,部署为微服务或与推理网关协同工作。在推理时,控制器接收当前推理轨迹和剩余预算,生成 steering 动作,注入到原始提示中继续生成。因此,它可以作为现有 LLM API 调用的中间件,兼容 OpenAI、vLLM 等主流推理框架,无需修改底层模型。集成工作集中在开发控制器的强化学习训练管道,并定义场景特定的预算策略。

具体落地用例

  • 电商智能导购:在线客服机器人使用 LLM 进行商品推荐的推理,ACTS 根据用户咨询的复杂度动态调整思考深度。简单“比价”请求使用极简推理(低预算),复杂“穿搭方案”则分配更多 token,在保障体验的同时降低千次对话的 GPU 消耗。
  • 金融研报自动摘要:投资分析平台每日处理数千份财报,LLM 需进行多步因果推理生成摘要。通过 ACTS,平台可按报告重要性分配不同预算(紧急摘要用短推理,深度报告用长推理),实现批量处理吞吐量提升和计算成本优化。

局限

  • **合成轨迹质量高度依赖基座模型**:控制器初始化的合成 steering 轨迹,通过向冻结 reasoner 注入策略提示自动生成。这些轨迹的多样性与覆盖度受基座模型能力与提示设计影响,若基座模型在未见任务上表现不稳定,或生成的轨迹噪声较大,可能导致控制器学到偏差策略,进而影响 OOD 推理场景下的 token 节省效率与最终准确率。此外,轨迹生成过程本身消耗大量推理 token,增加了训练前准备成本。
  • **离散短语操控粒度有限**:ACTS 将控制器动作限定为预定义的 steering phrase 集合,依赖冻结 reasoner 自行解读并执行策略。这类离散控制难以实现细粒度的推理调节(如中间步骤置信度校准、输出风格精确适配),且在 reasoner 对提示不敏感或固执地重复原始推理路径时,控制器无法强制干预。与直接修改 logits 或中间激活的 bypass 方法相比,控制力的上限更低。
  • **控制器需随基座模型重新训练**:RL 优化阶段使用预算条件 reward shaping,控制器策略与特定 reasoner 的生成分布深度耦合。论文展示了在不同 reasoner 上的实验,但每个 case 均需从合成轨迹开始独立训练。对于频繁切换基础模型的场景,这带来显著的训练计算开销,缺乏一次训练跨模型泛化的机制,限制了 ACTS 的即插即用性。
论文Yu Xia2026-06-02原文

相关内容