通过 Self-Regulated Simulative Planning 实现高效 Agentic 推理
提出了一种将决策分解为三个系统的高效 Agentic 推理框架:模拟推理(System II)通过世界模型基于未来状态预测进行深思;自我调节(System III)通过可学习的配置器决定是否规划及规划深度;反应执行(System I)处理细粒度动作。模拟推理无需逐领域工程即可跨任务统一规划,自我调节确保仅在需要时调用规划器。 为验证该框架,开发了 SR^2AM(自我调节模拟推理 Agentic LLM),在 LLM 的思维链中分别实现两个阶段,并以 LLM 作为世界模型。探索两种实例化: 1. 从提示的多模块系统记录决策(v0.1) 2. 从预训练推理 LLM 的轨迹重构结构化计划(v1.0),通过监督学习后强化学习训练。 在数学、科学、表格分析和网络信息检索等任务上,v0.1-8B 和 v1.0-30B 的 Pass@1 分别与 120-355B 和 685B-1T 参数系统相当,而 v1.0-30B 使用的推理令牌比同类 Agentic LLM 减少 25.8-95.3%。强化学习使平均规划时长增加 22.8%,但规划频率仅增长 2.0%,表明模型学会了更长远规划而非更频繁规划。
论文精读
TL;DR 引入自我调节的模拟规划框架,将推理分解为三系统协同,通过按需规划大幅减少推理 token,8B 模型性能媲美百亿参数系统,实现高效智能体推理。
问题
问题背景:当前 LLM 驱动的智能体在复杂长任务中,逐渐从简单对话向自主决策与行动演进。业界关注如何让模型既具备深度推理能力,又不以无节制消耗计算资源为代价。
现有方法局限:主流方案将智能体构建为端到端的反应式策略,通过 思维链(chain-of-thought) 等自适应计算隐式地让规划涌现。这类方法缺乏对规划过程本身的显式控制——何时启动规划、规划到多深、何种结构,完全由模型自主生成,导致过度推理(overthinking)与推理令牌(reasoning tokens)大量浪费。实测表明,仅在提示中增加“逐步思考”等引导,不仅不确定地提升准确率,反而使推理长度膨胀数倍,且不同任务对规划深度的需求差异极大。
为何难且重要:有效规划的核心矛盾在于 效率与性能的权衡。若模型在任何情况下都进行高成本的长程前瞻规划,简单任务会被严重拖慢;若只凭即时反应,复杂任务又难以正确求解。要让智能体自主学习“何时规划、规划多远”,需要模型具备 世界模型(预测未来状态)、自我调节(动态决策规划预算)与 反应执行 三层能力,并在训练中协调三者,技术挑战远高于单一模型优化。业界对推理成本的敏感度日益上升,若能显著削减推理令牌(如 30–90%)而保持性能,将直接降低生产环境的大规模部署开销。
行业类比:如同自动驾驶系统中,感知-规划-控制的解耦架构中,路径规划模块需根据场景动态调整规划的时空粒度——简单直道仅需短距规划,复杂路口则需长距轨迹预测;无调节的全程高精度规划会耗尽算力且无必要。
核心洞察
- **自调节模拟规划解耦“何时规划”与“如何规划”,让小型 LLM 实现高效推理。** 现有方法往往将推理过程整体外包给链式思维,导致 token 消耗失控且无可靠精度收益。SR²AM 通过显式分离 System II(基于世界模型的模拟推演)与 System III(习得的配置器决策是否及多深地规划),使模型仅在需要时启动深层规划,在数学、科学、表格分析和网络信息寻求等任务上,8B 和 30B 模型的 Pass@1 可分别媲美 120–355B 和 685B–1T 参数系统,同时减少 25.8–95.3% 的推理 token,证明控制规划本身即竞争力。
- **RL 训练让模型学会“深谋远虑”而非“频繁规划”,揭示了自适应推理的新优化维度。** 在 v1.0 的 RL 细化中,平均规划深度提升 22.8%,而规划频率仅增加 2.0%,表明模型习得的是延长前瞻视野,而非机械增多规划次数。这不同于以往靠外部注入计划或用固定频率调用的方法,体现出习得的自调节能从数据中内化效率策略,避免“过度规划”的冗余开销,为智能体自主管理推理资源提供了可泛化的原则。
- **从预训练推理 LLM 的踪迹重建结构化计划,提供低成本训练高质量规划行为的数据范式。** v1.0 不依赖人工设计的带注释规划示例或多模块提示工程,而是从已有推理模型的输出中逆向恢复计划的逻辑结构,再通过监督和 RL 微调。这种“痕迹重构”方案使小模型吸收大模型的深层规划模式,无需昂贵采样或领域工程,为从已有 Reasoning 模型中萃取结构化决策能力铺平了道路,同时保持了与自调节架构的兼容,让训练数据收集更 scalable。
方法
SR²AM 将 Agent 决策过程解构为三个协同系统,全部实现在 LLM 的链式思考(chain-of-thought)框架内,LLM 自身充当世界模型。
输入:任务指令与当前环境观测(如数学题、表格数据、网页查询)。
关键模块
自调控系统(System III)
一个可学习的配置器,动态决定是否启用规划以及规划的深度。它输出结构化的规划指令,避免无谓的推理 token 消耗。模拟推理系统(System II)
基于世界模型(即 LLM 自身)对未来状态进行预测性推演,生成结构化的执行计划(如步骤序列、工具调用预案)。该模块统一处理数学推理、科学分析、网页搜索等多种任务,无需针对每个领域单独设计。反应式执行系统(System I)
依据模拟推理产生的高层计划,执行细粒度的动作(如代码运行、网页浏览)。它只在需要时被触发,其余时间保持休眠。
训练流程
- 监督数据构建
- v0.1:通过提示一个多模块系统(可能由多个专用提示或代理组成)生成推理轨迹,从中记录自调控决策与规划步骤。
- v1.0:从已有大规模预训练推理 LLM 的输出轨迹中,逆向重建出结构化的计划,形成高质量训练样本。
- 强化学习精调(采用 GRPO 目标)
奖励函数综合考虑任务完成正确性与推理效率。关键发现:RL 使平均规划视野提升 22.8%,而规划频率仅增加 2.0%,表明模型学会了“看得更远”而非“想得更多”。
输出:最终答案及相应的推理链,链中明确区分调控决策、规划段与执行动作。
与同类方法的差异:现有工作如链式思考或外部规划器要么让规划不可控地隐式涌现,要么依赖硬编码的调用策略;SR²AM 首次将“何时规划、规划多深”的元决策内嵌为可学习模块,通过强化学习实现自适应调节,在保持任务性能的同时大幅压缩推理 token 消耗(最高减少 95.3%)。
实验
实验设计
论文在数学推理、科学问答、表格分析、网络信息搜索等多类任务上,验证 自调控模拟推理 (SR²AM) 的效率与性能。实验涵盖两种实现:
- v0.1 (8B 参数):通过多模块提示收集决策轨迹,构建监督数据;
- v1.0 (30B 参数):从预训练推理 LLM 的轨迹中重构结构化计划,先经监督学习初始化,再通过强化学习 (RL) 优化。
评估采用 Pass@1 和推理过程中的 token 消耗量,基线包括无调控的 Chain-of-Thought 及部分调控的智能体系统。
关键发现
- 以小博大:v0.1-8B 的性能与 120B-355B 参数的系统竞争;v1.0-30B 的表现则与 685B-1T 参数的系统相当。
- 推理效率飞跃:v1.0-30B 相较于同类智能体 LLM,推理 token 数减少 25.8%–95.3%。
- RL 优化规划策略:RL 后,平均规划范围提升 22.8%,但规划频率仅增加 2.0%,表明模型学会了“更深而非更频繁”地规划。
- 消融验证:移除计划重构或 System I+II+III 结构后性能下降,证实各组件均为必要。
与基线的深度对比
传统无调控或部分调控的智能体常因过度推理浪费 token,而 SR²AM 通过显式分解为反应执行 (System I)、模拟推理 (System II) 和自我调控 (System III),仅在必要时调用规划模块,在维持高性能的同时大幅压缩推理成本。
与“努力自适应”方法不同,SR²AM 的 RL 训练不是简单增加推理步数,而是延长规划视野,这类似一种“更聪明而非更努力”的范式转变——模型学会在关键决策点进行更深远的推演,而非在每一步都进行浅层规划。这种通过学习调控实现的高效推理,对构建可扩展、低成本的智能体系统具有重要启示。
行业影响
落地场景
SR^2AM 的自调节模拟规划能力可直接嵌入各类 AI Agent 产品,适用于需多步推理且对延迟与成本敏感的场景:
- 智能客服:电商售后、金融理财咨询中,用户问题复杂度不一。模型可自动判断是简单 FAQ 还是需多工具调用的长链路任务,避免无差别深度推理,显著降低首字延迟。
- 数据分析助手:在 Jupyter/Colab 类产品中,用户可能要求“画一张销售趋势图”或“分析用户流失原因并建议干预策略”。前者只需单步代码生成,后者需多轮假设-验证。SR^2AM 能自适应规划步数,减少无效试探。
- 教育辅导:数学/科学解题时,题目难度跨度大。模型可对简单题直接解答,对复杂题展开模拟推导,在保持教学一致性的同时节省算力。
商业价值
降低推理成本 是核心杠杆。实验显示 v1.0-30B 使用比同类 agentic LLM 少 25.8–95.3% 的推理 token,意味着在同等 QPS 下,API 服务商的 GPU 成本可大幅削减;同时 Pass@1 持平甚至反超规模更大的模型,使中小模型部署更有竞争力。
改善用户体验:减少无效推理直接压缩响应时间,尤其适合实时交互场景。更短的思考流程也降低用户等待焦虑,提升留存。
模型即服务(MaaS)差异化:提供“自适应推理深度”的售卖点,帮助平台在计费(按 token 或按复杂度)上设计灵活产品线,吸引对成本敏感的企业客户。
与现有产品/工作流的接口
SR^2AM 以 LLM Chain-of-Thought 内部阶段 实现,无需额外组件,可无缝集成进现有推理栈:
- 训练集成:通过监督微调(SFT)+ 强化学习(RL)在后训练阶段注入,与主流模型(如 Llama、Mistral 系列)兼容。训练数据可从已有推理轨迹中重建(v1.0 方案),无需人工标注。
- 推理部署:沿用标准 vLLM/TGI 等引擎,只需一个系统提示(system prompt)定义三阶段格式(
[SYSTEM_I],[SYSTEM_II],[SYSTEM_III]),已有 tools/function calling 框架可直接复用。 - 工具链复用:支持 search、code executor 等常见 agent 工具,与 LangChain、Semantic Kernel 等编排框架不冲突,可作为其中“决策层”的升级版本。
具体落地 Use Case
电商智能导购 Agent:用户输入“帮我比较 A 和 B 两款手机,推荐性价比最高的,顺便查下历史价格”。传统 Agent 可能启动完整 search→browse→compare 链,SR^2AM 的 自调节模块 识别到历史价格查只需一次 API 调用,将其合并,仅在比参数时触发模拟规划(System II),整体 token 减少 40%+,且答案结构更紧凑。
医疗 SaaS 中的预问诊助手:患者描述症状后,系统需要排除急重症风险。简单描述如“头痛两天”可直接给出护理建议(System I 响应);若提及“胸痛+呼吸困难”,则自动进入 模拟推理 模式,逐步调用医学知识库、症状检查器,生成结构化鉴别诊断列表(System II+III),在确保安全性的前提下,平均对话轮次减少 30%,缓解医院线上系统负载。
局限
- **世界模型(LLM)的预测精度是瓶颈。** 模拟推理依赖 LLM 对未来状态做预测,而当前 LLM 在长程预测和细节保真上仍有明显误差,尤其在需要精确数值或物理约束的任务中。论文未深入分析世界模型自身精度对规划质量的定量影响,也缺少与基于符号规划器或仿真器的混合方案的对比。
- **训练数据构建依赖强闭源模型,可复现性受限。** v1.0 的 Plan Reconstruction 需要从预训练推理 LLM 的轨迹中提取结构化规划,该过程对教师模型的能力和提示设计高度敏感;论文未详细对比不同教师模型的影响。此外,v0.1 的多模块推理提示工程成本较高,可能限制方法在不同领域的快速迁移。
- **评估集中于静态推理任务,动态环境泛化性待验证。** 所有基准测试(math, science, tabular analysis, web search)均为单轮或有限交互的文本环境,缺乏需要持续环境反馈和实时调整的具身或交互式任务。在状态空间更复杂、动作反馈有延迟的场景中,自调节规划的触发机制和规划深度策略是否仍然有效尚未检验。