系统切换:快速决策模型何时该停下来思考?
双过程 智能体将快速策略与慢速审议模型配对。实时场景中慢速模型持续运行;在回合制智能体与机器人规划器中,它由不确定性或检测到失败等事件触发。我们研究一个快速学习 actor:它负责每个决策,仅当门控开启时才把控制权交给推理型 vision-language model,而游戏继续运行。 方法上使用闭环 Doom 与新的开放 System One 类型化决策模型,经统一的 llama.cpp 接口服务。在 900 道留出问题上: 1. 0.15B–9B 的零样本决策模型在其错误中选择收集物品的频率为随机的 1.6–1.8 倍,与选项顺序无关,但顺序会改变部分模型的准确率; 2. 准确率、校准 与 敏感度(置信度区分对错的能力)彼此独立:准确率相近的模型 AUROC 差异很大,最敏感模型的置信度追踪的是失败情境类型而非错误答案; 3. 离线把置信度最低的 30% 决策延迟给推理模型,增益与 actor 的 AUROC 成正比(秩相关 0.87),在留出游戏上增益为 +0.13 [0.08, 0.18] 与 +0.08 [0.02, 0.14],约一半来自推理; 4. 闭环中(33 局、三个种子)无变体到达出口;承诺执行计划能打开更多门并让静止的 actor 行动,但按固定探索规则行事时死亡更多。被告知某些门需要钥匙后,推理器会把普通门当作锁门,没有该知识时它又回去收集物品。
论文精读
TL;DR 针对“快速决策模型何时应停下思考”这一问题,论文在 Doom 实时环境中实测:基于置信度门控将低置信决策延迟给推理模型,增益与 AUROC 正相关,并揭示了闭环链路瓶颈。
问题
问题背景: 当前 AI 系统越来越多采用 快慢双过程架构,即轻量快速策略负责实时决策,重型推理模型处理复杂情形。在实时交互环境中,核心困惑是快速模型何时应把控制权移交给慢速推理模型。
现有方法局限: 多数实现让慢速模型连续运行,造成高计算开销与延迟;回合制系统中常按事件触发(如不确定性超阈值或检测到失败),但这些启发式信号与真实错误之间相关性弱,且无法适应动态闭环。此外,现有 deferral 研究多基于离线静态数据集,缺乏在线时序下 gate 的动态影响评估。快速模型的置信度往往校准不足,不能直接用作可靠开关。
为什么难/重要: 技术挑战在于 gate 必须同时满足低延迟、在线决策、与任务整体收益对齐,而 准确率、校准、敏感性(AUROC) 是独立维度——论文显示相似准确率模型在 AUROC 上差异显著,说明仅提升准确率不能解决何时停止思考的问题。业界关注点在于系统效率与性能的平衡,尤其在需要频繁调用大型推理模型时,错误的 gate 策略会浪费计算并破坏实时性。
行业类比: 类似自动驾驶中实时规划器与高算力推理模块之间的切换,何时让轻量模型把控制权交给复杂推理引擎,既避免延迟又能在关键场景解锁更强能力。
核心洞察
- **置信度质量的三个维度(accuracy / calibration / sensitivity)相互独立,且高 AUROC 的模型其置信度跟踪的是“失败类型”而非“答案对错”。** 这与传统 deferral / selective prediction 假设 confidence 直接反映样本难度的做法不同:即使模型准确率相似,AUROC 差异很大,且最灵敏模型的 confidence 与情境类别相关,而不是与单题正误相关。这意味着在部署时如果只依据 confidence 做门控,可能把系统性问题当作随机噪声处理,需要额外校准或按情境分桶。
- **离线 deferral 的收益与 actor 的 AUROC 呈强秩相关,但这一关系在 closed-loop 中不保证成立;闭环内没有任何变体到达出口,计划承诺反而暴露了状态表征缺失的瓶颈。** 离线实验中,选择 held-out 上最优的 actor 与 deferral rate 可获得 +0.13 的显著增益,与 AUROC 秩相关 0.87;然而在真实 Doom 环境中,固定 explore rule 或 reasoner 计划反而使 agent 死更多次,原因是 VLM 无法区分普通门和需要钥匙的门,导致错误的锁门假设。这说明静态的 confidence-gated deferral 基准不能替代闭环验证,门控策略必须考虑状态可辨识性和慢模型对同一状态的理解偏差。
方法
输入
Doom 游戏环境中的视觉观察与结构化决策问题。快速决策模型接收游戏状态(图像或文本描述),并针对当前选项(如是否收集物品、移动方向)输出选择。采用开源的 System One typed-decision models(0.15B–9B 参数),通过 llama.cpp 统一接口以零样本方式运行。慢速思考模型为推理型视觉语言模型(reasoning VLM),支持链式推理。
关键模块
- Fast Actor:每步决策由该模型快速执行,同时输出置信度(如 softmax 概率),用于门控判断。
- System Switch(门控机制):比较 actor 置信度与阈值;若低于阈值(例如最不自信的 30%),则打开门控,将控制权交给慢速思考模型。门控开启期间,游戏继续实时运行,不等待推理完成。
- Slow Thinker:获得当前观察(可包含历史上下文)后进行多步推理,异步产出决策,可能覆盖后续动作。
- 闭环评估:整个系统在 Doom 中连续运行多局游戏,记录通关率、地图覆盖率、开门次数等指标。
输出
最终执行的动作序列,来自 fast actor 与 slow thinker 的混合决策。离线阶段还通过置信度排序计算 AUROC,量化门控带来的相对随机推迟的增益。
与同类 selective prediction / cascade 方法相比,本工作在实时闭环环境中验证门控切换,并区分了准确率、校准与敏感度对最终增益的不同贡献。
实验
实验设计
- 环境为 closed-loop Doom,使用 System One typed-decision 模型(0.15B–9B)作为快速 actor,通过
llama.cpp接口统一服务。 - 在 900 个 held-out 问题上评估 zero-shot 决策模型的选项选择与置信度校准;离线实验将最低置信度 30% 决策推迟给推理 VLM,对比随机推迟。
- 闭环实验运行 33 场游戏、3 个种子,测试 plan commitment 与固定 explore rule 的实际效果。
关键发现
- 决策模型错误中选择收集物品的频率是随机的 1.6–1.8 倍,且选项顺序影响部分模型准确率。
- 准确率、校准与敏感性相互独立;相似准确率模型在 AUROC 上差异显著,最敏感模型的置信度追踪失败场景类型而非具体答案对错。
- 离线推迟收益与 actor AUROC 强相关(秩相关 0.87);在 held-out games 上选择最优 actor 和 rate 后,增益达 +0.13(原始顺序)/+0.08(打乱顺序),推理贡献约一半。
- 闭环中无一变体到达出口;承诺计划可扩大探索、增加开门数,但 explore rule 导致更高死亡率,推理常将普通门误判为锁门。
与基线对比解读
- 与随机推迟相比,置信度门控推迟显著更优,证明置信度信号有效;但闭环失败表明离线增益未转化为任务成功,实时环境中的状态歧义与计划执行瓶颈比单步准确率更关键。
- 相比传统连续运行慢模型的方案,事件门控可减少计算开销,但需解决可靠触发机制,否则无法完全替代持续推理。
行业影响
落地场景
双进程(dual-process)决策架构适用于需要低延迟高频决策 + 偶发复杂推理的产品。快速 actor 处理大多数常规操作,仅在不确定性高时请求慢速 VLM reasoner。典型场景:
- 自动驾驶 / 机器人:常规路径跟随用轻量策略,罕见场景(临时施工、异常障碍)触发视觉语言模型。
- 电商实时推荐:轻量模型快速生成候选,高价值或低置信用户/商品请求 LLM 深度排序。
- 智能客服:规则或小模型响应常见问法,复杂投诉转接给 LLM 多轮推理。
商业价值
核心收益在推理成本与决策质量平衡。论文显示,基于置信度 gate 的 deferral 相比随机 deferral 在 held-out 游戏上可提升 +0.08~+0.13 准确率,推理模型承担约一半增益。企业可以:
- 减少大模型调用:只在约 30% 低置信决策时调用 reasoner,节省 GPU/API 成本。
- 提升用户体验:避免简单任务过度延迟,同时降低高风险场景错误率。
- 可量化调优:通过 actor 的 AUROC 与 deferral 比例选择最优点,无需全量部署 slow model。
与现有产品 / 工作流接口
论文使用统一的 llama.cpp 接口服务多个 System One typed-decision models 和 VLM reasoner,集成路径清晰:
- 将策略模型与视觉推理模型都封装为兼容 OpenAI 或
llama.cpp的服务。 - 在决策层加入 gate 中间件,读取 actor 的置信度或熵,超过阈值则转发给 reasoner,否则直接输出。
- 离线评估各 actor-option-order 配对的 AUROC,确定合适的 deferral rate(例如 30%)和顺序配置,上线后持续监控校准与错误类型。
具体 use case:某电商搜索排序系统,快速双塔模型实时返回 top-10,当 query 置信度低于阈值时调用多模态 LLM 对商品图片和用户历史做联合重排;某自动驾驶公司的端到端行车模型在匝道合流或临时施工时触发视觉推理模型看路况图并生成备选路径。
局限
- **实验规模与泛化受限**:闭环实验仅 33 场游戏、3 个种子,且只使用 Doom 单一环境,统计稳健性有限,也缺乏跨环境的泛化验证。门控策略(固定延迟最低置信度 30%)是在离线阶段确定的,没有在闭环中动态调整,可能并非最优。与同类工作相比,未与更先进的闭源推理模型(如 GPT-4V 等)对比,使用的 System One 模型参数量仅 0.15B–9B,可能不足以代表实际部署的模型容量。
- **任务复杂度暴露的瓶颈**:作者承认所有闭环变体均未到达出口,暴露出当前系统在长周期规划与感知结合场景下的明显短板。关键问题在于环境中“需要钥匙的门”与“普通门”在视觉状态上不可区分,导致推理模型做出错误假设,这反映出仅依赖当前状态观察的局限性,也限制了该方法在真实复杂环境(如机器人操作)中的直接应用。
- **工程实用性评估不足**:论文主要研究“何时切换”,但未系统比较不同门控策略(如基于不确定性、基于失败检测、基于任务进度等)之间的优劣,仅对比了随机延迟。同时缺少推理模型运行代价(如延迟、计算开销)的量化分析,无法指导实际系统的成本-收益权衡。这使得研究结论更偏观察性,难以直接转化为工程决策准则。