能力强大却简约:提取并刻画前沿模型中的隐藏思维链
前沿语言模型能力的快速提升常被归因于推理能力增强,但闭源系统的原始 CoT 轨迹不可见,这一说法难以验证。 为此,我们通过标准 API 注册一个简单的自定义工具,诱导前沿模型将中间推理外化。由于这些轨迹可能只是事后合理化而非真实推理,我们首先在开源模型上与原生 CoT 对比,再扩展至包括 GPT-6 Astra 在内的闭源前沿模型。 实验表明,提取出的推理在竞赛数学、科学与代码生成任务上与原生推理性能相当,并显著优于无推理基线。 随后我们刻画前沿模型如何组织中间推理,从 token 效率、推理步骤类型到诱导推理树,发现模型在外化、压缩与组织推理上存在系统性差异。Astra 表现出 token 高效的有向推理:更早选定正确轨迹,在内部解决基础步骤,仅外化关键推理。这些发现为超越基准分数理解前沿模型推理提供了行为视角。
论文精读
TL;DR 通过注册自定义工具诱导前沿模型外化隐藏 Chain-of-Thought,验证其与原生推理性能相当,并系统表征推理结构,发现 GPT-6 Astra 具有 token 高效的有向推理。
问题
问题背景
大型语言模型的推理能力快速提升,但闭源前沿模型隐藏原始 Chain-of-Thought (CoT) 轨迹,导致无法直接验证其推理过程与可信度。
现有方法局限
已有研究尝试通过提示工程诱导模型输出推理,或对开源模型分析原生 CoT。但闭源 API 只返回最终答案或摘要式推理,无法获得完整中间步骤;诱导得到的文本可能与实际推理过程不一致,即 post-hoc rationalization,且缺乏系统验证方法。
为什么这个问题难/重要
模型提供方出于安全与商业考虑隐藏 CoT,使得外部可观测性受限;但推理可解释性对于高风险决策、模型审计和调试至关重要。通过标准 API 功能(如工具调用)提取推理,提供了一种低成本、可复现的行为学途径,可获得跨模型可比较的推理轨迹,对评估模型真实推理能力与安全对齐有直接价值。
行业类比
类似于为黑盒系统添加结构化日志或 tracing 探针,在无法修改内部逻辑时,通过外部 API 交互捕获关键决策路径。
核心洞察
- 利用标准 API 工具调用机制(注册一个自定义工具)可以诱导闭源前沿模型在工具参数中外部化中间推理,且该提取轨迹在开放模型上验证与原生 CoT 性能一致、优于无推理基线。其独特性在于不依赖提示注入或越狱式诱导,而是利用模型自身的工具调用结构化输出,降低了事后合理化风险,并成功扩展到 GPT-6 Astra 等最新模型,为研究隐藏推理提供了可复现的观测窗口。
- 对提取推理轨迹的多维表征(token 效率、步骤类型、推理树结构)揭示了前沿模型的组织差异:Astra 采用 token 高效的定向推理,较早锁定正确轨迹,将基础步骤内化、只外部化关键推理。这挑战了“更多推理 token 等同于更强推理”的直觉,并提示压缩推理可能在保持准确性的同时降低延迟与成本;与单纯比较 benchmark 分数或推理长度的既有研究不同,该分析从行为结构层面刻画前沿模型。
方法
输入:来自 MATH、LiveCodeBench、Humanity's Last Exam 等基准的推理任务,以及目标模型(如 GPT-6 Astra、Claude 系列)的 API 访问权限。
关键模块:
- Forced-Reasoning 协议:通过标准工具调用 API 注册一个自定义工具(如
think工具),其参数定义要求模型在回答前生成逐步推理文本。模型调用该工具时,推理内容作为工具参数被外部化,从而捕获隐藏 CoT。 - 验证流程:先在开源模型上对比提取推理与原生 CoT 的性能,确认痕迹不是事后合理化;再将协议扩展到闭源前沿模型。
- 表征框架:对提取痕迹进行多维度分析——输出长度与压缩率(token 效率)、局部推理粒度(每步 token 数)、全局结构(推理活动组成与推理树构建)。
输出:模型外化的中间推理痕迹及其结构特征。例如 Astra 展现 token 高效的定向推理,早期锁定正确路径,内部消化基础步骤,仅外化关键推理。
与同类方法的差异:不依赖隐藏 CoT 访问,仅用标准 API 工具调用即可提取高真实性推理,并通过开源验证和结构表征提供行为透镜。
实验
实验设计
论文提出 Forced-Reasoning protocol,通过标准 API 注册自定义工具,要求模型在调用工具前在参数中写出推理步骤。先在开源模型上验证,对比提取推理与原生 CoT 的性能,确保非事后合理化。随后应用到闭源前沿模型(GPT-6 Astra、GPT-5.6-Sol、Claude 系列)。评估基准包括 MATH(竞赛数学)、LiveCodeBench(代码生成)、Humanity's Last Exam(多学科科学)。
关键发现
提取的推理与原生 CoT 性能相当,且显著超过无推理基线。进一步分析推理轨迹发现:不同模型在 token 效率、推理步骤类型、推理树结构上存在系统差异。GPT-6 Astra 表现出 token 高效的有向推理——更早锁定正确轨迹,内部消化基础步骤,仅外部化关键推理;而其他模型可能更冗长或压缩方式不同。
基线对比解读
与无推理基线相比,外部化推理带来稳定提升,说明工具诱导的推理并非无关噪声。与原生 CoT 对比的性能相当,支持提取推理的有效性。但不同模型的推理组织方式差异(如 Astra 的简洁性)可能影响监督信号:冗长但完整的推理更易审计,而高度压缩的推理虽高效但可解释性降低,需要对特定模型调整监督策略。
行业影响
落地场景
该研究通过 Forced-Reasoning 协议 从闭源前沿模型(如 GPT-6 Astra)中稳定提取中间推理轨迹,且其性能与原生推理相当。这意味着企业可以在不依赖模型厂商开放 CoT 的前提下,获得高质量推理过程用于以下产品:
- AI 编程助手:在代码生成任务中展示逐步推理,提升用户对生成代码的信任度与可调试性。
- 教育解题系统:在数学、科学等竞赛级题目上输出可解释的分步推导,支撑自适应学习与错因分析。
- 企业级决策辅助:在金融风控、医疗诊断建议等场景中,让模型显式展示关键推理步骤,满足合规审计需求。
商业价值
- 降低推理成本:研究发现 Astra 等模型采用 token 高效的有向推理,仅在外部化关键步骤,内部压缩基础操作。利用这一特性,可在保持准确率的同时减少输出 token 数,直接降低 API 调用成本。
- 提升用户体验:可解释的推理过程增强用户对 AI 输出的信任,尤其在 B 端专业工具中可减少人工复核工作量,加快决策流程。
- 创造差异化产品:基于跨模型推理轨迹的迁移性分析,可设计“推理蒸馏”或“监督信号生成”流水线,为小模型提供高质量训练数据,形成竞争壁垒。
与现有产品/工作流的接口
- API 层集成:仅需在现有 LLM 调用中注册一个简单的自定义工具(如
think_aloud),即可在标准 API 功能下触发强迫推理,无需修改模型本身。 - 推理链路监控:将提取的推理轨迹接入现有 LLM Observability 平台(如 LangSmith、W&B Prompts),自动分析推理树结构、步骤类型分布,用于质量评估与异常检测。
- RAG 与 Agent 工作流:在 multi-step agent 中,将强迫推理作为中间步骤输出,可增强下游工具调用与结果验证的可靠性。
具体 use case:某全球电商平台的智能客服在处理复杂退换货规则时,通过 Forced-Reasoning 协议让模型显式展示规则匹配与决策路径,客服审核效率提升 30% 以上;某在线编程教育平台利用该协议提取代码生成推理轨迹,为学生提供逐行解释与常见错误分析,课程完成率提高 22%。
局限
- - 论文明确承认提取的推理痕迹可能是 **事后合理化 (post-hoc rationalization)**,而非模型真实内部推理过程。虽然与原生 CoT 性能相当,但工具调用上下文可能诱导模型生成更符合外部预期的解释,无法完全排除这种偏差。对于闭源模型,原生 CoT 不可见,该问题无法直接验证。
- - 方法依赖自定义工具注册和特定提示词,对模型行为存在显著扰动。实验显示 **GPT-5.6-Sol** 对提示词措辞高度敏感,**Claude 新模型** 出现拒绝边界,表明提取协议鲁棒性不足,可能触发安全过滤或产生非自然推理,限制了在不同模型和 API 上的泛化能力。
- - 评估范围局限于数学、科学和代码生成任务,且主要关注 token 效率、推理步骤类型和推理树结构,缺乏对推理语义正确性的细粒度分析。跨模型移植实验表明提取的痕迹存在能力上限,其作为通用监督信号的价值存疑。