论文

Chain-of-Experience 用于持续大语言模型改进

Chain-of-Experience 用于持续大语言模型改进

人类通过经验持续学习,而传统的大语言模型(LLM)评估忽略了模型通过推理时交互进行改进的能力。本文研究 LLM 如何在测试时从迭代经验中学习,我们将这一设定称为 Chain-of-Experience(CoE),模型通过与自身或环境的反馈进行迭代交互,累积经验轨迹,形成超越零样本推理的持续改进循环。 我们使用多种反馈机制实例化 CoE,包括模型自我反馈和环境信号(如正确性或公共编码测试通过率),并在数学、编码和知识领域使用 8 个 LLM(包括 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet)进行评估。研究表明,利用迭代经验始终优于无反馈基线,仅凭自我反馈即可实现显著收益,同时在不同任务和模型上总体提升 5.6%,API 成本降低 19%。 进一步地,结合互补的反馈通道(例如模型与正确性信号)可带来额外收益,且 CoE 比现有的测试时策略具有更高的每 token 准确率。我们观察到 LLM 基础能力与改进能力之间存在正相关,并证明模型在弱反馈或虚假反馈下依然稳健,不同反馈贡献于不同的改进方面,大多数收益在迭代早期即可获得。

论文精读

TL;DR Chain-of-Experience 让 LLM 在推理时通过迭代自我/环境反馈积累经验,持续改进输出,超越零样本基线,准确率提升 5.6% 且 API 成本降低 19%。

问题

问题背景

当前 LLM 评估主要依赖静态数据集上的零样本 / few-shot 准确率,衡量模型“一次性”作答能力。然而,人类在学习与解题中会不断积累经验,利用反馈改进后续表现,这种 推理时交互学习 (inference-time interaction) 能力尚未被主流基准捕获。

现有方法局限

  • 单轮推理扩展:如 CoT、Self-Consistency 仅在单次生成内并行采样或延长思考,不产生跨轮次的经验累积。
  • 浅层自修正:Self-Refine、Reflexion 等方法最多进行一轮自我批评与重写,缺乏对多轮迭代中反馈信号的持续整合。
  • 忽略环境反馈:代码执行结果、测试通过率等外部信号很少被作为可学习的经验源,模型无法像真实场景那样利用环境校验来改进策略。

这些方法均不形成 体验链 (Chain-of-Experience, CoE),导致模型在遇到新问题时无法复用之前的成功或失败教训。

为什么这个问题难/重要

构建 CoE 面临三个核心挑战:

  1. 反馈可靠性:自我反馈可能产生幻觉或误导,环境反馈也可能稀疏或延迟,需要设计鲁棒的反馈融合机制。
  2. 成本与效率:多轮迭代带来额外 token 开销,如何在提升准确率的同时保持 token 效率 (accuracy per token) 是实际部署的关键。
  3. 能力依赖性:不同基线能力的模型从经验中获益程度可能不同,需要通用且自适应的改进策略。

业界对 test-time scaling 和持续改进的关注度极高,因为静态模型难以适应动态任务,而 CoE 提供了一条在推理阶段动态提升性能的路径。

行业类比

类似强化学习 agent 在仿真环境中通过试错交互持续优化策略,或代码调试助手根据测试失败日志迭代修复补丁,CoE 让 LLM 在推理时也能“从错误中学习”。

核心洞察

  • CoE 将推理时迭代交互构建为“经验积累”的持续改进闭环,突破传统 zero-shot 评估对模型静态能力的假设。与现有 test-time strategies(如 self-refine、多数投票)大多聚焦单轮修正或简单聚合不同,CoE 让模型在多轮迭代中显式累积自反馈与环境反馈,使性能随经验增长,并在 8 个 LLM 上一致优于无反馈 baseline(+5.6%),验证了“经验”作为可复用资源的价值。
  • 混合互补反馈通道是 CoE 效率与鲁棒性的关键,自反馈与环境信号结合带来额外增益,并实现更高 token 效率与更低 API 成本。相对于纯自我反馈可能存在的盲区,CoE 引入正确性、测试通过率等环境信号作为外部校验,形成互补;实验显示混合反馈进一步提高性能,且每 token 准确率优于现有测试时策略,API 成本降低 19%,为部署推理时改进提供了更经济的路径。

方法

方法概述

Chain-of-Experience (CoE) 是一种推理时持续改进框架,让 LLM 在测试阶段通过迭代交互积累经验,形成由模型自反馈或环境反馈驱动的改进循环。

输入:一个任务实例(如数学题、代码生成、知识问答)的提示词。

关键模块:

  1. 初始推理:模型对输入生成初始回答(零样本基线)。
  2. 反馈获取:从两条通道获取信号:
    • 模型自我反馈:模型对自身输出进行评价或提出改进建议;
    • 环境反馈:外部信号,如答案正确性、公共代码测试用例通过率等。
  3. 经验累积:将每轮推理输出与反馈组合为经验痕迹(experiential trace),追加到上下文窗口,作为后续迭代的参考。
  4. 迭代改进:模型基于累积经验重新生成答案,循环多轮(大部分增益出现在早期迭代)。

输出:经过多轮迭代后选择的最终答案(如最后一次输出或根据反馈选择的最优答案)。

CoE 与 self-refine 等同类方法的差异在于:self-refine 通常只利用模型自身反馈做单轮或少量修正,而 CoE 显式建模跨轮次的经验累积,并将多种互补反馈通道(模型自我与环境信号)结合,形成更稳健、token 效率更高的持续改进循环。

实验

实验设计

在数学、编码、知识领域评估 8 个 LLM(包括 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet),引入多种反馈机制:模型自反馈、环境信号(正确性、公共编码测试通过率等)。对比反馈自由基线,衡量准确率与 API 成本。

关键发现

  • 迭代经验一致优于基线,仅自反馈即可产生显著提升。
  • 整体准确率提升 +5.6%,API 成本降低 -19%。
  • 组合互补反馈(如模型+正确性)带来额外增益。
  • CoE 每 token 准确率高于现有测试时策略。
  • 基础能力与改进能力正相关;模型对弱/伪反馈保持鲁棒;改进多集中在早期迭代。

与基线对比

CoE 相对零样本无反馈基线,通过累积交互经验形成持续改进循环,在提升指标的同时降低 API 调用成本。与现有测试时优化策略(如 self-refine)相比,CoE 以更高的 token 效率实现更优准确率,说明经验积累机制比单次额外推理更有效。该设计不引入训练成本,适合作为推理时的通用增强层。

行业影响

落地场景

  • 在线教育:自适应练习系统可让学生提交解答后,模型通过自我反馈与环境反馈(如正确性信号)在推理时迭代改进解题思路,动态生成个性化提示与解析,提升学习效果。
  • 软件开发辅助:代码助手可以在生成初始代码后,利用公共测试通过率作为环境反馈,多次迭代修复代码缺陷,提高一次通过率。类似的 coding 任务可嵌入 CI/CD 流程,减少人工调试负担。
  • 企业级 RAG 问答:客服或知识库系统可让模型根据用户反馈(点赞/点踩)和自我反思,在会话上下文中形成经验链,优化后续回答。

商业价值

  • 降低成本:论文显示 CoE 整体提升 5.6% 且 API 成本降低 19%。对于大规模调用 LLM 的业务,意味着在相同准确率下可减少 token 消耗,直接节省推理开支。
  • 提升体验:通过迭代反馈,模型可以在不重新训练的情况下提升任务表现,尤其对高价值复杂任务(数学推理、代码生成)带来用户体验的显著改善。
  • 增收机会:能够支持更复杂的自动化流程,比如自动代码审查、智能辅导等增值服务,扩大产品能力边界。

与现有产品/工作流的接口

  • 轻量级集成:CoE 不需要改变底层模型,可作为推理时编排层,在现有 LLM API 调用之上包装一个“反馈-重试”循环。例如,在 LangChain 或 LlamaIndex 中实现一个 ChainOfExperience 节点,接收任务、初始输出、反馈信号,自动执行多轮迭代。
  • 反馈源设计:可以对接已有的业务信号(如用户点击、测试结果、数据库查询成功标志)作为环境反馈;模型自反馈可以调用同一模型生成 self-critique。
  • 成本控制策略:研究显示大部分增益在前几轮迭代产生,可以设置早停机制(最大迭代次数或基于反馈信心的阈值),避免过度消耗 token。

具体落地 use case:

  • 代码托管平台(如 GitHub Copilot 类产品)可在用户接受代码建议后,自动利用单元测试结果作为环境反馈,让同一个模型对未通过的测试进行针对性修正,形成“生成→测试→修正”的体验链,显著提高用户采纳率。
  • 电商智能客服:用户投诉时,模型先给出初步解决方案,根据用户后续不满情绪(反馈信号)进行自我反思和调整,生成更符合用户诉求的回复,减少人工转接率。

局限

  • **任务与模型覆盖有限**:论文主要在数学、编码和知识三类任务上验证 CoE,虽然涵盖了多种 LLM,但实验范围仍不足以完全证明其通用性。作者在讨论中也承认,反馈机制(如自我反馈、正确性信号)是预定义的,并未探索动态调整反馈策略的可能性。此外,迭代轮数固定(例如 3 轮),没有研究更长期的经验积累效果,因此无法确定是否存在性能上限或饱和点。这些限制意味着 CoE 在更复杂、开放域任务中的表现仍有待验证。
  • **实际部署考量不足**:虽然论文报告 API 成本降低 19%,但 CoE 需要多轮推理交互,整体延迟和计算时间可能高于单次零样本推理。对于实时性要求高的场景,这种迭代过程可能不合适。另外,模型自我反馈的质量依赖基础能力,实验显示基础能力与改进容量正相关,表明低能力模型的提升空间有限,可能无法从 CoE 中获得显著收益。反馈信号的可靠性也有待进一步检验,特别是当环境反馈存在噪声时,模型虽展现一定稳健性,但极端情况下的表现未做深入分析。
  • **缺乏与更先进测试时策略的对比**:CoE 与 self-refine、self-consistency 等工作相似,但本文未与基于搜索的测试时扩展方法(如树搜索、多智能体辩论或内部推理模型)进行系统对比,无法确定其在更广泛测试时计算谱系中的相对优势。此外,CoE 缺少明确的停止准则,可能在不必要的情况下继续迭代,浪费 token。作者也未提供理论解释,说明为何经验积累能带来性能提升,这限制了该方法在理论层面的贡献。
论文Haoqin Tu2026-08-18原文

相关内容