论文

使用 Bidirectional Evolutionary Search 的自改进语言模型

使用 Bidirectional Evolutionary Search 的自改进语言模型

传统搜索方法(如 best-of-N 采样和 树搜索)在语言模型自改进中面临两大局限:一是依赖稀疏验证信号,二是候选构造主要基于自回归扩展,将探索限制在模型概率质量较高的区域。本文提出 Bidirectional Evolutionary Search (BES),一种将前向候选进化与后向目标分解相结合的搜索框架。 在前向搜索中,BES 利用 进化算子 重组部分轨迹,生成难以通过单次模型 rollout 得到的候选;在后向搜索中,BES 递归分解原始任务为 可检查子目标,提供密集中间反馈以引导前向搜索。理论分析表明:纯扩展搜索的候选局限在狭窄的 熵壳 内,而进化算子可突破该限制;后向搜索能指数级减少找到正确答案所需的样本量。 实验方面,在具有挑战性的后训练任务中(主流后训练算法无法提升性能),BES 持续带来增益;在三个开放式问题求解基准的推理阶段,BES 在平均和最佳性能上均超越现有开源框架。代码和模型已公开。

论文精读

TL;DR BES 通过前向进化算子与后向目标分解,突破自回归搜索的熵壳限制,在稀疏奖励下实现高效探索与自改进。

问题

问题背景

让语言模型在无需外部监督的情况下自我改进,是当前 AI 研究的核心方向之一。无论是后训练阶段的样本生成,还是推理时的动态搜索,能否有效探索更大的解空间直接决定了模型在复杂任务上的上限。

现有方法局限

主流搜索策略如 best-of-N 采样树搜索(MCTS)存在两个根本局限:

  • 稀疏验证信号:搜索过程只能获得最终答案的正确与否反馈,缺少中间步骤的细粒度指导,导致探索盲目,采样效率极低。即使引入过程奖励模型,信用分配依然困难。
  • 自回归扩展限制:候选序列通过逐 token 自回归生成,搜索被严格限制在模型的概率分布内,难以跳出所谓 熵壳(entropy shell),错失大量模型认可度不高但实际正确的推理路径。 这使现有方法在逻辑推理、多跳推理等需要长程规划的任务上,性能增益远不及预期。

为何这个问题难且重要

技术挑战在于,搜索空间随序列长度指数级膨胀,而稀疏奖励加剧了探索-利用困境。更关键的是,既要利用模型先验保持生成质量,又要打破先验限制发现新解,这两者的平衡极难把握。业界关注度方面,随着 LLM 被用于代码生成、数学证明等需要自主决策的场景,降低搜索成本、提升探索有效性已成为决定系统实用性的瓶颈。解决这一问题,意味着模型能在更少采样下获得更高正确率,直接推动复杂推理产品的落地。

行业类比

这类似于用 遗传算法 优化高维非凸函数:单纯随机采样难以逃脱局部最优,必须引入 交叉、重组 等操作来重组现有片段——对 LLM 而言,即通过演化式地重组部分生成轨迹,从而逃离自回归的局部偏好,找到更优解答。

核心洞察

  • BES 通过进化操作(如 crossover、translocation)重新组合部分生成轨迹,突破了传统自回归搜索局限于模型高概率区域的“熵壳”限制,从而能产生单一模型 rollout 难以生成的候选解。 与 best-of-N 和树搜索仅依赖模型自身的采样或扩展不同,BES 的前向进化显式地从多个部分解中重组出跳出局部的候选,显著扩大了搜索空间的覆盖范围,在逻辑推理和多跳推理等困难的后训练任务上实现了传统方法无法达成的增益。
  • 后向目标分解递归地将原始任务转化为可检查的子目标,为前向搜索提供密集的中间验证信号,缓解了传统方法依赖稀疏最终奖励导致的采样效率低下问题。 该方法区别于单纯增加前向搜索预算的思路,通过在反向链路上构建目标树,将验证信号注入搜索过程,理论证明可指数级减少找到正确解所需的采样次数。在推理实验中也验证了这一策略的有效性,提升了最优和平均性能。

方法

输入与整体框架

BES 接收一个初始任务提示(如逻辑推理、多跳问答或开放域问题)和预训练语言模型作为生成器。它不修改模型权重,而是构建一个双向搜索流程,在训练后数据生成或推理时直接优化候选解。

关键模块

1. 前向进化搜索(Forward Search)

传统搜索(如 best-of-N 或树搜索)仅通过自回归扩展(autoregressive expansion)生成完整序列,这会将候选解限制在高概率的狭窄区域(熵壳)。BES 引入进化算子(evolutionary operators),对搜索过程中产生的部分轨迹进行重组:

  • 交叉(Crossover):交换两个不同轨迹的片段。
  • 易位(Translocation):将一段轨迹移动到另一位置。
  • 删除(Deletion)组合(Combination):移除冗余或拼接互补片段。 这些算子允许生成模型单次采样难以到达的序列,从而逃离熵壳,探索更广的解空间。
2. 后向目标分解(Backward Search)

为解决传统搜索中验证信号稀疏的问题,BES 将原始任务递归分解为可自动检查的子目标(checkable subgoals),构成一棵目标树。例如,多跳推理问题可拆解为多个单跳问题;程序合成任务可分解为子函数。每个子目标都有确定的验证标准,提供密集的中途奖励,指导前向搜索的方向。

3. 双向协同

后向分解出的子目标树成为前向搜索的中间路标。前向进化在生成候选解时,每一步都争取满足当前子目标,并通过验证信号及时筛选或修正,形成闭环优化。

输出与应用

经过搜索后,输出一系列高质量候选答案。在训练后场景中,这些候选被用作监督微调或偏好优化的训练数据;在推理场景中,直接选取最优候选作为最终答案。

与同类方法的差异:相比仅靠扩展的树搜索或 best-of-N,BES 通过进化算子主动重组搜索轨迹,并利用后向分解提供即时、密集的验证,从而在样本效率解空间覆盖上均有显著提升。

实验

实验设计

作者在两类场景评估 BES 的有效性:

  • 后训练样本生成:在逻辑推理与多跳推理任务上,主流后训练算法(如 best-of-N 采样)无法带来性能提升,BES 用于生成高质量微调样本。
  • 推理时搜索:在 Circle Packing (Square)Circle Packing (Rectangle)Heilbronn (Convex) 三个开放问题求解基准上,将 BES 作为推理时搜索策略,与现有开源框架对比。

同时,消融实验分解了进化算子与向后分解各自的贡献,并进行了成本分析。

关键发现

  • BES 在后训练任务上实现了持续增益,即使基线完全失效的场景下仍驱动模型自我改进。
  • 在开放问题求解中,BES平均性能最佳性能均超越所有对比的开源框架。
  • 消融表明,向前进化算子(组合、删除、交叉、易位等)显著扩展了可探索的解空间,生成传统自回归扩展难以获得的候选;向后目标分解产生密集的中间奖励信号,有效引导向前搜索。

与基线对比的深度解读

传统搜索(best-of-N、树搜索)受限于两个根本问题:

  1. 仅依赖稀疏的最终验证信号,缺少过程监督。
  2. 候选构建主要通过自回归扩展,探索范围局限于模型概率质量较高的“熵壳”内。

BES 通过进化算子重新组合部分轨迹,打破了这种限制,使搜索能触及常规 rollout 之外的解。理论分析证实,进化算子可使候选脱离窄熵壳的约束。同时,向后递归分解将原始任务转化为可检查的子目标,提供了密集反馈,指数级降低找到正确解所需的采样次数。这一设计在复杂推理任务上相比纯扩展搜索实现了显著性能跃升,尤其在需要长周期规划和多步组合的问题上。

行业影响

落地场景

BES 适用于需要复杂推理与验证的生成式 AI 产品,主要包括:

  • 智能编程助手:在代码生成与调试中,通过进化搜索探索脱离高概率区域的解,解决算法竞赛题或复杂代码重构任务。
  • 对话式分析系统:金融、医疗领域的问答与决策支持,利用目标分解将多跳推理转化为可检查的子步骤,提升答案可靠性。
  • 企业自动化工作流:IT 工单处理、合规审查、战略分析等,使用双向搜索生成并验证可执行计划。

商业价值

  • 降本:后向分解提供密集的中间验证信号,减少对昂贵人工标注的依赖;前向进化可在推理时以更少样本找到正确解答,降低 token 消耗与重试成本。
  • 增收:在逻辑推理、数学证明等高价值任务中提升成功率,直接增强产品竞争力,有助于获取企业级订阅与高净值用户。
  • 体验优化:在推荐解释、个性化教育等场景中,生成的推理过程更严谨且可追溯,提高用户信任与留存。

与现有工作流集成

  • 后训练管线:作为 RLHF/DPO 之后的数据增强模块,利用 BES 生成高质量合成轨迹,再用 SFT 或蒸馏回注至基座模型。
  • 推理引擎:封装为独立搜索服务,通过 API 与 vLLM、SGLang 等框架对接,接收 prompt 和任务定义,返回经双向搜索优化后的最终答案。
  • Prompt 工程:将后向分解得到的子目标树嵌入 prompt,引导模型逐步推理,与 Chain-of-Thought 等现有技术无缝结合。

典型落地案例

  1. 电商推荐解释:当系统向用户推荐特定商品时,需多跳推理(用户偏好→品类特征→商品属性匹配)。BES 先向后拆解解释步骤,再通过进化算子生成多条逻辑严谨的解释文本,提升点击转化率。
  2. 医疗辅助诊断:输入患者主诉与检查数据,BES 将诊断任务分解为“鉴别诊断列表”、“排除证据收集”、“最终推断”等子目标;前向进化对每个子目标生成多个候选路径,结合验证信号筛选出可靠诊断方案,降低误诊风险并提供完整审核链。

局限

  • 该方法高度依赖可检查子目标(checkable subgoals)的预先定义,反向搜索的质量直接受子目标分解策略影响。对于开放域或非结构化任务(如创意写作),自动生成可验证的子目标仍具挑战性,可能需要显著的人工设计,限制了方法的通用性和可扩展性。
  • 进化算子(如交叉、易位)虽然提升了搜索多样性,但引入了额外的模型调用和组合开销,尤其是在处理长轨迹时,计算成本可能远高于标准自回归采样或简单树搜索,实际部署时的推理延迟和资源消耗尚未充分量化对比。
  • 实验集中在逻辑推理、多跳推理和开放问题求解等结构化推理任务,尚未在更广泛的语言生成任务(如对话、翻译、摘要)上验证有效性。因此,BES 在通用 NLP 基准上的表现及其与现有后训练方法(如 RLHF、DPO)的互补性仍有待探索。
论文Guowei Xu2026-05-27原文

相关内容