Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
设计更快的 GPU 内核的经验能否也有助于解决一个长期悬而未决的数学猜想?近期,集成到进化搜索中的大语言模型(LLMs)在优化任务上取得了最先进的成果,包括开放数学猜想、GPU 内核设计、科学规律发现和组合谜题。为此,先前的工作每次只对单个目标任务应用搜索框架,每个新问题都从头开始,模型尝试结束后搜索过程中积累的经验便被丢弃。这种逐步进化解决方案的能力(例如,知道变异哪一部分以及如何变异、何时回溯)完全保留在框架中,而非模型本身。模型自身能否获得这种能力并在不同任务间复用,尚未得到充分研究。 为解决此问题,我们提出了进化微调(Evolution Fine-Tuning, EFT),这是一种中间训练范式,通过将进化搜索轨迹转化为监督信号来教导 LLMs 跨任务进化解决方案。我们构建了 Finch Collection 数据集,包含 156K 条轨迹,覆盖 10 个领域和 371 个优化任务,并在 2B 到 9B 参数的开源 LLMs 上进行微调。实验表明,EFT 实现了跨任务泛化:在 22 个保留任务上,我们的模型平均超过基础模型 10.22%。此外,结合测试时强化学习(test-time RL),我们的模型在两个圆填充任务上达到最先进性能,并在 Erdős 最小重叠问题上超越其基础模型对应版本。EFT 因此作为通用发现代理的“练习阶段”,使其不再从零解决新问题。
论文精读
TL;DR EFT 将进化搜索经验固化为模型能力,让LLM跨任务自我进化,不再每次从零搜索,成为通用发现智能体的“练习阶段”。
问题
问题背景
LLM 与进化搜索的结合已在多个优化任务上取得 SOTA 成果,包括开放数学猜想、GPU 内核设计、科学定律发现等。然而,现有方法每次面对新任务都从零开始,搜索过程中积累的经验(变异策略、回溯时机等)随任务结束而丢弃,未能内化到模型参数中。
现有方法局限
- 单任务孤立搜索:进化搜索框架(scaffold)对每个任务独立运行,不保留跨任务的通用“进化技能”,导致计算资源浪费且无法复用知识。
- 能力归属错位:如何迭代改进解、选择变异方向等关键能力完全由外部框架规则编码,LLM 仅充当变异算子,自身缺乏对进化过程的元认知。
- 泛化缺失:当任务分布变化时,系统必须重新设计搜索策略,无法像人类专家那样将以往的设计经验迁移到新问题上。
技术挑战与重要性
让模型学会“如何进化”,而非仅在单个任务上“被进化”,是迈向通用发现智能体的关键一步。其难点在于:
- 轨迹抽象:从多样化的优化任务中提取出通用进化模式(如收敛判断、探索-利用平衡),这些模式必须与领域知识解耦。
- 跨域泛化:同一进化策略要适用于数学、代码、组合优化等差异巨大的领域,要求训练数据覆盖足够宽的 task landscape。
业界关注此问题,因为一旦突破,LLM 将能以试错经验为燃料持续自我改进,大幅降低新任务上打到 SOTA 的成本,并可能催化科学研究自动化。
行业类比
类似 RL 智能体在多个游戏环境中训练后产生的“学习策略”,能零样本泛化到新游戏;EFT 期望 LLM 经过多种优化任务的“练习”后,变成一个能跨任务快速适应的通用进化求解器,而不再需要每次从头调参。
核心洞察
- EFT 将搜索经验内化到模型参数中:通过把 371 个任务上的进化搜索轨迹转化为监督信号进行中训练,模型不再依赖外部脚手架从零开始探索,而是学会通用且可跨任务迁移的进化策略。与 FunSearch、Eureka 等每次针对单一任务搭建搜索脚手架且用完即丢不同,EFT 积累的“如何突变、何时回溯”的元能力使新任务求解不再从零冷启动。
- EFT 与测试时 RL 构成互补的两阶段范式:先通过轨迹监督让模型掌握基础进化操作,再在测试时与 RL 结合进一步优化,性能超越单纯使用 RL 或脚手架的同类方法。这为构建通用 AI 发现智能体提供了新路线——中训练负责“练习”,测试时 RL 负责“临场发挥”,两者叠加在 Erdős 最小重叠问题、圆装箱任务上均取得领先结果。
方法
方法概述:Evolution Fine-Tuning(EFT)
EFT 是一种 mid-training 范式,核心在于将 LLM 与进化搜索过程深度融合,使模型直接内化跨任务的发现与迭代优化能力。该方法遵循 “输入 → 关键模块 → 输出” 的管线,具体如下。
输入:任务-解对与进化轨迹
- 给定一个优化任务(如数学猜想、GPU 内核设计、科学定律发现等),附带当前候选解。
- 输入格式化为文本序列,包含任务描述和当前解状态,模型需预测一个更优的变体解。
关键模块:Finch Collection 构建与监督微调
1. Finch Collection – 进化轨迹数据集
- Seed Optimization Task Collection:从 10 个领域收集 371 个基准优化任务,并为每个任务生成初始解。
- Evolutionary Trajectory Collection:对每个任务运行进化搜索(如使用变异、交叉、回溯等操作),记录完整的搜索轨迹,即一系列
(当前解, 变异操作, 新解)的步骤。 - Trajectory Filtering:只保留最终导向高性能解的轨迹,过滤掉无收益或退化的路径,确保监督信号质量。
- 最终得到 156K 条轨迹,覆盖多种优化拓扑,形成通用的“进化经验”语料。
2. EFT 微调过程
- 以 Finch Collection 为监督数据,对开源 LLM(2B 至 9B 参数)进行标准语言建模微调。
- 训练目标:给定任务上下文与当前解,模型直接生成下一轮变异后的解。通过模仿成功轨迹中的变异决策,模型隐式学习到变异策略、时机判断及回溯模式。
- 附加阶段:训练模型区分“好解”与“坏解”(二分类头或 reward 信号),进一步增强对解质量的判别能力,从而在生成时更可能提出有效改进。
输出:具备通用进化能力的发现代理
- 微调后的模型(称为 ℱinch)在未见过的 22 个 hold-out 任务上,平均性能比基座模型提升 10.22%。
- 模型可独立运行进化搜索,不再依赖外部 scaffold 全部指导;测试时还支持与 test-time RL 结合,继续适应新任务。
与同类方法的差异点
先前工作将 LLM 与进化搜索结合时,每个任务都从零开始构建独立的搜索 scaffold,累积经验被丢弃,无法跨任务迁移;EFT 则将搜索经验固化为模型参数,实现了搜索能力的跨任务泛化,使得新问题求解不再是“从零开始”的过程。
实验
实验设计:作者在 Finch Collection 上对 2B 到 9B 的开放 LLM 进行中期微调(mid-training),并在 22 个保留任务上测试跨任务泛化。同时结合测试时强化学习(test-time RL)以考察 EFT 作为中期训练的功效。
关键发现:EFT 在所有模型规模上均带来跨任务发现泛化提升,平均相对提升 10.22%。进一步训练模型区分好与坏解能增强泛化。EFT 还能有效作为测试时 RL 的中期训练,使模型在 circle-packing 任务上匹配最先进性能,在 Erdős 最小重叠问题上超越原始基础模型。增加训练任务数量能持续提升迁移效果,表明模型学习了可迁移的发现模式而非死记硬背。
基线对比:与从零开始的搜索支架相比,EFT 模型将经验内化至模型权重,避免了每个新任务从头开始。这区别于先前工作仅靠外部支架(scaffold)迭代,知识无法累积。与单纯增大模型或单纯 RL 相比,EFT 在少量样本上即展现泛化,且能与测试时 RL 协同,显示出“练习阶段”的价值。
行业影响
落地场景
Evolution Fine-Tuning (EFT) 赋予 LLM 跨任务进化优化能力,可直接嵌入需要反复搜索与改进的自动优化场景:芯片设计中的 布局布线优化、药物分子设计的 属性优化、GPU 内核代码性能调优、推荐系统超参搜索、量化交易策略生成等。这些场景的共同痛点是每次新问题都需从零设计搜索策略,EFT 的模型能复用先前的探索经验,减少重复试错。
商业价值
EFT 的核心价值在于 降低优化成本与加速研发周期。传统进化搜索每次任务需人工设计算子与回溯逻辑,且搜索轨迹无法复用;EFT 通过中段训练将轨迹转化为模型本能,使新任务首次尝试即可表现更好,直接节省算力与专家时间。与测试时强化学习结合后,模型可在推理阶段持续自我改进,形成“训练时积累经验 + 推理时微调”的正反馈,为自动化 AI 实验室(如 AutoML 平台)提供更高阶的发现能力,从而缩短产品迭代周期,提升企业竞争力。
集成接口
EFT 模型可作为 发现代理 插入现有 LLMOps 或 AutoML 流水线:
- 替换/增强现有进化搜索框架的 变异与评估模块,通过 API 调用模型生成候选方案及其改进方向。
- 与 测试时 RL 框架(如 OpenRLHF、TRL)结合,在部署环境实时调整策略,无需重新训练即可适应分布变化。
- 作为 可复用资产,通过持续采集新任务轨迹扩展数据集
Finch Collection,形成企业内部的优化经验库,供不同业务线调用。
具体用例:
- 电商推荐系统超参调优:训练好的 EFT 模型直接对推荐模型的嵌入维度、学习率等参数组合进行进化搜索,比传统贝叶斯优化快数倍,且能迁移到新品类的推荐任务。
- 金融量化策略生成:在生成 Alpha 因子组合时,EFT 模型可根据市场状态动态调整因子权重与回溯参数,避免策略过时,实现自适应进化。
局限
- **依赖预收集的进化搜索轨迹**:EFT 的训练数据 Finch Collection 需要在大规模任务上运行进化搜索来生成轨迹,这需要可观的计算资源,尤其是对于复杂任务。若任务分布变化,可能需要重新收集轨迹,限制了方法的即插即用性,且对动态任务环境的适应成本较高。
- **模型规模有限且未验证大模型**:实验仅在 2B 到 9B 参数的模型上进行,未扩展到数十亿参数的模型(如 70B)。更大模型可能已经具备隐式的进化能力,EFT 的增益是否会饱和或消失尚不明确,也未探索 scaling law,缺乏对趋势的预判。
- **跨任务泛化的稳健性存疑**:尽管在留出任务上平均提升 10.22%,但部分任务可能增益较小或无效。论文未深入分析失败案例,也未与那些为每个任务单独优化搜索支架的方法进行全面比较,因此 EFT 在广泛现实任务上的普适性未得到充分验证。