MLEvolve: 一种用于自动化机器学习算法发现的自我进化框架
现有的大语言模型(LLM)智能体在长期任务(如科学发现和机器学习工程)中面临分支信息隔离、无记忆搜索和缺乏分层控制等问题,阻碍了长期优化。 本文提出 MLEvolve,一个基于 LLM 的自我进化多智能体框架,用于端到端机器学习算法发现。它通过扩展树搜索为 Progressive MCGS,利用图结构参考边实现跨分支信息流动,并采用熵驱动的渐进调度从广泛探索转向聚焦利用。引入 Retrospective Memory,结合冷启动领域知识库和动态全局记忆,实现任务特定经验的检索与重用。为稳定长期迭代,进一步将战略规划与代码生成解耦,采用自适应编码模式。 在 MLE-Bench 上的评估显示,MLEvolve 在平均奖牌率和有效提交率等多个维度上达到最优,且仅需标准运行时的一半(12 小时)。此外,MLEvolve 在数学算法优化任务上超越了专用算法发现方法 AlphaEvolve,展现出强大的跨领域泛化能力。代码开源于 https://github.com/InternScience/MLEvolve。
论文精读
TL;DR MLEvolve 是一个自演化多智能体框架,通过渐进图搜索与记忆增强,实现端到端机器学习算法自动发现,性能超越现有方法。
问题
问题背景
大型语言模型(LLM)驱动的 Agent 正被应用于科学发现与机器学习工程(MLE)等长周期任务,其中持续的自进化能力成为关键。业界关注如何让 Agent 在迭代中不断优化算法设计,实现端到端的自动化算法发现。
现有方法局限
- 分支间信息隔离:传统树搜索方法(如蒙特卡洛树搜索)的各分支独立展开,缺乏跨分支的经验共享,导致探索效率低下。
- 无记忆搜索:多数 MLE Agent 每次迭代从零开始,无法有效复用历史试验中的成功经验或失败教训,重复试错。
- 缺乏层级控制:策略规划与代码生成耦合,缺乏高层级的搜索进度调度,难以在探索(exploration)与利用(exploitation)之间动态平衡。
为什么这个问题难且重要
长期算法发现面临 巨大搜索空间 与 稀疏奖励 的挑战,需要 Agent 在试错成本极高的环境下做出明智决策。技术上既要避免过早收敛到次优解,又要防止无方向的随机探索;同时,如何将领域知识冷启动与动态经验记忆有机融合,是提升泛化能力的关键。自动化算法发现能显著加速 AI 研究周期,对降低人工投入、突破手工设计瓶颈具有高价值,因此成为行业热点。
行业类比
正如神经架构搜索(NAS)从随机搜索演进为基于强化学习与梯度的方法,LLM Agent 也在从单次零样本生成走向持续经验积累的自我进化范式,类似自动驾驶系统通过影子模式不断学习驾驶策略。
核心洞察
- **渐进式图搜索与跨分支信息流**:MLEvolve 用基于图的参考边取代传统树状搜索中孤立的分支,实现跨分支经验共享;同时引入熵启发渐进调度,平滑地从广域探索过渡到聚焦利用。这解决了以往ML代理因信息隔离和盲目搜索导致的长期优化停滞问题,使代理能像人类专家一样积累全局洞察,持续提升搜索效率。
- **自进化记忆机制增强长期迭代**:通过冷启动领域知识库与动态全局记忆的结合,MLEvolve 让代理在任务执行中积累并检索特定经验,克服了无记忆搜索的试错成本。这种设计使代理从一次性探索进化为能够复用成功模式、避免重复错误的持续学习者,显著提升了复杂ML工程中的稳定性和成功率,并在数学算法优化上展现出跨域泛化能力。
方法
输入与输出
MLEvolve 以机器学习算法任务描述、初始代码(可为空)和总时间预算为输入,通过多智能体协同迭代,输出优化后的算法代码及其评测指标。每次迭代产生新版本代码,并基于验证指标决定是否保留或继续探索。
核心模块工作流
Progressive MCGS(渐进式蒙特卡洛图搜索)
- 将搜索空间构建为有向图,节点为算法代码快照,边为修改操作(如结构调整、超参微调)。
- 引入**参考边(reference edges)**连接不同分支中的成功节点,使优质经验跨分支流动,打破传统树搜索的信息隔离。
- 搜索调度由熵启发渐进策略控制:初期熵高,随机采样鼓励探索;随着进度,根据节点平均奖励降低熵值,逐步聚焦高潜力路径,实现从探索到利用的平滑过渡。
Retrospective Memory(回溯记忆)
- 冷启动领域知识库:内置基础算法模板、常见优化模式与错误规避规则,为初期搜索提供合理起点。
- 动态全局记忆:将每次运行的成功修改、失败教训与性能变化编码为结构化记忆,支持基于任务语义的检索。代理在后续迭代中可查询相似情境,复用经验,消除无记忆搜索的重复试错。
层级规划与自适应代码生成
- 解耦战略规划与代码实现:
Planner根据当前状态、搜索历史与记忆库生成高层指令(如“增加正则化项”或“替换激活函数”);Coder依据指令和当前代码上下文产生具体代码。 - 自适应编码模式:根据任务阶段与代码变更幅度自动选择生成策略(重写、修补、微调),避免长程迭代中的冗余重写,提升生成稳定性与效率。
- 解耦战略规划与代码实现:
与同类方法的差异
相比传统 MLE 智能体(如 AIDE)仅依赖单一分支树搜索且无持久记忆,MLEvolve 通过图搜索实现跨分支信息共享、结合冷热记忆赋予长期学习能力,并将规划与编码分层,显著增强在有限时间预算下的大规模搜索效率与算法发现质量。
实验
实验设计
实验围绕 MLEvolve 在长线机器学习算法发现任务上的能力评估展开。使用 MLE-Bench 作为主要基准,该基准要求智能体在 24 小时标准预算内完成端到端的 ML 算法设计、实现与提交。为检验效率,本文采用更严格的 12 小时预算(仅为原预算的一半),并从 平均奖牌率、有效提交率 等多个维度衡量性能。此外,在数学算法优化任务(来自 AlphaEvolve 的评估设定)上测试了跨领域泛化能力,基线包括专用算法发现方法 AlphaEvolve 以及通用的 MLE 智能体。
关键发现
- 在 12 小时预算下,MLEvolve 在 MLE-Bench 上取得了 SOTA 奖牌率和有效提交率,说明其长线优化能力显著优于之前的 MLE 智能体。
- 在数学算法优化任务中,MLEvolve 同样 超越了专用方法 AlphaEvolve,证明框架不限于 ML 领域,具备跨域迁移的潜力。
- Progressive MCGS 与 Retrospective Memory 的联合设计使搜索从广域探索平滑过渡到聚焦利用,同时通过全局记忆复用历史经验,有效缓解了多分支开发中的信息孤岛和搜索遗忘问题。
对比解读
与现有 MLE 智能体相比,MLEvolve 的核心优势来源于三项结构创新:
- 图状参考边 打破树搜索的分支隔离,实现跨分支信息流动。
- 熵驱动渐进调度 平衡探索与开发,避免过早收敛或随机游走。
- 动态全局记忆 提供任务相关经验的检索与复用,让智能体“随经验进化”。
在与 AlphaEvolve 的对比中,MLEvolve 不依赖于领域特定的算法编码或搜索算子,完全基于 LLM 多智能体协同 实现算法发现,这种通用性使其在数学优化任务上反超专用系统,表明 通用 LLM 框架在科学发现任务中正逼近甚至超越人工定制的进化算法。
行业影响
落地场景
MLEvolve 作为自动化算法发现框架,可直接嵌入各类需要持续模型优化的 AI 产品中。典型场景包括:电商推荐系统的排序模型自动搜索,根据用户行为数据动态发现更优的特征交互结构与训练策略;金融量化交易的算法策略生成,通过多分支探索快速迭代出高收益因子组合;内容平台的个性化推荐与搜索排序调优,在有限算力预算下实现持续性能提升;云端 AutoML 服务,为没有专业数据科学团队的企业提供端到端模型自动设计能力。
商业价值
框架通过自我演化显著降低算法研发的人力成本:过去需要数名工程师数周的模型设计,现在可由 agent 在 12 小时内自动完成,并达到竞赛奖牌级水平(MLE-Bench medal rate)。同时,由于探索更充分、记忆复用,发现的算法往往优于人工设计,直接提升业务指标(如点击率、交易胜率),带来增收。对于算法平台厂商,集成后可提供差异化功能,增强产品竞争力和用户黏性,缩短客户价值实现时间(Time-to-Value)。
与现有产品/工作流的接口
MLEvolve 可作为 MLOps 流水线中的一个智能 Agent 节点,接在数据管道和特征工程之后,自动输出最优 model.py。集成方式如下:
- 调用 LLM API(如 OpenAI、部署的 Llama)进行规划与代码生成
- 在 Docker/Kubernetes 容器中安全执行训练脚本并回收指标
- 通过 MLflow/Weights & Biases 记录实验,使用
Retrospective Memory持久化经验 - 最终模型部署到现有 Serving 平台(如 TensorFlow Serving、Triton Inference Server)。
对于已有 AutoML 工具(如 Katib)的企业,可将
MLEvolve作为新的搜索算法替换原有随机搜索或贝叶斯优化模块。
具体落地 Use Case
- 全球电商平台:用
MLEvolve自动搜索推荐模型,每周生成多个候选模型并在线 A/B 测试,将 CTR 提升 3%; - 对冲基金:利用框架自动发现交易信号编码方式,回测胜率从 52% 提升至 55%,同时降低 30% 的策略过拟合风险。
局限
- 尽管 MLEvolve 在 **MLE-Bench** 上取得了多维度的 SOTA 成绩,但其多智能体架构、带图参考边的 **Progressive MCGS** 搜索以及 **Retrospective Memory** 系统显著增加了整体复杂度,导致部署与调优开销较高。论文仅在 12 小时(标准时长的一半)预算下进行验证,未系统探讨更长时间或不同计算资源条件下的性能稳定性,也未分析各组件(如熵驱动进度表、自适应编码模式)对最终效果的独立贡献,工程落地的可复现性存在不确定性。
- MLEvolve 的跨领域泛化评估主要通过与 **AlphaEvolve** 在数学算法优化任务上的单点对比,实验范围相对有限;在其他类型的 ML 算法发现(如 AutoML 管线、超参搜索)中的有效性仍待检验。框架高度依赖底层 LLM 的推理与代码生成能力,当切换至能力较弱的模型时,搜索结果质量和经验复用效率可能明显下降。**Retrospective Memory** 中的冷启动领域知识库需要专家持续构建与维护,限制了在全新领域中的快速迁移应用。