论文

Dream-RSI: 通过演化世界实现递归自我改进

Dream-RSI: 通过演化世界实现递归自我改进

递归自我改进 对自主 AI agent 愈发关键,其进展取决于能否在复杂领域中发掘高价值解法,而这一过程的驱动力是高效探索。然而,如何管理与改进探索策略仍是主要瓶颈:现有系统面临两难——固定策略无法随搜索空间扩展而适应,在线策略优化则要在长程 rollout 中、面对延迟且昂贵的反馈去遍历庞大的元搜索空间。 Dream-RSI 是一个可扩展且能递归自我改进的探索框架。它通过轻量级编排层把探索显式化、可编程化,底层 coding agent 保持不变。其核心洞见是:积累的发现历史可作为已实现搜索空间上的回放模拟器。 通过在由历史 discovery tree 构建的回放模拟器中进行 dreaming,Dream-RSI 能以即时、低成本的 off-policy 反馈来评估并精炼探索策略,无需反复触发昂贵的在线评估。改进后的策略随后重新部署到线上驱动进一步发现,持续扩展模拟器池,形成自我改进闭环。 在算法工程、数学优化与 GPU kernel 工程任务上,Dream-RSI 在多种设置下取得相当甚至更优的发现质量,同时大幅降低发现成本。

论文精读

TL;DR Dream-RSI 用历史发现树构建回放模拟器,离线试炼探索策略后再上线,让 AI 自我改进更省算力、适应越来越大搜索空间。

问题

问题背景

自主 AI agent 的长期进阶依赖递归自我改进,核心瓶颈在于探索策略能否在大规模搜索空间中持续发现高价值解。

现有方法局限

当前主流方案面临两难:

  • 固定启发式策略(如随机采样、进化算子或人工 prompt 模板)在搜索空间扩大时无法自适应调整,探索效率迅速衰减。
  • 在线策略优化虽然能学习探索行为,但需要在巨大的 meta 搜索空间中进行长 horizon rollout,反馈延迟且评估开销极高;每次策略更新都要真实执行大量 agent 任务,在算法工程、数学优化、GPU kernel 设计等复杂领域中难以承受。

此外,现有系统往往把探索逻辑硬编码在 agent 内部,无法显式观察、重用或改进探索决策;历史发现记录也仅作日志,未转化为可学习的经验。

为什么这个问题难 / 重要

难点在于探索策略的反馈信号天然在线且稀疏:只有实际运行 agent 到任务结束才产生价值信号,而长 horizon 任务单次在线运行成本高、周期长,导致策略迭代极慢。

业界关注度持续上升:从 OpenAI 的 AI Scientist、Sakana 的 AI-Scientist 到 DeepMind 的 FunSearch 等,都试图提升 agent 自主发现能力。但多数系统依赖一次性探索采集,未形成可积累、可改进的策略闭环。

行业类比

类似 AlphaGo 通过自对弈 replay buffer 离线训练价值网络,Dream-RSI 用历史发现树构造 replay simulator,让探索策略在低成本梦境中自我完善,再返回真实环境继续进化。

核心洞察

  • Dream-RSI 将探索策略优化从昂贵的在线评估中解耦,通过把历史发现树构建为 replay simulator,为策略改进提供即时低成本的 off-policy 反馈。与现有在线元搜索方法(需在长 horizon rollout 中承受延迟和昂贵反馈)以及固定启发式(无法随搜索空间扩展而适应)相比,该方法避免了重复在线评估的瓶颈,同时在历史真实搜索空间上保留了策略改进所需的信号密度,使递归自我改进在规模化场景下变得可行。
  • Dream-RSI 的核心创新在于把发现历史本身视为一个持续扩展的模拟器,形成“策略发现→模拟器扩展→策略改进”的自增强循环。这不同于简单的经验重放或 memory 机制:它不只重放历史状态或轨迹,而是利用发现树的结构信息来构建一个可编程的、针对已实现搜索空间的模拟环境。这种设计让探索策略的改进始终锚定在真实发现分布上,同时又能通过低成本的 dreaming 不断迭代策略,从而在多个复杂工程任务中降低发现成本、保持竞争力。

方法

输入与核心设定

  • 输入:累积的历史发现记录,以发现树(discovery trees)形式保存,包含探索轨迹、决策序列与最终结果。
  • 底层编码代理(coding agent)保持不动,通过一个轻量级编排层(orchestration layer)将探索策略显式化、可编程化,避免直接修改模型权重或推理逻辑,工程上易于接入现有 pipeline。

关键模块一:重放模拟器

从历史发现树中构造一个重放模拟器(replay simulator),它近似刻画已实现的搜索空间,相当于一个廉价的“世界模型”。在该模拟器上执行 dreaming 操作,即离线重放过去的探索路径,从而获得即时、低成本的离策略反馈(off-policy feedback)。相比在线 rollout,这里无需再跑昂贵的真实环境评估,反馈延迟从长周期降为近实时。

关键模块二:策略改进与选择

利用重放模拟器中获得的反馈来评估候选探索策略,比较不同策略在历史搜索空间上的表现,选出更有潜力的策略。整个过程是纯离线的,不触及真实环境,避免了在线策略优化中遍历巨大元搜索空间的困境。策略改进可以循环多次,每次都是低成本的试错。

输出与递归循环

  • 输出:改进后的探索策略被重新部署到在线环境,驱动新一轮发现。
  • 新发现的轨迹又回填到发现树,扩充重放模拟器的覆盖范围,从而开启下一轮自我改进。

这一“在线发现 → 历史回放 → 离线改进 → 在线再发现”的闭环构成了递归自我改进(recursive self-improvement)。

与同类方法的差异

与固定探索策略相比,Dream-RSI 能随搜索空间扩展而自适应;与在线策略优化相比,它用历史重放模拟替代重复的昂贵在线评估,在算法工程、数学优化、GPU 内核工程等任务上保持了竞争力并显著降低发现成本。

实验

实验设计

论文在三个领域评估 Dream-RSI:算法工程、数学优化、GPU Kernel 工程。基线包括固定探索策略与在线策略优化方法。指标关注 发现质量 与 发现成本,通过历史发现树构建 replay simulator 进行离线 dreaming 评估,再与在线 rollout 结果对比。

关键发现

Dream-RSI 在若干设置下达到 有竞争力或更优的发现质量,同时 显著降低发现成本。其核心在于利用累积的发现历史作为 replay simulator,为探索策略提供即时、低成本的离策略反馈,避免了重复的昂贵在线评估。递归自我改进循环不断扩充 simulator pool,使策略能持续适应日益复杂的搜索空间。

基线对比解读

与固定策略相比,Dream-RSI 的探索策略可编程且可进化,能够应对规模增长的搜索空间;与在线策略优化相比,Dream-RSI 通过离线 dreaming 绕开了长程 rollout 下的 延迟与昂贵反馈 问题。其 lightweight orchestration layer 保持底层 coding agent 不变,降低了集成成本。但论文也指出改进幅度在部分设置中为 competitive 而非全面超越,提示 replay simulator 的覆盖度与历史归纳偏置可能影响效果。

行业影响

落地场景

Dream-RSI 适用于需要长期自主探索的 AI Agent 产品,如 AI 编程助手、AutoML 平台、GPU 内核优化工具。具体 use case:某云服务商的 AutoML 服务记录历史实验发现树,构建 replay simulator 离线评估探索策略,减少真实训练次数;某企业级 AI 编程平台使用历史代码搜索路径优化 agent 策略,提升代码补全质量与多样性。

商业价值

核心降本:将昂贵的在线策略评估迁移到离线 replay,大幅减少长程 rollout 次数。例如 AutoML 中一次真实训练可能耗费数百 GPU 小时,使用 Dream-RSI 可将策略评估成本降低一个量级。同时更优探索策略加速发现高质量解决方案,提升产品性能与用户满意度,增强商业竞争力。

跟现有产品/工作流的接口

Dream-RSI 是轻量级 orchestration layer,不改动底层 coding agent。通过统一接口积累历史发现树,定期在 replay simulator 上离线评估策略,再将改进策略部署回在线 agent。可与 LangChain/LangGraph、AutoGen 等框架集成,增加策略读取与历史记录两个 API 即可无痕接入现有工作流。

局限

  • 论文承认的局限:Dream-RSI 的 replay simulator 由历史发现树构建,因此其质量受限于已有探索的覆盖范围。在冷启动阶段,历史数据稀疏,离线策略评估容易产生高方差甚至误导性反馈,策略改进效果有限。此外,作者指出重放目标可能过度偏向历史分布,导致改进后的策略倾向于在已探索区域内微调,对未知区域的探索激励不足,这在长时程发现任务中可能限制搜索空间的扩展。
  • 可推断的局限:离线评估虽大幅降低计算成本,但引入分布偏移风险——策略在历史重放环境中表现良好不等同于真实在线环境同样有效。历史数据无法完全反映环境动态变化或新出现的挑战,如果策略过拟合历史搜索模式,在线部署后可能出现性能回退。实验仅在算法工程、数学优化、GPU kernel 工程三个领域进行,且任务规模有限,框架在其他复杂领域或开放世界任务中的泛化能力仍需验证。
  • 与同类工作对比:相较基于在线强化学习的自我改进系统(如 Voyager 等),Dream-RSI 采用离线重放反馈,牺牲了对实时环境反馈的直接利用,可能错过需要在线探索才能发现的策略改进信号。同时,该方法依赖静态历史数据,无法主动设计信息量大的实验来填补探索盲区;而一些在线方法可通过 uncertainty-aware exploration 动态调整策略。这种离线优先的设计在样本效率上占优,但在适应性上存在固有短板。
论文Tong Zheng2026-09-14原文

相关内容