论文

DEI:面向质量多样性搜索的进化推理中的多样性

DEI:面向质量多样性搜索的进化推理中的多样性

本文提出 DEI(Diversity in Evolutionary Inference),一个分布式质量多样性(QD)搜索框架。该方法将异质大语言模型(LLM)作为变异算子(mutation operator)部署在对等节点(peer node)上,节点间通过非阻塞集合通信(non-blocking collective operations)协作。 与复制单一模型归纳偏好的同质并行搜索不同,DEI 将每个 LLM 独特的创意先验视为行为新颖性的互补来源。框架扩展了 Digital Red Queen 范式:每轮结束后节点共享局部最优解,作为下一轮种群的种子,从而产生跨模型的对抗压力,推动鲁棒性超越单模型自博弈(self-play)。 在 Core War 领域(Redcode 战士程序在模拟机器中对抗的编程竞赛基准)上进行评估:一个四节点异质集成(GPT-5.4-mini、Claude Sonnet 4.6、GPT-5.2、Claude Haiku 4.5)在等总 LLM 调用预算下,相比单节点基线实现了: - 合并存档 QD-Score 提升 124%(45.90 vs 20.46) - 覆盖度提升 28%(80.6% vs 63.0% 的单元格) - 并在所有四种模型家族上,在 QD-Score、覆盖度和留出解泛化性方面均优于等预算同质集成。 实验首次实证表明:在基于 LLM 的分布式 QD 搜索中,模型多样性(而非仅仅是并行性)是性能提升的关键驱动因素。

论文精读

TL;DR DEI 框架在分布式 Quality-Diversity 搜索中,将异构大语言模型作为变异算子,利用模型多样性而非单纯并行,首次实证证明多样性是提升搜索性能的关键驱动因素。

问题

质量多样性搜索(Quality-Diversity, QD)作为进化算法的重要分支,正被广泛用于开放式任务(如程序生成、游戏内容设计),目标是同时发现高适应度行为多样的解集。随着大语言模型(LLM)展现出强大的代码生成与变异能力,将LLM作为变异算子嵌入QD流程已成为一个新的增长点。

现有方法的局限主要集中于并行策略:多数工作采用同构并行搜索,即所有工作节点复制同一个LLM进行变异。这种设计虽然易于实现,但深层缺陷明显:单一模型的归纳偏置(inductive biases)会限制变异方向,导致种群陷入相似的局部区域,难以产生行为新颖性。此外,同构节点的自博弈(self-play)无法形成真正的对抗压力,覆盖度与解的质量上限受限于单一模型的创造力边界。简单地增加节点数或LLM调用预算,往往只是重复同样的搜索模式,多样性增益递减

为何这一难题重要?异构LLM的创作先验存在天然差异(如不同模型对汇编代码的理解、探索策略的偏好),有效融合这些互补能力需要解决两个技术挑战:一是如何设计非阻塞通信机制,让各节点异步共享最优解而不降低效率;二是如何构造跨模型对抗压力,使异构变异形成持续驱动,而非简单混合结果。业界正密切关注:AI自动生成复杂程序、竞技性游戏AI设计等场景,都迫切需要突破单模型能力天花板的分布式搜索框架

行业类比:如同多智能体系统中,不同策略的自主Agent(如 AutoGPT 的“专家角色”)协同攻关,每个角色贡献独特视角,最终产生超越任一个体的整体方案。

核心洞察

  • 模型多样性是分布式 QD 搜索的性能杠杆,而非简单的并行度扩展。以往并行 QD 搜索在所有工作者间复制同一 LLM 的归纳偏见,本质上仍是同质化探索;DEI 首次让 GPT-5.4-mini、Claude Sonnet 4.6、GPT-5.2 和 Claude Haiku 4.5 作为异构变异算子并存,每个模型的独特创作先验被当作互补的行为新颖性来源,在等量 LLM 调用预算下,异构集成比单节点基线 QD-Score 提升 124%,覆盖率高 28%,直接证明多样性才是增益核心。
  • 跨模型对抗压力通过冠军共享实现协同进化,效果超越单一模型自博弈。DEI 扩展 Digital Red Queen 框架,每轮结束节点间广播局部最优解以种子下一轮种群,形成跨模型对抗动力学,迫使各模型不断适应来自其他模型的新颖策略,而非仅与自身历史最优竞争。这产生更强的泛化性,在 Core War 保留测试中,异构集成在所有四类模型家族上的保留解通用性均优于同等预算的同构集成,验证了对抗多样性是驱动 LLM 进化推理鲁棒性的关键机制。

方法

DEI 是一个分布式 Quality-Diversity (QD) 搜索框架,将异构大语言模型 (LLM) 作为突变算子分配给不同对等节点,通过非阻塞集体通信实现跨模型协作。

输入与初始设置

  • 任务描述:为 Core War 基准编写 Redcode 汇编程序,使其在模拟机内对抗中获胜。
  • 初始种群:随机生成的程序或空种群。
  • 行为空间:预定义行为描述符 (如执行路径统计),划分为网格单元。
  • 模型池:多个不同的 LLM (如 GPT-5.4-mini、Claude Sonnet 4.6 等),每个节点固定绑定一个。

关键模块

  • 分布式节点:每个节点独立运行 Digital Red Queen (DRQ) 循环,维护一个 MAP-Elites 存档。
  • 变异:从当前存档选择父程序,由节点绑定的 LLM 对其代码进行突变 (增删指令、修改跳转),生成新一代候选。
  • 评估与更新:候选程序在 MARS 模拟器中相互博弈,计算适应度与行为特征;将优胜者插入存档对应网格单元,保留每个单元的精英解。
  • 跨模型分享:每轮结束时,节点通过非阻塞 collective 操作广播本地存档的局部最优解,作为下一轮种子的补充。这种机制将不同 LLM 的创造性先验注入各节点,形成跨模型对抗压力,促使每个节点产生能抵御其他模型策略的鲁棒程序。

输出

最终合并所有节点的存档,得到全局高质量多样性档案,衡量指标包括 QD-Score (各单元最高适应度之和)、覆盖率 (非空单元比例) 和 held-out 泛化性。

与同类方法的差异:传统同质并行 QD 仅复制单一模型的归纳偏置,而 DEI 通过模型多样性而非简单并行扩展,利用异构 LLM 互补的创新策略,驱动搜索覆盖更广的行为空间并提升解的质量。

实验

实验设计

Core War 模拟器上评估 DEI 框架。实验搭建了一个四节点分布式系统,每个节点运行独立的 Digital Red Queen (DRQ) 循环,但分别采用不同的 LLM 作为变异算子:GPT-5.4-miniClaude Sonnet 4.6GPT-5.2Claude Haiku 4.5。每轮结束节点通过非阻塞集体操作共享局部最优解,作为下一轮的种子种群,形成跨模型对抗压力。基线包括:等预算的单节点搜索(任一模型独立运行)和等预算的同构四节点集合(四个节点使用同一模型)。所有条件严格控制总 LLM 调用次数一致。

关键发现

异质集合的合并档案 QD-Score 达到 45.90,比单节点基线(20.46)提升 124%;覆盖率从 63.0% 提升到 80.6%(+28%)。在同等预算下,异质集合在所有模型族上的 QD-Score、覆盖率和留存解泛化性均优于同质集合。这首次给出实验证据:模型多样性,而非仅仅并行度,是分布式 LLM 驱动的 QD 搜索增益的核心驱动力。

对基线的深度解读

单节点搜索受限于单一模型的归纳偏置,容易陷入创意枯竭;同构并行只是复制同一个偏置,并未引入新的行为新颖性来源。DEI 通过异质变异算子将不同 LLM 的互补创造性先验注入演化过程,节点间共享的局部最优又触发 跨模型对抗压力,迫使每个模型不断适应其他模型产生的挑战者,从而探索出更多样、更鲁棒的解分布。这解释了为何异质集合在 QD 指标上全面超越同构集合和单节点。该发现对实际工程有直接启示:在构建基于 LLM 的演化系统时,应优先考虑模型生态的多样性,而非简单堆叠同质计算资源。

行业影响

落地场景

DEI 框架将异构大语言模型 (LLM) 作为变异算子引入分布式 QD 搜索,天然适合需要创造性与多样性的自动生成任务。例如:

  • 代码自动生成与优化:在游戏 AI、自动化安全测试、编译器模糊测试中,利用模型间的交叉模型对抗压力持续产出多样且健壮的解决方案。
  • 创意内容生产:广告文案、游戏关卡设计、产品描述生成等场景,通过行为多样性探索更丰富的风格与策略,避免单一模型带来的创意枯竭。
  • 药物发现与分子设计:将不同 LLM 的生成能力映射到分子图变异,以异构突变扩大候选分子覆盖面。

商业价值

  • 降本:在同预算下,DEI 的异构组合显著提高 QD-Score 与覆盖率(本实验中 +124% QD-Score),意味着无需增加 LLM 调用次数即可获得更优产出,直接降低生成服务的 token 成本。
  • 增收/体验提升:更全面的解空间覆盖与更强的泛化能力(held-out solution generality)可提升生成结果的新颖性与实用性,在内容平台或推荐系统中增加用户参与度和留存率。
  • 差异化竞争:将 DEI 嵌入 LLMOps 管道,可为客户提供模型多样性即服务,形成技术护城河。

与现有产品/工作流的接口

DEI 通过非阻塞集合操作进行节点间通信,并基于 GossipSub 协议 实现异步最优解共享,可无缝接入现有分布式训练或推理集群:

  • Kubernetes + Ray / Dask等编排平台上,DEI 的各个 LLM 节点可部署为独立 Pod,通过轻量网络层(如 Yggdrasil overlay)通信。
  • 与 CI/CD 集成:自动触发新一轮搜索当代码仓库更新,或将 DEI 作为 GitHub Action 持续生成多样化测试用例。
  • 监控方面,可结合 Weights & BiasesMLflow 记录每轮 QD-Score 与覆盖率,形成反馈闭环。

具体落地用例

  1. 电商平台商品描述生成:接入多个 LLM API(如 GPT-5.4-mini 与 Claude Sonnet 4.6),通过 DEI 框架并行变异描述文案,以 QD 指标衡量情感倾向、信息完整度的多样性,最终合并存档输出高多样性与高点击率的描述集,提升转化率。
  2. 自动驾驶感知模型测试用例生成:将不同 LLM 作为传感器数据变异算子,搜索能暴露模型边界行为的极端场景(如模糊、遮挡、光照变化),利用 DEI 的跨模型对抗压力生成比单一模型更丰富的测试集,提高模型鲁棒性。

注意:当前实现基于 Core War 领域,工业落地需适配特定领域的模拟器与行为描述符,但框架本身与领域解耦。

局限

  • - **领域泛化性未验证**:实验仅在 Core War 程序对战环境中进行,这是一个具有特定规则和搜索空间的模拟竞技场景。QD 搜索和模型异构的优势是否能够迁移到其他代码生成、数学推理或机器人控制等典型 QD 应用,仍缺乏实证。该基准的搜索空间特性可能恰好凸显模型多样性,而在更开放或更结构化的任务中收益可能衰减,需要跨领域复现。
  • - **LLM 多样性的同质风险**:虽采用不同厂商的异构 LLM,但当前预训练模型在架构、数据和训练目标上高度趋同,不同模型的创造性先验可能仍共享大量隐式偏差,限制实际多样性。未来若出现更根本性的模型类型(如扩散模型、符号推理器)作为变异算子,或需重新评估结论;且所选择的专有模型存在 API 可用性和版本变更风险,影响可复现性。
  • - **系统开销与成本并未完全纳入比较**:尽管实验控制了总 LLM 调用预算,但分布式节点间通过 Yggdrasil 覆盖网络和 GossipSub 协议共享解,可能引入不可忽略的延迟与带宽消耗,这在实时或大规模搜索中会成为瓶颈。此外,同时维护多个商业 LLM 的访问配额和计费模型,增加了工程复杂度和财务成本,与单一模型的简单并行方案相比,实际部署的门槛更高。
论文John Donaghy2026-05-26原文

相关内容