论文

SCOPE: 通过策略协同进化的自我对弈用于开放式任务

SCOPE: 通过策略协同进化的自我对弈用于开放式任务

现有自我对弈方法可训练语言模型而无需外部监督,但要求任务具有规则可检查的答案,导致开放式任务只能依赖精心设计的提示或前沿模型作为评判者。 本文提出 SCOPE,一个无数据的自我对弈框架,通过 策略协同进化 解决开放式任务。框架包含两个策略:Challenger 生成基于文档的任务,Solver 通过多轮检索回答问题。一个初始模型的冻结副本作为 自评判器,从源文档生成任务特定的评分标准(rubric),并据此对 Solver 的回答进行评分。 在三个7-8B指令微调模型(Qwen2.5、Qwen3、OLMo-3)上,SCOPE 在8个开放式基准上平均提升最多 +10.4 分,匹配或超越使用约9K精心设计提示训练的 GRPOdata。此外,仅在开放式任务上训练的 SCOPE 在7个保留的短问答基准上也提升最多 +13.8 分,在所有三个模型上均超越 GRPOdata。 消融实验表明:协同进化 Challenger 对于保持任务接近 Solver 的能力边界是必要的;性能提升来自检索和合成的改进,且相对贡献因任务而异;评分标准生成质量是自评判的瓶颈。

论文精读

TL;DR SCOPE 通过自博弈协同进化挑战者与求解者,无需外部监督即可在开放域任务上大幅提升性能,甚至超越基于策划数据的 GRPO_data。

问题

自博弈(self-play)训练语言模型能够在完全无外部监督的条件下自我提升,是当前 AI 对齐与自动改进的热点方向,尤其对开放任务(open-ended tasks)的泛化能力提升至关重要。

现有自博弈方法(如 GRPO_dataSPIN)几乎都依赖可规则验证的答案(rule-checkable answers),即要求任务必须存在明确的 ground-truth 或可执行代码验证。这导致:

  • 开放任务依赖昂贵的外部监督:对于长文推理、研究式问答、文档综合等开放任务,只能依靠人工编写高质量提示词,或调用强大的前沿模型(frontier-model judge)充当裁判,成本高、覆盖窄、难以扩展。
  • 任务分布静态:固定的人工提示集合无法随模型能力动态调整,容易使训练陷入“能力停滞”,模型仅学会过拟合训练分布,而非持续进步。

该问题的难度在于:

  1. 评估主观性:开放任务无标准答案,模型输出的质量评判本身就是一个复杂的语言理解问题。
  2. 任务生成需动态匹配模型能力:若要实现无数据的自我进化,生成的任务必须始终处于模型能力的边界(frontier),过易无训练价值,过难则产生噪声。
  3. 训练信号可靠性:缺乏外部真值,必须设计稳健的自评机制,避免奖励作弊(reward hacking)。

业界对此高度关注,因为用大规模人工标注数据驱动训练已触及收益递减的瓶颈,而无数据的自我改进(data-free self-improvement)是实现超级对齐和持续学习的关键路径。

类似场景:就像在自动驾驶中,用合成数据引擎不断生成越来越复杂的驾驶场景,同时用自评判系统确保驾驶行为符合安全规范——模型既是考生,也是出题人,还是阅卷者,三者协同进化才能持续突破性能上限。

核心洞察

  • 通过 Challenger-Solver 协同演化实现无标签开放式任务自我提升:SCOPE 让挑战者生成文档扎根任务、求解器通过多轮检索回答,二者在自博弈中互相推动难度前沿,无需任何外部标注或预定义题库。这种闭环的课程学习式设计区别于 DPO/GRPO 等依赖特定格式奖励或预选提示的范式,使模型在不接触外部数据的情况下持续产生难度适中的训练信号。
  • 以冻结初始模型作为自评判生成评分标准(rubric),解决了开放式任务自动评估的瓶颈:SCOPE 不依赖更强模型打分,而是让初始模型从源文档抽取任务特定的评分维度,用标准进行细粒度打分。实验表明评分标准质量是自评判的核心限制因素,这为后续研究指明了优化方向,即提升标准生成比单纯提升评分能力更能放大自博弈效果。

方法

输入与初始化

SCOPE 从一个预训练的指令微调模型(如 Qwen2.5-7BOLMo-3-8B)和一组文档语料库 D(如 Wikipedia)出发。初始模型复制一份作为自我裁判 J 并永久冻结,之后不再依赖任何外部标签或人工评分。

关键模块:两条共同进化的策略与自我裁判

框架核心由三个角色构成:

  1. 挑战者策略 π_C:从文档 d ∈ D 中自动生成开放式、需要多步推理和检索的任务(例如“从文献中提炼 XX 技术的利弊对比”)。其目标是生产难度恰好处于当前 Solver 能力边界的问题。
  2. 求解者策略 π_S:针对挑战者提出的任务,通过多轮检索逐步收集信息,并最终合成答案。每轮可发出搜索查询,接收检索到的文档片段,直至生成最终响应。
  3. 自我裁判 J:基于源文档为每个任务动态生成本地化评分标准(rubric)——涵盖事实准确性、覆盖度、推理深度等维度,然后对求解者的回答进行分项评分并汇总为一个标量奖励,完全替代外部裁判。

训练流程:交替自我对弈

SCOPE 每一轮迭代包含两个阶段:

  • 阶段1:训练挑战者。固定 π_S,用当前求解者的平均得分衡量任务难度(得分低=难)。挑战者通过 GRPO 优化难度奖励(偏好在 “适度可回答” 范围内的任务)和格式奖励,从而学会生成能推动求解者进步的高质量任务。
  • 阶段2:训练求解者。固定 π_C,采样一批新任务,π_S 通过多轮检索与回答获得由 J 给出的 rubric 评分作为奖励;同时辅以搜索行为奖励(鼓励有效检索)和格式奖励(保证输出结构)。Solver 同样用 GRPO 更新。上述两阶段循环执行,策略共同进化。

输出与应用

训练结束后只保留 π_S。该模型在 8 个开放域基准上最多提升 +10.4 分,并能迁移到 7 个短问答基准(+13.8 分),无需任何外部监督。

与同类方法的差异

区别于 GRPO_data 等依赖人工策划 prompt 或外部裁判的 self-play 方法,SCOPE 通过挑战者-求解者-自我裁判三角架构,首次在开放式任务上实现完全数据自由的共同进化,且挑战者的动态任务生成是保持能力持续提升的关键(消融实验证实移除挑战者会导致退化)。

实验

实验设计

SCOPE 在三个 7-8B 指令微调模型(Qwen2.5, Qwen3, OLMo-3)上进行无数据自博弈训练。框架包含两个协同进化的策略:Challenger 生成基于文档的开放域任务,Solver 通过多轮检索回答。一个冻结的初始模型作为 自评判者,从源文档提取评分标准(rubrics)并对回答打分。训练分两阶段:先训练 Challenger,再训练 Solver。评估覆盖 8 个开放域基准与 7 个 held-out 短问答基准,基线为使用 ~9K 策划提示训练的 GRPO_data

关键发现

  • 开放域性能最高提升 +10.4 分,在三个模型上均达到或超过 GRPO_data。
  • 仅训练于开放域任务,却在短问答基准上实现最高 +13.8 分 的提升,全面超越 GRPO_data
  • 消融实验确认:Challenger 的共同进化确保任务处于 Solver 能力前沿;提升来源于检索与综合能力的双重改进;rubric 生成质量 是自评判效果的瓶颈。

与基线对比的深度解读

SCOPE 证明了通过策略协同进化,可以在无外部监督的情况下匹配甚至超越基于人工策划数据的 GRPO_data。这突破了传统自博弈对规则可验证答案的依赖,将应用范围扩展到开放域。更值得注意的是其泛化能力:从开放域到短问答的正向迁移表明,该方法习得的不是任务特化技能,而是更底层的检索与推理能力。这一发现为大规模、低成本、可持续的模型自我提升提供了工程化路径,提示未来可探索更复杂的共同进化机制以进一步延缓能力饱和。

行业影响

落地场景

SCOPE 的数据自由(data-free)self-play 框架为开放域任务提供了无需外部监督的训练路径,对以下场景特别适用:

  • 企业知识管理:基于内部文档库的智能问答,无需人工标注问题集,模型通过自举式对弈持续提升。
  • 对话式 AI 产品:技术支持、法律咨询等需要多轮检索和复杂综合的开放式查询,SCOPE 可直接从源文档生成训练信号。
  • 内容平台:自动摘要、观点生成等任务,可利用源材料自我生成高难度 prompt,替代昂贵的人工或前端模型评判。

商业价值

  • 降本:消除对人工标注、整理提示(curated prompts)或 frontier-model judge 的依赖,大幅降低垂直领域持续训练的成本。在医疗、金融等专家资源昂贵的行业尤为显著。
  • 增强闭环:模型部署后可通过 持续自我对弈 不断进化,适应新文档和用户需求,提升 长期运维效率,减少模型性能衰退。
  • 体验提升:SCOPE 同时优化检索和合成能力,产生的回答更精准、有据可依,降低幻觉,增强用户信任,从而改善产品留存和满意度。

与现有产品/工作流的接口

SCOPE 可无缝嵌入 标准 LLM 训练流水线,作为监督微调(SFT)后的强化学习微调阶段。它只需要一个基础模型和一系列源文档,无需额外数据,易于与现有 RAG 系统集成:

  • 在检索阶段,Solver 策略可生成子查询;在合成阶段,同一策略生成最终答案。SCOPE 的奖励机制同时优化检索和生成,无需修改系统架构。
  • 训练循环(Challenger 生成任务 → Solver 作答 → Self-Judge 评分)易于编排在 MLOps 平台(如 Ray, Kubeflow)上,通过 rollout workers 收集轨迹,与现有 RLHF/GRPO 流程类似。
  • 冻结的初始模型作为自判官生成要点(rubric),可与现有的安全、合规审核层结合,确保生成内容符合业务规则。

具体落地用例

  • 电商智能客服:给定产品手册、政策文档,SCOPE 训练一个能处理复杂退换货咨询、产品对比等开放式问题的 Solver,无需人工编写数千条对话。Challenger 自动生成接地文档的高难度任务,确保模型始终挑战能力前沿,降低运维人力投入。
  • 医疗文献问答:基于最新论文库,系统自对弈生成“根据文献 X、Y、Z,总结治疗进展”等任务,并自我评分。大幅降低领域专家审核成本,加速专业助手迭代,同时 Rubric 生成质量可作为评估可靠性的指标。

局限

  • **自评判瓶颈**:论文明确承认评分标准生成质量是自评判的瓶颈。冻结的初始模型作为 self-judge 能力有限,当源文档复杂或任务需要深层语义理解时,生成的评分标准可能不精确,导致奖励信号噪声,限制 Solver 的优化上限。此设计虽然无需外部监督,但评判的准确性与基础模型强绑定,在低能力模型上可能效果骤降,而引入更强外部评判则破坏 data-free 特性。
  • **计算开销与可扩展性**:多轮检索与生成式自玩循环在每次迭代中需大量前向推理,且共同进化两个策略增加了超参数敏感性和训练不稳定风险。论文仅在 7–8B 指令微调模型上验证,未探索更大规模或不同架构的模型,且依赖文档检索管道,对非文本或长尾领域扩展受限。能否稳定训练更大模型仍待检验。
  • **任务泛化与偏好对齐**:尽管在 held-out 短式 QA 上表现提升,但训练仅基于开放任务,可能对需要精确事实匹配的封闭式 QA 或事实核查任务增益有限。Challenger 生成的难度依赖内部奖励设计,可能偏向 Solver 已掌握的技能,导致技能覆盖不足,且未考虑人类偏好对齐,生成的回答可能风格单一或偏离预期。
论文Wai-Chung Kwan2026-05-29原文

相关内容