Co-RL: 多智能体强化学习中多样化群体涌现的无监督推理
强化学习(RL)已成为提升语言和视觉语言模型推理能力的强大方法,但其最显著的成功仍高度依赖真实标注监督(如可验证奖励)。这类标注成本高昂,且当推理能力超越人类可靠评估范围时愈发稀缺。自我奖励强化学习通过让模型从自身生成结果中获取奖励信号,减少了对标注的依赖。然而,仅基于自我生成反馈的训练可能强化已有偏见和次优行为,降低响应多样性,最终导致同质化响应和训练崩溃。 在本研究中,我们展示了无监督推理可通过合作式多智能体训练自然涌现。我们提出 Co-RL 框架,其中多个参数不共享的解耦模型通过强化学习联合优化,奖励来源于同伴模型。我们进一步证明,通过异构模型家族、不同规模及改写训练样本提升群体多样性,可减少驱动自我强化反馈循环的相关错误。这种多样性持续提升推理性能、维持行为多样性并缓解训练崩溃。 在纯文本和多模态域中,Co-RL 均持续优于基础模型和先前无标签方法,同时媲美或超越监督方法,且无需任何真实标签。具体而言,Co-RL 在 LLM 的七个文本基准上平均提升 3.0-8.6%,在 VLM 的四个多模态基准上提升 2.3-7.2%。代码已开源:https://github.com/DrStranded/Co-RL。
论文精读
TL;DR Co-RL 通过多模型互评的协作强化学习,利用群体多样性抑制自奖励 RL 的偏差与崩溃,在无标签条件下显著提升推理性能,甚至匹敌监督方法。
问题
问题背景:当前 RL 在提升 LLM 与 VLM 推理能力上效果显著,但主流方法依赖可验证 reward 或人工标注,数据成本随推理复杂度升高急剧增加。
现有方法局限:self-rewarding RL 试图用模型自身生成反馈代替外部监督,却容易形成自我强化的反馈回路:模型会放大既有偏差,降低响应多样性,最终导致同质化输出甚至训练崩溃。同时,可验证 reward 仅覆盖数学、代码等规则清晰的问题,对开放域推理、多模态推理等难以自动判定正确性的场景无能为力,而人类评估在高难度推理任务上可靠性不足、成本高昂。
为什么难/重要:核心挑战在于无标注条件下如何获得稳定且多样的训练信号。单一模型的自评信号存在系统性偏差,多个异构模型互相评估可减少相关错误,但协调训练动态、避免群体同质化仍然困难。业界关注此事,因为无监督 scaling 是降低数据成本、支撑模型持续自我提升的关键路径,直接影响推理模型能否从“依赖标注”转向“自主进化”。
行业类比:类似多模型 LLM-as-a-judge 自动评估系统中,用多个独立模型互相评分以降低单一偏见,Co-RL 通过“同侪互评”提供无标签的学习信号。
核心洞察
- Co-RL 用同伴模型的交叉奖励替代自奖励,打破自我强化的偏差循环,从而避免训练崩溃。与现有 self-rewarding RL 仅依赖单模型自我评价不同,Co-RL 利用多个无参数共享的模型互相提供学习信号,这种交叉监督天然降低了相关误差(correlated errors),使训练动态更稳定,并扩大了正确收敛的吸引域(basin of convergence)。这是对多智能体 RL 用于推理任务在理论层面的重要补充,之前方法多关注协作策略,未系统分析交叉奖励对偏差解耦的作用。
- 刻意构造异质 cohort(不同模型家族、规模、改写样本)能够显著减少反馈回路中的相关错误,是无监督推理性能提升的关键。实验表明,增加 cohort 多样性不仅带来文本与多模态基准上 3.0-8.6% 和 2.3-7.2% 的平均增益,还维持了行为多样性,缓解了自奖励 RL 常见的响应同质化问题。相比其他 label-free 方法,Co-RL 的优势在于同时兼顾性能与训练稳定性,且无需真实标签即可匹配或超越监督方法。
方法
输入与 Cohort 构建
- 输入为无标签的推理问题(文本或多模态),无需任何 ground-truth 奖励。
- 构建一个 Cohort(多个异构模型,如不同模型家族、不同参数规模),所有模型参数解耦,互不共享权重。
- 对训练样本进行 改写(rephrase)以增强数据多样性,进一步降低模型间相关误差。
交叉奖励生成
- 每个模型独立生成推理链与答案。
- 将每个模型的输出交由 peer models 评估,通过多模型一致性、互相比较等方式构造奖励信号,取代传统 self-rewarding 中的自反馈。
- 该机制称为 cross-agent supervision,理论分析表明其能扩大正确收敛的 basin,避免自反馈导致的偏差放大。
强化学习优化
- 使用上述 peer-derived reward 对每个模型独立执行 RL 更新(如策略梯度类方法)。
- 各模型在优化过程中保持行为多样性,抑制 homogenized responses 与训练崩溃。
输出
- 训练后的模型在文本与视觉语言基准上推理性能显著提升,且全程不依赖人工标注或可验证奖励。
与同类方法的差异点:相比单模型 self-rewarding RL,Co-RL 通过多智能体 peer 反馈与异构 cohort 多样性,打破相关误差循环,实现真正的无监督推理能力涌现。
实验
实验采用 Co-RL 框架,多个无参数共享的模型通过 RL 同时优化,奖励来自同伴模型的输出。为增加多样性,引入异构模型家族、不同参数规模和重述训练样本,以减少相关误差驱动的自反馈循环。评估覆盖纯文本和多模态两类基准,与基线和先前的无标签方法对比。
关键发现:Co-RL 在 7 个纯文本基准上平均提升 3.0-8.6%,在 4 个多模态基准上平均提升 2.3-7.2%,且无需任何 ground-truth labels。同时,增加群体多样性可维持行为多样性并缓解训练崩溃。理论分析表明交叉智能体监督扩大了正确收敛的吸引域。
与自奖励 RL 相比,Co-RL 通过同伴反馈打破自我强化的偏置,避免响应同质化。尽管没有标签监督,性能仍能匹配或超过有监督方法,这为无监督推理训练提供了可行路径。工程启示:多模型协作的群体训练可以降低对人工标注的依赖,同时提升鲁棒性。
行业影响
落地场景
Co-RL 适合缺少高质量标注的任务,例如电商客服对话和金融文档合规审查。电商场景中,多模型互相评价商品问答和推荐理由,无需人工核对每条回答的正确性,即可提升推理质量和一致性;金融场景中,对财报摘要、风险提示等长文本进行推理校验,可自动发现逻辑漏洞,降低人工审计成本。
商业价值
核心降本点在于消除对人工标注奖励的依赖,同时减少由于单一模型自我强化导致的性能退化。在不牺牲精度的前提下,企业可更快迭代模型,覆盖更多垂直领域。对客户体验而言,更稳定的推理输出意味着更少的错误答案和更可信的 AI 助手,直接带来用户留存与转化提升。
与现有产品/工作流的接口
Co-RL 可以嵌入现有的 RLHF 流水线:将奖励模型替换为 peer-derived reward,或在标注数据不足时作为预训练阶段。它与分布式训练框架兼容,支持多个异构模型并行优化。部署时可将训练出的模型输出通过投票或集成方式融合,不影响线上推理延迟。具体可参考 项目主页 与 代码库。
局限
- **Co-RL** 需要同时训练多个模型,计算开销显著高于单模型 self-rewarding RL。尽管论文在实验中控制了训练和推理预算,但多智能体协作本质上增加了 GPU 内存和训练时间成本,对资源受限的研究团队可能不实际。此外,异构模型族的构建需要额外挑选和适配不同架构,增加工程复杂度。
- 多样性带来的收益依赖于 cohort 内模型之间的足够差异(异构家族、不同规模、改述样本)。如果参与者模型能力差距过大,较弱模型可能拖累整体性能;如果模型过于相似,则相关性错误未充分解耦,多样性优势减弱。论文未系统探索 cohort 规模、能力差异阈值和多样性度量对性能的敏感度。
- 虽然 Co-RL 在多个基准上匹配或超越监督方法,但增益幅度有限(文本 3.0-8.6%,多模态 2.3-7.2%),且尚未在更大规模模型(>12B)或更复杂推理任务(如数学竞赛级)上验证。与验证器驱动的 RL 相比,无监督奖励可能仍存在噪声,长链推理中的信用分配问题未完全解决。代码刚开源,社区验证和实际部署效果有待观察。