论文

Qwen-Image-2.0-RL 技术报告

Qwen-Image-2.0-RL 技术报告

我们提出 Qwen-Image-2.0-RL,一种后训练流程,通过 强化学习从人类反馈 (RLHF) 和 on-policy 蒸馏 (OPD) 提升 Qwen-Image-2.0 扩散模型的视觉质量与指令跟随能力。为提供可靠奖励信号,我们构建了任务特定的复合奖励模型:对视觉-语言模型进行微调,采用 pointwise 评分范式 和 思维链推理。对于文本到图像生成,奖励模型覆盖 对齐性、美学 和 人像保真度 维度;对于图像编辑任务,奖励系统关注 指令跟随准确性 和 人脸身份保持。 基于该奖励系统,我们开发了可扩展的 GRPO 强化学习训练框架,集成以下创新: - 混合无分类器引导 (CFG) 策略以保留预训练知识 - 通过 组内奖励范围过滤 进行提示筛选 - 按类别奖励权重校准 为合并文本到图像与编辑任务特化的 RL 策略,我们提出 on-policy 蒸馏 作为最终训练阶段,通过 轨迹级速度匹配 将多个教师模型整合为单一学生模型。 大量评估表明,Qwen-Image-2.0-RL 在 Qwen-Image-Bench 上取得 57.84 总体得分(超过基线 +2.61),在文本到图像竞技场 Elo 评分 1193(+78),图像编辑竞技场 1349(+93),在美学质量、提示遵循和编辑准确性上均获得一致提升。

论文精读

TL;DR **Qwen-Image-2.0-RL** 通过复合奖励模型与 **GRPO** 强化学习框架,结合 **on-policy distillation** 合并任务专有策略,显著提升扩散模型在图文生成和编辑上的视觉质量与指令跟随能力。

问题

文生图与图像编辑的后训练挑战

当前文本到图像生成(T2I)和图像编辑领域正从单纯的模型架构扩展转向后训练对齐,旨在使生成结果更符合人类审美与复杂指令。

现有方法多以监督微调(SFT) 或 CLIP 相似度指标为中心,难以捕获细粒度的人类偏好,例如美学质量人像保真度或编辑中的身份保持。奖励模型通常仅采用单一评分,无法覆盖多任务需求;强化学习训练在扩散模型中的应用尚不成熟,直接应用常导致灾难性遗忘,破坏预训练知识。此外,T2I 和编辑任务往往分开优化,缺乏统一策略,限制了模型的通用性。

该问题的难点在于:

  • 复合奖励建模:需同时衡量对齐度、美学、编辑一致性等多个维度,并为不同任务校准权重,避免奖励冲突。
  • 训练稳定性:扩散模型的去噪过程为序列决策,强化学习需在每步提供有效梯度,且必须引入机制保留预训练能力,如本文的混合 CFG 策略。
  • 多策略融合:将专精于 T2I 和编辑的多个策略合并为单一模型,要求在蒸馏时保持各自优势,防止性能退化。

行业重要性不言而喻:只有通过可靠的对齐流程,模型才能在产品中提供一致、可信的生成结果。类比于 LLM 的 RLHF 对齐范式,视觉生成同样迫切需要一套系统化的后训练方法,以打通从研究到可靠部署的最后一公里。

核心洞察

  • 基于 VLM 的点式评分与链式思维推理构建复合奖励模型,解决了生成任务中主观质量评估的细粒度量化难题。区别于常见的 CLIPScore 或单一美学预测器,该方法通过微调视觉语言模型获得对齐、美感、人脸保真等多维信号,并引入显式推理过程,使奖励更可靠、可解释,为 RL 训练提供高保真监督。
  • 在 GRPO 训练中引入混合 CFG 与组内奖励范围过滤,有效平衡了探索与预训练知识保留。混合 CFG 在强化学习时动态调整引导尺度,避免模型遗忘原有生成能力;而奖励过滤则自动筛除低质量提示,减少噪声信号干扰,并配合类别权重校准,使多任务优化更稳定,这相比直接应用 RL 于扩散模型有更工程化的改进。
  • 通过轨迹级速度匹配的 on-policy distillation 将多个任务专用 RL 策略合并为单一模型,为多能力集成提供了新范式。传统方法叠加多个组件导致部署复杂,该蒸馏框架在训练轨迹上对齐学生与多教师输出,既保留各任务性能又实现模型统一,展示了 RL 后训练中知识融合的可行路径。

方法

方法概述

Qwen-Image-2.0-RL 采用 后训练管线,以增强扩散模型在文生图(T2I)与图像编辑任务中的视觉质量与指令遵循能力。整个流程遵循“输入提示 → 奖励建模 → 强化学习微调 → 策略合并 → 最终模型”的范式。

1. 复合奖励模型构建

为提供可靠训练信号,系统基于 视觉语言模型(VLM) 微调得到任务定制的 复合奖励模型

  • 文生图维度:奖励模型同时评估 生成-提示对齐度美学质量肖像保真度
  • 图像编辑维度:重点考察 指令遵循准确性人脸身份保持
  • 微调采用 逐点评分范式(pointwise scoring)与 思维链推理(chain-of-thought),使奖励信号更细粒度且可解释。

2. GRPO 驱动的强化学习框架

以奖励模型为基础,构建可扩展的 GRPO(Group Relative Policy Optimization) 训练流程,并在其中融入三项关键设计:

  • 混合无分类器引导(Hybrid CFG):在 RL 训练时动态调整引导强度,防止灾难性遗忘预训练先验。
  • 组内奖励范围过滤:对批量内生成样本按奖励值分布筛选提示,只保留奖励跨度足够大的高质量提示,提升训练效率。
  • 类别奖励权重校准:针对不同奖励维度(如美学、对齐)按任务重要性自适应加权,避免单一指标主导优化。

3. 在策略蒸馏(OPD)

由于 T2I 与编辑任务分别训练得到专项 RL 策略,最后通过 在策略蒸馏 将其合并为统一模型。该方法在轨迹层面进行 速度匹配(trajectory-level velocity matching),使多个教师策略的生成分布同时迁移到单个学生模型,避免任务间干扰。

与同类工作的差异

常见 RLHF 方法多针对文本生成或单独维度优化,而本工作将 复合奖励模型GRPO 结合,并通过 OPD 实现多任务策略的无损融合,这在扩散模型后训练中尚属首次尝试。

实验

实验设计

  • 奖励建模:基于视觉语言模型(VLM)微调,构建覆盖对齐度美学质量人像保真度(T2I)以及指令遵循准确度人脸身份保持(编辑)的复合奖励模型,采用逐点评分搭配思维链推理。
  • RL训练框架:采用GRPO算法,引入混合分类器自由引导(CFG)以保留预训练知识,通过组内奖励范围过滤筛选高质量提示,并对不同奖励类别进行权重校准
  • 策略合并:最终阶段使用On-Policy Distillation (OPD),通过轨迹级速度匹配将多个任务专家模型蒸馏为单一学生模型,实现多任务统一。

关键发现

  • Qwen-Image-Bench 上综合得分 57.84,较基础模型提升 +2.61,验证了多维奖励信号的有效性。
  • 文本到图像竞技场 Elo 评分 1193(+78),图像编辑竞技场 Elo 评分 1349(+93),反映模型在视觉吸引力指令对齐上的显著进步。
  • 消融表明 OPD 阶段对合并专项策略至关重要,避免了多任务间的干扰。

基线对比深度解读

  • RLHF + OPD 的组合相比纯监督微调或单一RL阶段,更能兼顾生成质量与指令遵循,这得益于奖励模型的细粒度设计和GRPO的探索效率。
  • 混合CFG 解决了强化学习训练中常见的基础能力遗忘问题,使得最终模型在保持通用性的同时获得专项提升。
  • 该框架的模块化设计(奖励模型可替换、蒸馏可扩展)为工业级应用提供了参考,暗示未来可在更多模态任务上复用类似管线。

行业影响

落地场景

Qwen-Image-2.0-RL 通过 RLHF 与在线策略蒸馏 (OPD) 提升扩散模型的美学质量与指令遵循能力,可直接集成至以下产品线:

  • 创意内容平台:自动化生成高美感配图、营销素材、个性化头像与海报;
  • 电商与品牌:根据商品描述或用户编辑意图,大批量生成高质量商品图、穿搭照、场景图,并支持局部编辑(换背景、修改素材)而不丢失身份一致性;
  • 交互式设计工具:提供图像编辑助手,用户用自然语言指令调整构图、风格、光影,实时反馈符合专业美学的效果;
  • 教育/数字孪生:文本生成教程插图,或对已有图像进行结构化编辑,确保视觉统一。

商业价值

降本 方面,模型在美学、指令对齐和编辑保真度上的自动提升可减少人工筛选与后期修饰成本。例如在广告素材生产中,一次生成通过率大幅提高,直接降低重生成与人工精修开销。

增收 方面,更强的提示词遵循与编辑能力赋能 A/B 测试自动化,营销团队可快速生成数百版素材,优化点击率与转化率;同时,高美学质量保障品牌调性,提升用户停留和分享意愿。

体验提升 方面,人像编辑的身份保持(portrait fidelity)和编辑准确度(instruction-following accuracy)让终端用户获得专业级修图体验,增强产品粘性。

与现有工作流的接口

该管线与现有生成式栈高度兼容:

  1. 奖励模型集成:可复用现有的 VLM(如 GPT-4V 或开源替代)进行点式打分,无需昂贵的人工成对偏好标注,只需少量微调即可构建任务特定评分器;
  2. RL 训练框架:GRPO 与混合无分类器引导 (CFG) 策略可插入主流扩散模型训练流程,保护预训练知识的同时微调生成策略;
  3. 蒸馏融合轨迹级速度匹配 的 OPD 可将多个专用教师(T2I 和编辑)融合为单一学生模型,简化部署和维护,适合模型平台的多任务 API 服务。

具体落地用例

  • 电商平台商品拍摄:某时尚电商希望用同一件衣服快速生成多种肤色模特试穿图并保留服装细节。Qwen-Image-2.0-RL 可从文本描述生成高质量试穿图,并通过编辑功能替换背景或微调配饰,同时确保服装纹理一致。其分类别奖励权重校准可针对不同服装品类(如正装、运动)自动调整美学与对齐权重,大幅减少人工修图。
  • 在线设计协作工具:某 SaaS 设计平台计划嵌入自然语言驱动的图像编辑助手。用户输入“将背景改为咖啡馆,增加柔和侧光”,模型准确修改背景并保持前景人物光照统一。奖励模型中的思维链推理确保编辑过程遵循复杂指令,直接提升用户改图效率与满意度。

局限

  • 奖励模型泛化与偏好偏差:为不同任务独立微调 VLM 构建复合奖励模型,需要高质量偏好数据,且每个新场景(如特定艺术风格、复杂实体组合)都需重构评分维度与数据管线,扩展成本高。同时,VLM 评分虽结合 CoT 推理,但与真实人类感知仍存 gap,可能引入系统性偏差,尤其在人像保真度等主观维度上,长期可能导致模型朝奖励函数可利用但人类不认可的方向偏移。
  • 生成多样性可能下降:RL 优化直接最大化奖励,易陷入模式坍缩。尽管采用 on-policy distillation 合并教师策略,但仅在质量、指令遵循等维度做对齐,缺少显式的多样性约束(如 LPIPS 多样性、召回率)的讨论与消融实验,生成多样性可能弱于基模型,在实际应用中导致创作者可探索的风格空间收窄。
  • 计算开销与基线对比不足:GRPO 在线训练、多教师模型维护、不同类别奖励权重校准等环节带来显著计算负担,论文未给出详细训练成本对比,限制了对中小团队实用性的判断。同时,外部对比主要依靠 Elo 评分与自建 Benchmark,缺少与同期主流模型(如 SD3、Midjourney v6 等)在公开标准 benchmark(如 DrawBench、T2I-CompBench)上的直接指标比较,难以定位其绝对竞争力。
论文Yixian Xu2026-06-25原文

相关内容