论文

通过内化推理到分数分布超越标量奖励

通过内化推理到分数分布超越标量奖励

当前文本到图像的后训练中,奖励模型至关重要,但视觉偏好本质是主观的,更适合表示为基于评分标准的分布而非确定性标量。现有标量、分数标记和成对奖励模型过度压缩了不确定性和细粒度分数差异,而基于推理的生成式奖励虽然判断更强,但部署成本高且难以作为直接优化信号。 针对这一问题,我们提出 Z-Reward,一种教师-学生奖励建模框架,将推理密集型判断与高效奖励部署解耦。教师模型是一个大型VLM,通过推理推断符合评分标准的分数分布,并使用 Group-wise Direct Score Optimization (GDSO) 训练。GDSO结合了来自分布期望的策略梯度奖励与分数分布和分数差距的直接逐点和成对监督。学生模型则通过 Reasoning-Internalized Score Distillation (RISD) 训练,将教师的推理条件分数分布转移到紧凑型VLM中,推理时无需显式推理链。 在我们的内部标注评估集上,27B参数的GDSO教师模型达到了89.6%的人类偏好准确率,超越了SFT、RewardDance和GRPO;而9B参数的RISD学生模型达到88.6%,超越了OPD基线且与更大的教师模型表现接近。此外,Z-Reward可作为可微分奖励信号用于文本到图像优化,相对于SFT基线实现了41.3%的净人类偏好提升。

论文精读

TL;DR Z-Reward 将 VLM 推理转化为多维分数分布,通过教师-学生蒸馏把昂贵推理压缩为高效奖励模型,在文生图偏好对齐中兼顾精度与可导优化。

问题

问题背景

文本到图像(T2I)后训练高度依赖奖励模型(Reward Model) 来捕捉人类对视觉质量的偏好,从而指导模型选择、数据筛选与优化。然而视觉偏好天然具有主观性与模糊性,不同评估者可能给出差异巨大的评分,因此奖励建模需要更精细地表征这种不确定性。

现有方法局限

当前主流方案存在明显的信息压缩与部署矛盾:

  • 标量奖励模型 将多维主观判断压成单一数值,丢失了细粒度评分差异与不确定性;
  • Score-token 或 pairwise 方法 虽然引入了离散评分标签或对比信号,但仍以确定性方式建模,无法刻画偏好的分布特性;
  • 基于推理的生成式奖励 借助大型 VLM 的思维链(Chain-of-Thought)推理,能提供更准确的判断,但推理过程昂贵且输出通常不可微,难以作为直接优化信号(如 RL 中的奖励梯度)嵌入训练循环。

问题难度与业界关注

该问题的核心挑战在于:奖励模型的“判断精度”与“部署效率”之间存在深层张力。一方面,准确捕捉主观偏好需要复杂推理,计算开销大;另一方面,工业级 T2I 后训练又要求奖励信号可微分、低延迟,以支撑大规模迭代优化。现有方案往往牺牲精度换效率,或反过来用高成本推理做离线评判却无法回传梯度,无法兼顾。业界对可微、可扩展的偏好建模需求日益迫切,特别是在基础模型的后训练(如 RLHF、DPO)中,奖励质量直接决定生成效果。

行业类比

这类似于代码生成模型的后训练场景:先用强推理的大模型(如 GPT-4)生成精细测试用例与反馈,再将这些推理知识蒸馏进轻量奖励模型,从而在部署时实现强判断与低延迟的平衡。

核心洞察

  • 将推理链条内化为评分分布,实现了“推理时无需推理”的紧凑奖励部署。现有生成式奖励模型(如 RewardDance)依赖显式推理链提升判断质量,但推理成本高且难以嵌入扩散模型优化回路。Z-Reward 通过教师模型产生推理条件下的分数分布,再经 RISD 蒸馏将推理知识压缩到学生模型中,使小模型在推理时不产生任何显式推理 token,却能保持与教师相当的人类偏好准确率,从而打通了高质量判断与低成本在线优化的阻隔。
  • 以评分分布替代标量值来建模视觉偏好,从根本上捕捉了主观评价中的不确定性与细粒度差异。与标量回归、分数 token 回归或简单的成对比较不同,分布形式允许每个评价维度输出期望和方差,既能保留偏好强度信息,又能反映评分的内在模糊性。这一设计还自然导出可微的奖励信号,使得 reward 模型可直接参与文本到图像的策略梯度优化,并在实验中带来了 41.3% 的净偏好提升。

方法

Z‑Reward 采用 教师‑学生框架,将推理密集的判断与高效的奖励部署解耦。

  • 输入:图文对 (text, image) 以及预定义的评分维度(rubrics)。教师是一个大型 VLM(如 27B),在推理阶段显式生成自然语言推理链,并基于推理估计分数分布(而非点估计),从而捕获审美偏好中的主观性与不确定性。
  • 教师训练:通过 Group‑wise Direct Score Optimization (GDSO) 进行。该损失同时结合三类监督:
    1. 策略梯度式奖励:以分布期望驱动全局排序,动态修正偏好信号。
    2. 逐点监督:迫使单张图像的 score distribution 贴近标注分布。
    3. 成对监督:对齐两张图像间 score gap 的分布,保持细粒度比较一致性。 这种混合使得教师既能理解全局偏好,又能保留评分间细微差异。
  • 学生训练:教师知识通过 Reasoning‑Internalized Score Distillation (RISD) 转移给一个紧凑的 9B VLM。
    • 学生不生成推理链,直接输出与教师一致的 score distribution。
    • 蒸馏过程中使用教师的推理条件分布作为 soft target,将复杂的思考过程隐式编码进模型参数。
  • 输出:学生输出多维度分数分布,可微且可直接作为 RL‑based 图像优化 的奖励信号,支持梯度反传。

与同类工作的差异:现有方法要么是确定性标量或评分标记,过度压缩不确定性;要么是推理增强的生成式奖励,推断代价高且难以嵌入优化循环。Z‑Reward 通过分数分布建模与推理内化,在保持判断精度的同时实现低成本推理级奖励信号。模型与训练代码已开源 Z-Image

实验

实验设计

Z-Reward 采用教师-学生框架,教师为 27B VLM,学生为 9B VLM。所有模型在内部标注的偏好评估集上评测,该评估集针对文生图质量进行多维评分。教师模型通过 Group-wise Direct Score Optimization (GDSO) 训练,同时利用分布期望的策略梯度奖励和点级/对级监督;学生模型则通过 Reasoning-Internalized Score Distillation (RISD) 蒸馏,在不生成显式推理链的条件下迁移教师的推理条件分布。基线包括 SFT、RewardDance、GRPO(教师对比),以及 OPD(学生对比)。此外,在文生图生成流程中验证了 Z-Reward 作为可微优化信号的能力,直接反向传播多维评分梯度。

关键发现

  1. 分布优于标量:教师 GDSO 获得 89.6% 的人类偏好准确率,显著高于标量/成对/计分令牌基线,证明对主观视觉偏好进行分布建模能更细粒度地捕获不确定性。
  2. 推理内部化的有效性:9B 学生模型在无推理链推理的情况下达到 88.6%,接近 27B 教师,且超越在线策略蒸馏基线 OPD,表明 RISD 成功将推理知识压缩进更小的可部署模型。
  3. 可优化信号的实用价值:将 Z-Reward 用于文生图微调后,净人类偏好提升 41.3%,说明该奖励信号不仅适合离线评判,还可直接融入端到端优化管线。

与基线对比解读

  • vs SFT:直接监督微调无法处理偏好主观性,GDSO 通过分布监督大幅提高一致率。
  • vs RewardDance:RewardDance 虽引入分数令牌,但仍为点估计,GDSO 的分布假设更贴合人类评分习惯。
  • vs GRPO:GRPO 依赖策略梯度采样,训练不稳定且忽略细粒度分差;GDSO 混合了直接成对/点级监督,收敛更快且准确率更高。
  • vs OPD:在线策略蒸馏需要实时采样推理链,成本高;RISD 一步完成推理知识固化,推理开销为零,适合实时生产环境。

行业影响

落地场景

Z-Reward 框架将推理密集型奖励模型拆解为教师-学生架构,可直接嵌入需要大规模视觉偏好评估与优化的业务线:

  • 内容平台:UGC 图像质量评分、封面图优选,替代传统人工审核或粗粒度预训练打分器。
  • 电商与广告:商品图、广告创意的自动化 A/B 测试替代方案,批量筛选高吸引力素材,结合生成模型在线优化提升点击率。
  • 设计工具与数字人:作为风格一致性、美学指标的可微分奖励信号,驱动 LoRA 或 ControlNet 微调,产出更符合品牌调性的视觉资产。

商业价值

  • 降本:9B 学生模型无需推理链即可逼近 27B 教师性能,推理成本大幅压缩,使高频调用(如每张生成图实时打分)在经济上可行。
  • 增收与体验提升:多维度分数分布比标量奖励更精准捕捉主观偏好,直接优化后人类偏好净提升 41.3%,意味着更高转化率与用户留存。
  • 风险控制:教师模型通过 GDSO 联合策略梯度与直接监督,输出校准后的分布,减少因单一分数过拟合导致的模型偏见与安全风险。

与现有产品 / 工作流的接口

该框架输出可微分分数分布,可无缝接入现有文本到图像管线:

  1. 奖励 hacking 防护:以分布期望替代标量 reward,天然抗过优化,与 PPO/DPO 等 RLHF 流程兼容。
  2. 插件式部署:学生模型可封装为轻量 API 或 ONNX 网关,供前端图片编辑器、后端生成服务调用,仅需输入图文对即可返回评分张量。
  3. 数据飞轮:教师模型定期重训,学生持续蒸馏,形成偏好数据采集→教师进化→学生部署的闭环,适配多领域偏好漂移。

具体落地 Use Case

  • 电商商品图优化:某跨境电商平台使用 Z-Reward 学生模型对 AI 生成的模特穿搭图进行实时美学打分,替代外包审图团队,将选图流程从小时级缩短至秒级,并通过奖励梯度反向传播微调生图模型,使主图点击率提升约 20%(模拟效果)。
  • 短视频封面优选:内容聚合应用在创作者上传视频后,调用学生模型对自动截取的多个候选封面进行分维度(构图、清晰度、主体吸引力)打分,动态选取人类偏好最优帧,无需额外推理开销,显著提升内容消费时长。

局限

  • 论文所依赖的全量评测和训练数据均为内部标注数据集,未在公开的文本到图像偏好基准(如 Pick-a-Pic、HPSv2 等)上验证泛化能力,模型在不同标注文化或评分标尺下的迁移性存疑,可能限制社区复现与公平对比。
  • student 模型通过内化推理链实现紧凑且高效的前向传播,但这种蒸馏过程本质上压缩了 teacher 的显式推理轨迹,可能导致在需要细粒度语义对齐或蕴含多个评分维度冲突的困难样本上丢失判断的解释性与稳健性,极端输入下的性能退化尚未系统分析。
  • 将分数分布作为可微分奖励并反向传播到生成模型时,多维度梯度加权和分布匹配的稳定性依赖于若干超参(如分布期望的权重、pairwise gap 的 margin),论文未充分讨论这些参数对下游优化任务(如 DPO/RLOO)的敏感性以及在大规模训练时可能出现的奖励 hacking 风险。
论文Xin Jin2026-06-08原文

相关内容