FIRM-Video: 在评分前先核查,用于可靠的文本到视频奖励建模
可靠的奖励模型对于文本到视频评估和对齐至关重要。然而,评估准确性与推理效率之间的权衡对训练监督的质量提出了很高要求。现有方法通常依赖带有固定规则或开放式推理的整体评判,导致检查不完整、理由不可靠以及归因纠缠。我们提出 FIRM-Video,一种基于先核查后评分原则的统一清单驱动数据构建框架:构建特定维度的检查清单,对照时间视觉证据验证每个标准,并仅聚合经过验证的决策。 对于指令遵循,FIRM-Video 将提示分解为加权原子要求;对于世界一致性,它构建基于可见实体和动作的、经提示校准且针对特定目标的检查;对于感知质量,它应用视觉缺陷的通用分类。经验证的标准和分数进一步转化为自然语言分析,用于端到端奖励建模。随后,我们构建了 FIRM-Video-90K(包含来自 29,348 个视频的 88,044 个特定维度实例),并推出 FIRM-Video-Bench(包含 750 条逐点人工标注,覆盖 250 个视频)。基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上取得了最优整体 MAE,同时在三个视频生成器的 Best-of-8 采样中持续获得最高的 VBench Total、Quality 和 Semantic Scores。
论文精读
TL;DR FIRM-Video 通过 check-before-score 的 checklist 驱动,先逐项核验时间视觉证据再聚合分数,构建 90K 数据和评测基准,8B 模型在准确性与 Best-of-8 采样上表现最优。
问题
问题背景
文本到视频生成模型的自动评估与对齐高度依赖奖励模型,评估精度与推理效率的平衡对训练监督质量提出很高要求。
现有方法局限
主流方案分为两类:固定评分标准 的整体评判器在评前定义维度,但无法覆盖 prompt 中隐含的细粒度要求,容易漏检;开放式推理 让模型自由生成分析再打分,但推理过程常脱离视频时序证据,产生“不忠实理由”,且多维度分数相互纠缠,无法定位具体缺陷。这种 holistic judge 范式导致不完整检查、不可信归因。
为什么这个问题难/重要
视频奖励建模的难点在于:检查必须逐项验证 prompt 中的原子要求是否在时序视觉证据中出现,而视频帧间动态变化使证据定位成本高;同时,推理效率约束下不能对所有帧做密集验证,必须设计选择性检查机制。业界对该问题的关注源于奖励模型直接用于 Best-of-N 采样和 RLHF,低质量奖励会引导生成偏向错误方向,放大缺陷。因此,如何构造高质量训练监督成为关键瓶颈。
行业类比
类似代码审查中引入 checklist 机制——逐条核对提交是否满足需求,避免人工评审的随意性,奖励模型也需要先检查、后评分。
核心洞察
- 将奖励建模重构为 **check-before-score** 的逐项核查流程:对每个维度生成细粒度检查清单,模型必须基于 **时序视觉证据** 逐条验证,只有通过验证的准则才被聚合为最终得分。这不同于现有 holistic judge 或固定 rubric 直接给出整体分数,它强制决策过程可审计、可纠正,从而缓解不完整检查、不忠实理由和归因纠缠。该机制为视频奖励模型提供了类似 process supervision 的可解释中间监督,可直接迁移到其他多模态生成任务的奖励设计。
- 针对不同评价维度采用 **非对称的检查清单生成策略**:指令遵循将复杂 prompt 分解为带权重的原子要求,世界一致性从可见实体和动作构造 prompt-calibrated 目标检查,感知质量则应用通用视觉缺陷分类。这一设计打破了单一 rubric 跨维度的不足,使每个维度的监督信号密度和特异性最大化。对于实际工程,这种维度解耦的思路可指导奖励模型的模块化设计,避免用一个黑盒评分器硬套所有评估场景。
方法
方法流程
输入:视频与对应文本提示,经过维度分解进入三个并行的关键模块。
- Instruction Following:将提示分解为带权重的原子要求(weighted atomic requirements),每个要求形成可验证的检查项(check),确保覆盖提示中的关键指令。
- World Coherence:基于提示校准的目标特定检查(prompt-calibrated, target-specific checks),只关注可见实体与动作,避免对不可见或推测内容的无效判定。
- Perceptual Quality:应用通用视觉缺陷分类(generic taxonomy of visual defects)生成检查项,覆盖时序伪影、模糊、闪烁等低层质量问题。
每个模块产出的检查项都经过 基于时序视觉证据的逐条验证(temporal visual evidence verification):模型必须定位视频中的具体帧或片段作为证据,才能判定该检查通过或不通过,未通过证据支持的判定不进入聚合阶段。
聚合与输出:仅聚合已通过验证的决策(aggregate only verified decisions),形成各维度的数值分数;同时将验证过的检查项与分数转化为自然语言分析文本,作为端到端奖励模型的监督信号。最终输入 Qwen3-VL 基础模型,训练得到 FIRM-Video-8B,输出一个标量奖励值,用于文本-视频评价或 Best-of-N 采样。
与依赖固定评分表或开放式推理的整体评判不同,FIRM-Video 的 check-before-score 将评分拆解为可检查、可归因的子决策,并通过证据验证避免不忠实的理由生成,使奖励模型在效率与准确性之间取得更优平衡。
实验
实验设计围绕FIRM-Video-Bench 的点式人工标注展开,该基准包含 250 个视频、750 条维度级标注,用于直接比较各奖励模型的 MAE。同时引入 MJ-Bench-Video 验证泛化性,并在 VBench 上执行 Best-of-8 采样,覆盖三种视频生成器,以考察奖励模型在真实对齐场景下的选优能力。
关键发现:基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上取得最佳 MAE,同时在 Best-of-8 采样中稳定获得 VBench 的 Total、Quality、Semantic 最高分,表明 checklist 驱动的验证机制有效提升了评估准确性与采样增益。
与基线对比:相比固定 rubric 或开放式推理的整体评分方法,FIRM-Video 的 check-before-score 将指令跟随、世界连贯性、感知质量拆解为原子检查项,避免遗漏与错误归因。该方法在相同推理成本下,通过显式时序证据验证,提升了奖励模型的可靠性与指令对齐效率。
行业影响
落地场景
FIRM-Video 提供的 checklist-driven 奖励模型可直接嵌入视频生成评测与对齐 pipeline,服务于以下场景:
- 内容平台视频质量审核:对 UGC/PGC 视频自动评估指令遵循、世界一致性与感知质量,替代或辅助人工审核。
- 视频生成模型迭代:作为 reward model 参与 Best-of-N 采样、RLHF 或 DPO 训练,提升生成视频的语义对齐与画面质量。
- 广告/电商短视频生成:快速筛选符合 brief 的候选视频,降低重拍与后期成本。
- 教育/培训视频生成:自动检查物理规则、动作连贯性及视觉缺陷,保证教学素材可用性。
商业价值
- 降本:将人工评测转化为自动化 reward 打分,减少标注人力;FIRM-Video-90K 数据集可直接用于训练轻量 reward 模型,无需从零构建。
- 增收/体验提升:在视频生成产品中集成 FIRM-Video-8B,可提升生成结果的可接受率,减少用户等待与重新生成次数,改善平台留存。
- 差异化竞争力:相比 holistic judge 或固定 rubric,check-before-score 机制提供可解释、细粒度的评分依据,便于产品侧向客户展示质量保障流程。
与现有工作流接口
- 离线批量评测:将 FIRM-Video-8B 部署为独立推理服务,接收视频+prompt,输出各维度分数与自然语言分析,替代现有 VBench、MJ-Bench-Video 中的人工或规则评分模块。
- 在线生成 pipeline:在扩散模型采样后接入 reward model 做 Best-of-N 筛选,或作为 RM 用于强化学习训练循环(如 PPO/DPO),可直接对接 Hugging Face 上的模型权重与推理脚本。
- 数据飞轮:利用 FIRM-Video-Bench(750 条人类标注)作为回归测试集,监控线上 reward 模型的性能漂移,并定期用新采集的 prompt-video 对更新 checklist 与训练数据。
局限
- 论文未明确承认的局限可推断为:FIRM-Video 的数据构造流程高度依赖上游 MLLM(如 GPT-4o / Qwen 系列)生成维度专属 checklist 并进行视觉证据验证,因此训练监督的质量上限受限于这些模型自身的视觉推理与指令跟随能力,可能引入系统性的偏好或偏见。论文未对上游模型选择做消融实验,无法量化这种依赖的稳健性;同时,从 29,348 个视频构建 88,044 个维度实例需要大量多轮视觉问答与自然语言生成,数据生产成本较高,实际扩展到更大规模或实时更新时会遇到工程瓶颈。
- 从实验设计看,FIRM-Video-Bench 仅包含 250 个视频和 750 个人工标注(每个视频三个维度各一),样本规模较小且可能集中在特定视频类型或生成器输出,难以充分评估 reward model 在开放域、长时长、高分辨率视频上的泛化能力。Best-of-N 采样只在 3 个视频生成器(如 CogVideoX 等)上验证,未覆盖更多样的商用或开源生成模型(如 Sora、Kling、Gen-3 等),因此模型作为通用奖励模型的有效性证据仍然有限,尤其对于复杂物理交互或长时序因果关系的世界连贯性判断可能存在盲区。
- 与同类工作相比,VideoScore、VBench 等 holistic 评分通常直接输出整体分数,而 FIRM-Video 的 check-before-score 流程需要额外生成 checklist、逐条验证并聚合,因此在推理效率上存在明显劣势,可能不适用于需要低延迟反馈的在线 RLHF 或大规模 Best-of-N 采样场景。论文没有报告与轻量级奖励模型(如 CLIP 分数或简单回归模型)在推理延迟、吞吐量或计算成本上的定量对比,这削弱了对实际部署价值的论证;同时,该方法生成的 checklist 可能过于细粒度,导致评分一致性受限于验证步骤的累积误差。