Video Models Can Reason with Verifiable Rewards
视频扩散模型在感知真实性和时间连贯性方面取得了快速进展,但主要针对合理生成而非可验证推理进行优化,在生成视频需满足显式空间、时间或逻辑约束的任务中尤为受限。受可验证奖励强化学习(RLVR) 在推理导向语言模型中的启发,本文提出 VideoRLVR,一种基于规则反馈优化视频扩散模型的实用方案。 VideoRLVR 将视频推理形式化为可验证视觉轨迹的生成,包含 SDE-GRPO 优化骨架、密集分解奖励 和 Early-Step Focus 策略(将策略优化限制在早期去噪阶段,训练延迟降低约 40% 且性能不变)。 在 Maze、FlowFree 和 Sokoban 三个程序生成领域(具客观成功标准)中评估。VideoRLVR 在各项任务中均一致优于监督微调基线,密集分解奖励 在低成功率场景下尤为重要。RL 优化模型在可验证推理基准和跨领域基准上均超越评估的专有及开源视频生成模型。 结果表明:可验证 RL 能将视频模型从感知模仿推向更可靠的规则一致性视觉推理。
论文精读
TL;DR VideoRLVR 用可验证奖励的强化学习训练视频扩散模型,实现严格规则约束下的视觉推理,并通过早停策略降低 40% 训练开销,显著超越监督微调基线。
问题
问题背景
视频扩散模型在感知真实感和时序连贯性上取得了快速进展,但主要优化方向仍停留在生成视觉合理的画面,而非满足可验证的显式约束。随着 AI 推理从文本拓展到多模态,业界开始关注视频模型能否像语言模型一样进行规则一致的推理。
现有方法的局限
当前的视频生成模型大多依赖监督微调(SFT),通过模仿训练数据中的帧序列来学习映射。这种范式存在两个结构性缺陷:
- 缺乏对规则一致性的显式建模:模型只会复制训练分布中的统计模式,无法保证生成的视觉轨迹严格满足空间可达性、时序顺序或逻辑约束。在需要精确控制的场景下,SFT 模型常产生违反物理或游戏规则的动作。
- 稀疏奖励下的训练困难:传统强化学习在视频生成中面临高维动作空间和长序列决策的挑战,奖励信号常延迟且稀疏,导致策略无法有效收敛。直接套用语言模型中的 RLVR 方法会因去噪过程的特性而难以稳定训练。
为什么这个问题重要且难
视频推理任务要求模型不仅能生成像素级真实的画面,还要在连续帧序列中保持规则的一致性,这本质上是一个带约束的序列决策问题。技术挑战在于:
- 高维、变长输出空间:与离散 token 序列不同,视频扩散模型的隐空间是连续的,且去噪步数达数十甚至上百步,策略优化的搜索空间极大。
- 奖励信号的设计与分解:简单的是非判断无法有效指导学习,需要将成功准则拆解为可逐帧评估的子目标,同时避免奖励稀疏导致的梯度消失。
- 训练效率瓶颈:全去噪链路的 RL 微调计算成本高昂,需引入如本文的 Early-Step Focus 等方案来降低约40%的延迟,同时保持性能。
业界正积极推动从“生成逼真内容”到“生成可信推理”的范式转变,这直接关系到视频模型在机器人规划、程序化内容生成和自动化测试等领域的实际落地。
行业类比
类似 LLM 从纯语言生成向代码推理(如 CodeRL)或数学证明(如 LeanDojo)进化,视频模型也在经历从“画得像”到“逻辑对”的蜕变,其核心都是用可验证的奖励信号驱动策略突破模仿边界。
核心洞察
- 将 RLVR 范式从 LLM 迁移到视频扩散模型,通过 **可验证的视觉轨迹生成** 来优化时空约束满足能力。不同于以往视频生成仅追求感知真实感,VideoRLVR 引入 SDE-GRPO 与稠密分解奖励,使模型能够显式学习规则一致的推理行为,在 Maze、FlowFree、Sokoban 等过程生成任务上超越监督微调基线,证明 reward-driven 训练可让生成模型产出更可靠的逻辑结果。
- Early-Step Focus 策略只在扩散早期阶段进行策略优化,将训练延迟降低约 40% 而性能无损。这与常规全轨迹 RL 优化不同,揭示出视频扩散推理中早期噪声步已包含关键决策信息,后端微调可被安全跳过,对大规模视频 RL 训练的工程效率提升具有直接指导价值。
方法
输入与任务定义
VideoRLVR 以预训练的视频扩散模型(video diffusion model)为策略网络,输入为任务描述(如迷宫求解、FlowFree 路径规划、Sokoban 推箱子)以及首帧图像或初始状态。目标是在去噪过程中生成满足显式空间、时间或逻辑约束的视频轨迹,并通过可验证的规则奖励(verifiable rewards)进行优化。
关键模块
1. SDE-GRPO 优化骨干
将扩散模型的去噪过程建模为随机微分方程(SDE),并采用**组相对策略优化(GRPO)**进行强化学习更新。GRPO 在每组采样轨迹内部比较相对奖励,无需价值网络,适合高维生成任务。SDE 形式允许在连续时间框架下进行策略梯度估计,提升训练稳定性。
2. 密集分解奖励(Dense Decomposed Rewards)
奖励不是仅在最终帧判断任务成功与否,而是根据中间步骤的可验证性设计,例如每步的物体位置合法性、路径连通性、步数效率等子奖励。密集反馈在任务成功率极低时(冷启动)尤其重要,能够提供有效学习信号。
3. Early-Step Focus 策略
观察到早期去噪步骤决定视频的全局结构与规划,后期步骤仅做局部细化。该方法仅对前 ~40% 去噪步进行策略优化,跳过后续步骤的计算图,从而将训练延迟降低约 40%,而性能几乎无损。
输出与训练流程
最终输出为能够一致满足约束的推理视频模型。训练时先进行监督微调(SFT)作为基础,再使用 VideoRLVR 进行 RL 微调:每次前向生成一批视频轨迹,通过规则引擎计算密集奖励,利用 SDE-GRPO 更新模型参数,并配合 Early-Step Focus 加速训练。
与同类方法的关键差异
相较于传统 SFT 只能模仿训练分布而无法保证约束满足,VideoRLVR 直接以可验证规则作为优化目标;相比 LLM 领域的 RLVR,本工作针对视频扩散模型的 SDE 本质设计 GRPO 变体,并提出了 Early-Step Focus 这一针对生成过程的高效训练策略。
实验
实验设计
VideoRLVR 在 Maze、FlowFree 和 Sokoban 三个程序生成的任务上评估,这些任务要求生成视频满足明确的空间、时间或逻辑约束,并提供可验证的成功标准。实验采用 SDE-GRPO 作为强化学习优化骨干,结合 密集分解奖励 与 Early-Step Focus 策略。基线包括经过监督微调(SFT)的扩散模型,以及多个专有和开源视频生成模型。测试覆盖域内指标(如成功率)和分布外泛化能力。
关键发现
相比 SFT 基线,VideoRLVR 在所有任务上取得持续提升,尤其在初始成功率较低的困难设置中,密集分解奖励 的作用更加显著。Early-Step Focus 策略将训练延迟降低约 40%,且几乎不影响最终性能。RL 优化后的模型不仅大幅超越 SFT 模型,也优于对比的商用及开源视频生成模型,并在未见的分布外任务上展现出更好的泛化能力。
与基线对比的深度解读
这一结果揭示了 RLVR(可验证奖励强化学习) 在视频生成领域的潜力:通过可验证奖励,模型能够从感知合理性转向规则一致的视觉推理。与近期语言模型通过 RLVR 提升推理能力的趋势相似,VideoRLVR 证明即使在高维、连续的视频空间中,基于规则的反馈也能有效驱动策略学习。这对需要精确约束满足的应用(如具身智能、规划仿真)具有实际意义,表明将任务知识编码为可验证奖励函数,可以弥补监督学习在符号约束上的不足。
行业影响
VideoRLVR 通过 可验证奖励的强化学习(RLVR)优化视频扩散模型,使生成视频能够严格遵守空间、时序与逻辑约束,这为需要可靠视觉推理的工业场景打开了新的落地空间。
落地场景
- 工业数字孪生与仿真:生成符合物理定律或装配流程的机械运行动画,替代手工建模与脚本驱动。
- 游戏与交互内容生成:自动化生成关卡过关轨迹、NPC 行为视频,确保动作序列符合游戏规则。
- 自动化视频质检与修正:在视频生成中嵌入规则校验,输出即合规,减少后处理。
商业价值
- 降本:将依赖人工审查或规则脚本的视频制作流程自动化,SDE-GRPO 与 Early-Step Focus 策略可减少约 40% 训练延迟,直接压缩算力成本。
- 增收:为 AIGC 平台提供“可验证生成”增值功能,吸引对内容准确性要求高的企业客户(如教育、工业软件),提升产品溢价。
- 体验提升:用户获得一次生成即满足约束的视频,避免反复试错,在电商动态展示、技术培训动画等场景显著改善交互效率。
与现有工作流的接口
- 模型层:VideoRLVR 可作为 SFT 基座模型的后训练强化阶段,与现有视频 DiT(如 CogVideoX、Open-Sora)兼容,奖励函数通过外部规则引擎或视觉校验器提供。
- 数据与评估层:引入 程序化生成环境(如 Maze、FlowFree)自动产出训练样本和奖励信号,可无缝嵌入持续学习流水线。
- 部署层:优化后的模型可直接替换原有生成模型,不需要改动推理链路,Early-Step Focus 训练出的模型与标准采样过程完全兼容。
具体落地案例
- 电商商品动画:输入商品 3D 模型和“旋转展示 + 规避遮挡”规则,RLVR 微调后的模型生成无违规的 360° 展示视频,降低美工返工率。
- 自动驾驶场景生成:为端到端规划模型生成符合交通规则的 corner case 视频(如“路口让行后通过”),提升仿真数据多样性与真实性。
VideoRLVR 将视频模型从“逼真模仿”推向“规则遵循”,为工业级可信生成提供了可工程化的路线图。
局限
- - **任务域受限**:当前实验仅在 Maze、FlowFree 和 Sokoban 三个程序化生成的环境中进行,这些任务具有明确且可自动验证的规则,但场景复杂度远低于真实世界的视频推理需求(如物理交互、长程事件理解等)。方法在开放域视频推理上的泛化能力尚未得到验证,直接迁移可能面临奖励定义困难和模型表现退化的风险。
- - **奖励工程依赖强**:VideoRLVR 的性能高度依赖于密集分解奖励的设计,需要针对每个具体任务手工构建空间、时间、逻辑等多维度的子奖励函数。这种定制化的奖励设计在新任务上成本高昂,难以扩展到规则不明确或人工标注困难的开放域视频生成场景,限制了其作为通用视频推理优化方案的可行性。
- - **优化阶段取舍潜在缺陷**:Early-Step Focus 策略将策略优化限制在早期去噪步骤,虽减少了约 40% 的训练延迟,但放弃了在后期去噪阶段对视频细节(如精细动作、纹理一致性)的优化机会。这可能在需要高时空分辨率或复杂多步逻辑推理的序列中引入次优结果,而论文尚未充分分析该策略在长视频或高帧率生成中的影响。