论文

注释即 Rollouts: 视频 MLLMs 的高效可扩展强化学习

注释即 Rollouts: 视频 MLLMs 的高效可扩展强化学习

多模态大语言模型 (MLLMs) 已成为统一视频感知的主流范式。然而,在大规模多任务数据集上进行后训练仍面临挑战:现有强化学习方法即使借助昂贵的思维链 (CoT) 生成,也只能采样到少量高质量 rollouts 的 on-policy 组。本文研究视频 MLLMs 强化学习后训练的样本效率与可扩展性,提出 OraRL。 我们发现注释被忽视的额外作用:每个注释不仅能评估 rollouts,还能作为 oracle rollout 进入其 on-policy 组,提供直接的正向优化目标。不过,直接集成 oracle 并非易事:高奖励 oracle 会抬高组基线,使原本为正的策略优势变为负值,我们将此失败称为 优势翻转 (advantage inversion)。OraRL 的核心是解耦优势估计器:策略 rollouts 决定无 oracle 基线,而 oracle-策略差距同时调节方向性增益和独立的分离 oracle 优势。符号平衡剪枝可进一步提升效率:仅保留 oracle 及每个符号中最强的 rollouts,OraRL 的步耗时仅为 SFT 的 2.2 倍,不到带 CoT 的 GRPO (4.9 倍) 的一半。 OraRL 随模型规模与数据量扩展,在 0.8B 至 9B 范围内均超越其骨干模型,并在高达 10 万提示上超越 GRPO。无需思维链,Video-ORA-9B 解码仅需 130 ms,而非 4,780 ms。与各自先前最佳模型相比,它分别将时间 mIoU 从 62.5 提升至 66.0,跟踪 AO 从 73.0 提升至 78.2,分割从 64.3 提升至 70.4,三项基准的空间智能宏平均从 51.0 提升至 56.1;在 VSI-Bench 上得分为 73.1,而 GPT-5 为 55.0、Gemini-3-Pro 为 55.1。

论文精读

TL;DR OraRL 将标注作为 oracle rollout 引入强化学习,用解耦优势估计避免优势反转,以符号平衡剪枝提升效率,使视频 MLLM 无需 CoT 即可高效扩展并超越 GRPO。

问题

问题背景

统一视频感知任务中,多模态大模型 (MLLM) 已成为主流范式。后训练阶段用强化学习优化多任务策略是提升效果的关键路径,但高质量 rollouts 的获取成本与样本效率成为瓶颈。

现有方法局限

现有 GRPO 等方法在 on-policy 组内采样,依赖模型自身生成 rollout。即使引入 思维链 (CoT),单组内高质量 rollout 仍然稀少,且 CoT 会带来巨大的推理开销。更关键的隐性问题是:如果把高奖励的标注作为 oracle rollout 直接注入组内,它会抬高组内 baseline,从而把原本正向的策略 advantage 反转为负值,即 advantage inversion。这导致模型无法从标注中可靠学习。

为什么这个问题难/重要

视频任务标注本身包含完整正确答案,可视为天然的专家 rollout。但直接使用会破坏 RL 的 advantage 估计框架,需要重新设计 estimator。在 0.8B 到 9B 参数、最多 100k prompts 的规模下,同时保证训练效率(step time 仅 SFT 的 2.2×)与推理速度(130 ms vs 4780 ms)是实际部署的硬约束。业界对视频 MLLM 的后训练效率和可扩展性高度关注。

行业类比

类似用自动驾驶场景中的专家轨迹直接注入离线 RL,若 baseline 不调整,反而会抑制策略改进;OraRL 的做法类似给在线学习系统加一个独立的 reference policy,分离专家信号与策略信号。

核心洞察

  • 将 annotations 视为 oracle rollout 直接纳入 on-policy group,而非仅作为 reward 信号。这一视角独特在于把标注从“裁判”变为“示范”:现有多任务 RL 方法如 GRPO 即使使用 CoT,面对视频 MLLM 高难度 prompt 时每个 group 内高质量 rollout 数量少,而 annotation 天然是强正样本,直接作为优化目标可以显著提升 sample efficiency,每步训练都能利用高奖励参照,避免无谓探索。
  • 提出 decoupled advantage estimator 解决 advantage inversion 问题。直接注入高奖励 oracle 会抬高 group baseline,使原本正的策略优势反转为负,导致学习受阻。OraRL 将 oracle-free baseline 与 oracle-policy gap 解耦:策略 rollout 决定无 oracle 基线,oracle 通过分离的 detached advantage 和方向增益调制优化信号。独特处在于既保留 oracle 的引导作用,又不让其污染基线,这是 oracle 注入 RL 的关键难点。
  • sign-balanced pruning 通过保留 oracle 和每个符号的最强 rollout,大幅减少无效样本,使训练步骤时间仅为 SFT 的 2.2 倍,远低于 GRPO with CoT 的 4.9 倍。同时该方法无需 CoT,推理时 Video-ORA-9B 解码只需 130 ms,而 CoT 方法需要 4,780 ms。独特处在于同时优化训练与推理效率,为大规模 RL post-training 提供可行路径,尤其在视频多任务场景下避免了 CoT 带来的高昂延迟。

方法

输入与数据流

  • 视频 MLLM 接收视频帧与任务 prompt,输出预测 rollout。
  • 每个训练样本的标注被序列化为 oracle rollout,与策略采样的 rollout 一同构成 on-policy group。

关键模块:解耦优势估计

  • 策略 rollout 单独计算 baseline(不含 oracle),避免高奖励 oracle 拉高 baseline 导致 advantage inversion(策略本应正优势被翻转为负)。
  • 计算 oracle 与 policy 的差距,用于调制方向增益;同时生成 detached oracle advantage,为策略提供直接正优化目标且不干扰 baseline。

关键模块:符号平衡剪枝

  • 在 group 中仅保留 oracle 和每个符号(正/负)最强 rollout,减少计算开销。
  • 训练每 step 时间仅为 SFT 的 2.2 倍,低于 GRPO+CoT 的 4.9 倍。

输出与推理

  • 模型通过 RL 更新,不需要 chain-of-thought,推理延迟从 4780ms 降至 130ms。
  • 输出为统一视频感知结果,在 temporal mIoU、tracking、segmentation 等指标上显著提升。

与同类方法差异

OraRL 不同于 GRPO 等依赖 CoT 采样且忽略标注作为直接优化目标的方法,它通过解耦优势估计和符号平衡剪枝,在保证样本效率的同时大幅降低训练和推理成本。

实验

实验设计

OraRL 在视频 MLLM 上开展 RL 后训练,核心创新是 oracle rollout 与 解耦优势估计。评估覆盖时间分割、目标跟踪、语义分割及空间智能基准(VSI-Bench、ReVSI),训练数据扩展至 100k prompts,模型规模从 0.8B 到 9B。基线包括原始 backbone 与 GRPO with CoT。

关键发现

  • 性能大幅提升:temporal mIoU 从 62.5 提升至 66.0,tracking AO 从 73.0 提升至 78.2,segmentation 从 64.3 提升至 70.4,空间智能宏平均从 51.0 提升至 56.1。
  • 在 VSI-Bench 上,OraRL 得分 73.1,远超 GPT-5(55.0)和 Gemini-3-Pro(55.1)。
  • 无需 CoT:推理解码从 4,780 ms 降至 130 ms,训练步时仅为 SFT 的 2.2 倍,而 GRPO+CoT 需 4.9 倍。
  • 符号平衡剪枝 保留 oracle 与最强正负 rollout,提升样本效率。

基线对比解读

与 GRPO+CoT 相比,OraRL 不仅消除了昂贵的 CoT 生成,还以更低训练开销取得更优或相当性能,证明 oracle rollout 直接注入 比单纯增加 rollout 数量更有效。与 backbone 相比,所有模型规模均稳定提升,表明 RL 后训练的价值。与通用大模型 GPT-5 / Gemini-3-Pro 对比,OraRL 在专门空间智能上优势显著,凸显视频 RL 后训练的专业化增益。

行业影响

落地场景

OraRL 面向统一视频感知任务(时序分割、目标跟踪、空间智能),可直接用于视频内容平台(自动打标/审核)、电商直播(商品实时分割与跟踪)、自动驾驶与机器人(视频流语义理解)。例如,短视频平台可将其用于视频级多任务标注以替代人工初审;手术/内窥镜视频分析中,130ms 解码支持实时组织分割与器械跟踪。

商业价值

  • 训练降本:OraRL 将 RL 步时从 GRPO+CoT 的 4.9× SFT 降至 2.2× SFT,同等数据规模节省约 55% GPU 时,大规模后训练更可行。
  • 推理提速:9B 模型解码 130ms(约 7.7 FPS),对比 GRPO+CoT 的 4,780ms,无需 CoT 即可实时响应,显著降低边缘部署门槛。
  • 效果提升:temporal mIoU 62.5→66.0,tracking AO 73.0→78.2,segmentation 64.3→70.4,为内容审核、自动驾驶感知等业务减少漏检/误检。

现有工作流集成

OraRL 可作为 drop-in 替换视频 MLLM 的 RL 后训练模块:保留 SFT 阶段,将 GRPO 替换为 decoupled advantage estimator + sign-balanced pruning;训练数据只需把标注作为 oracle rollout 注入,无需额外生成 CoT。推理侧可直接用标准 vLLM/TensorRT 部署 9B 模型,代码开源在 GitHub,数据与权重可通过 HuggingFace 获取。

局限

  • - 论文将标注直接作为 **oracle rollout** 注入优化目标,但该方法高度依赖高质量标注。若标注存在噪声或格式不一致,**decoupled advantage estimator** 可能放大错误信号,导致策略偏移。此外,多任务数据集构建需为每个 prompt 提供 oracle,标注成本未被量化,是否适用于开放域视频理解尚无实验支撑。
  • - 实验覆盖的任务类型集中在可结构化输出的视频感知基准(temporal mIoU、tracking、segmentation 等),奖励函数定义清晰。对于开放式生成或对话式视频问答,oracle serialization 与奖励设计的普适性存疑,迁移灵活性不如通用 RLHF 框架,论文未给出相关讨论。
  • - 相比 **GRPO** 省去 CoT 带来高推理效率,但这也意味着模型无法通过逐步推理处理复杂视频关系。在需要多步逻辑推断的任务上,省略 CoT 可能损害上限;且 **sign-balanced pruning** 只保留 oracle 与最强 rollout,可能降低探索多样性,长期可能限制策略收敛的鲁棒性。
论文Yunheng Li2026-08-20原文

相关内容