论文

Rank-Then-Act: 基于帧序进度的无奖励控制

Rank-Then-Act: 基于帧序进度的无奖励控制

提出 Rank-Then-Act (RTA) 框架,用于从专家视频演示中学习控制策略,无需环境奖励。RTA 离线训练一个 Vision-Language Model (VLM) 作为基于进度的序数评分器,使用 Group Relative Policy Optimization (GRPO) 目标处理打乱的帧序列,迫使模型从视觉语义中恢复时间顺序,而非利用琐碎时间线索。 不同于直接将评分器用作标量奖励模型,我们提出一种基于相关性的奖励函数用于强化学习:在每个交互窗口,计算预测进度排名与真实时间索引之间的 Spearman 秩相关系数,得到有界、尺度不变的 learning signal。这一设计将奖励学习与绝对校准解耦,实现跨任务和环境的稳定迁移。 在离散控制基准(PyBoy: Catrap, Kirby)和连续控制任务(PointMaze, MetaWorld)上评估 RTA。RTA 一致匹配或超越先前基于视频的奖励学习方法及基于排名的基线,并展示出单个预训练进度评分器的强跨任务复用能力。结果表明,基于视频导出的序数信号的结构化相关性监督足以用于策略学习,为显式奖励设计提供了可扩展的替代方案。

论文精读

TL;DR Rank-Then-Act 从乱序视频帧学习视觉进度排序,用排序一致性作为强化学习奖励,无需手工设计奖励,实现跨任务稳定控制策略学习。

问题

问题背景

在强化学习和机器人控制中,从像素级视觉输入学习策略时,奖励函数的设计往往耗时、脆弱且容易被智能体利用(reward hacking)。为解决此痛点,研究者日益关注从专家视频演示中自动提取学习信号,替代手工奖励。

现有方法局限

现有基于视频的奖励学习方法主要面临三个技术瓶颈:

  • 标量奖励的绝对校准困难:直接训练模型将帧映射为标量奖励,需要精细调整尺度与偏置,且不同任务间难以复用,导致策略迁移时奖赏分布漂移。
  • 时间线索依赖而非语义进展:许多方法利用视频帧的自然时间顺序作为监督,但模型可能学到表面时间特征(如帧间时间戳差值),而非真正理解任务进展的视觉语义,泛化性差。
  • 排序信合利用不充分:部分工作尝试通过帧序排列学习进展,但多数采用成对比较,缺乏全局的、列表级别的排序优化,导致学习信号稀疏且不稳定。

为什么这个问题难且重要

从视频中提取进展信号的核心挑战在于:如何定义一个跨任务可迁移、对绝对尺度不敏感的学习信号。视频中的时间顺序隐含了任务的“进度”概念,但直接将时间映射为标量会引入任务特异的时标。同时,真实环境的视觉变化高度非线性,模型需具备强语义解析能力才能排序帧。业界之所以高度关注该问题,是因为它在游戏AI、机器人仿真无API环境下的自主训练等场景中具有广泛需求——这些领域难以获得稠密的奖励函数,但专家视频相对易得。

行业类比

类似视频理解中的自动进度条生成——用户无需逐帧标注时间,AI通过视觉语义变化自动推断任务完成百分比,这一能力可广泛应用于机器人技能学习和视频编辑辅助。

核心洞察

  • 将控制学习重新定义为时间顺序一致性任务,用排名相关性替代绝对奖励建模。RTA 不直接预测标量奖励,而是计算交互窗口内帧排序与真实时间索引的斯皮尔曼秩相关系数作为奖励信号。这种设计从根本上避免了绝对奖励模型的标定困难与尺度敏感问题,奖励有界且平移不变,显著提升了跨任务迁移的稳定性。相较于 VIPER、LIV 等使用 VLM 输出绝对任务进展的方法,RTA 的序数约束更鲁棒,尤其在不同环境外观剧变时仍能提供可靠学习信号。
  • 从打乱帧顺序中自监督学习任务进展,避免依赖简单时间线索。第一阶段用 GRPO 训练 VLM 从随机打乱的帧序列中恢复正确排序,迫使模型通过视觉语义理解任务进度,而非捕捉光照、纹理等表面时间特征。这种预训练策略无需人工标注,产生的进步评分器具有强泛化性,一个模型即可复用于多个不同控制任务,无需额外微调。相比传统方法中需要费力设计或学习的稠密奖励,RTA 仅靠帧序的序数监督就达到相当甚至更优性能,为无奖励控制提供了更可扩展的路径。

方法

RTA 方法分为两个阶段:先离线训练一个基于时序排序的进度评分器,再将其作为奖励信号引导在线策略学习,全程无需环境奖励。

  • 阶段一:训练序数进度评分器
    输入为从专家视频中抽取的打乱顺序的帧片段,不对帧做连续时间标注,只要求恢复相对顺序。使用 VLM 作为评分模型,通过 GRPO(Group Relative Policy Optimization)目标进行训练:对一组帧,模型预测每帧的“进展分数”,并最大化正确排序的似然。由于帧已打乱且去除了简单时间线索(如帧号),模型必须依赖视觉语义(如任务目标的接近程度、界面状态变化)来判断先后,从而学到跨任务通用的进展概念。输出是一个能在任意帧对上给出相对顺序判断的评分器,不输出绝对进度值。

  • 阶段二:在线控制与相关性奖励
    将评分器固定,在强化学习循环中,智能体与环境交互,收集一个滑动窗口内的帧序列。对窗口内每帧,用评分器预测进展排名,然后计算预测排名与真实时间索引的 Spearman 秩相关系数,直接作为奖励。该系数有界([-1, 1])、尺度不变,对绝对校准不敏感,因此可避免传统标量奖励模型常遇到的分布偏移和校准困难。策略通过最大化这一相关性来鼓励产生视觉上按预期进展变化的行为,实现无需手工奖励的控制学习。该奖励也可直接用于不同任务,因为评分器只依赖相对顺序,不绑定特定奖励分布。

与同类视频奖励学习方法的关键差异:以往工作多将评分器作为标量奖励模型直接输出奖励值,高度依赖绝对输出分布;而 RTA 只用序数一致性(相关性)作为信号,极大提升了训练稳定性和跨任务重用能力。

实验

实验设计

RTA 框架分两阶段评估:首先在离线专家视频片段上,利用 GRPO 目标训练 VLM 序数评分器,迫使模型从乱序帧中恢复视觉时序;然后在线交互中,以滑动窗口内预测排序与真实时间索引的 Spearman 秩相关系数 作为奖励,驱动强化学习。实验覆盖两类控制任务:

  • 离散控制:PyBoy 模拟器中的 Catrap 和 Kirby 游戏
  • 连续控制:PointMaze 导航与 MetaWorld 操作任务

基线包括基于视频的奖励学习方法(如 LOOP)和多种排序监督方案。

关键发现

  • RTA 在所有基准上匹配或超越先前方法,且奖励信号稳定,无绝对标度漂移问题。
  • 单次预训练的进度评分器可在多任务间直接复用,跨任务泛化能力强。
  • 仅从视频序数信号获得的相关性监督足以驱动策略学习,无需环境奖励或精细标定
  • GRPO 迫使模型从视觉语义理解进度,避免过拟合浅层时间线索。

基线对比解读

与传统标量奖励模型不同,RTA 的相关性奖励具有有界、尺度不变特性,跨环境迁移时无需重新标定。相比 LOOP 等需要任务专属奖励模型的方法,RTA 的序数评分器通用性更强,显著降低新任务适配成本。这一设计为大规模无奖励训练提供了可扩展的工程路径。

行业影响

落地场景

Rank-Then-Act (RTA) 框架直接从专家视频演示中提取任务进度信号,无需手工设计奖励函数,适用于难以定义显式奖励的复杂控制环境。典型落地场景包括:

  • 游戏 AI 与模拟器训练:在 retro games 或基于像素的模拟器(如 PyBoy)中,利用少量演示视频即可训练智能体,无需解析游戏 API 或编写奖励逻辑。
  • 机器人操作与导航:对于抓取、组装、室内导航等任务,只需提供成功操作的视频片段,RTA 就能生成连续控制策略,避免人工设计稀疏或易被钻空子的奖励。
  • 视频内容驱动的自动化:从教学视频或监控录像中提取任务进度,用于指导 AI 完成类似操作,如视频编辑中的自动剪辑、自动驾驶中的演示轨迹学习。

商业价值

RTA 通过消除奖励工程显著降低开发成本:

  • 降本:无需领域专家反复调试奖励函数,模型可直接从现有视频资产中学习,减少人工标注与算法迭代的时间。一个预训练进度评分器可跨任务复用,进一步摊薄训练成本。
  • 加速原型验证:在机器人或游戏 AI 项目早期,可快速用视频演示构建可工作的策略,缩短概念验证周期。
  • 提升策略鲁棒性:基于斯皮尔曼秩相关的奖励信号具有尺度不变性,避免绝对分值漂移,使策略迁移更稳定,减少重新训练的开销。

与现有产品/工作流的接口

RTA 可作为一个视频驱动的奖励生成模块嵌入现有强化学习 pipeline:

  • 集成方式:将 RTA 的进度评分器(基于 VLM 的 ordinal scorer)作为离线预处理步骤,对视频帧序列排序,输出相关性分数作为环境奖励,替换手工奖励函数。
  • 与现有框架兼容:支持 PyBoy、MetaWorld 等常用基准,可直接插入基于 OpenAI Gym/DMC 的训练流程。GitHub 仓库(rank-then-act)提供完整实现,便于集成。
  • 数据输入:只需收集少量成功任务视频,无需额外标注,适合企业已有视频资源的再利用。

具体落地用例

  1. 电商仓储机器人抓取:在物流仓库中,部署机器人进行货物分拣时,通常需要针对不同商品设计抓取奖励。利用 RTA,只需录制人工分拣的操作视频,即可训练机器人学习抓取顺序与放置位置,无需为每种 SKU 编写奖励函数,可快速适应新品类,降低系统集成成本。
  2. 自动驾驶中的演示轨迹学习:在自动驾驶仿真中,从人类驾驶的行车记录视频提取车道保持、变道、停车等行为的进度信号,用于训练规划或控制策略。这种无奖励的方式可避免设计复杂的安全约束奖励,同时在不同城市道路场景下复用进度评分器,加速策略迭代。

局限

  • RTA 高度依赖**专家视频演示**的质量。框架假设帧序列能够通过视觉语义反映出清晰的任务进展,若演示本身包含大量徘徊、循环或非单调动作(如探索性行为),序数评分器可能难以学到有意义的进度排序,从而破坏下游的秩相关性奖励信号。此外,视频中的遮挡、光照变化或视角偏移也会直接干扰 VLM 的排序学习,实际部署时需要对演示数据进行严格筛选或预处理,这在一定程度上限制了方法的即插即用能力。
  • **Spearman 秩相关奖励**虽然具有尺度不变和自校准的优点,但它要求每个交互窗口内的状态序列在时间上严格单调递增(即真实索引单调),这使其天然适用于具有明确正向进度推进的任务。对于需要往返、反复访问相同状态的场景(如仓库清理、来回搬运),相关性计算会给出低奖励甚至惩罚,可能误导策略放弃合理的回溯行为。同时,窗口长度的选择也带来敏感的超参数调优问题:过短则信息不足,过长则易包含非单调子序列,影响奖励的稳定性。
  • 目前实验仅在模拟环境上进行,包括**PyBoy**游戏和**MetaWorld**操作任务,缺乏在真实机器人系统上的验证。真实环境中视觉观测噪声大、动力学复杂,且专家演示通常更难获取,RTA 的直接迁移性能仍属未知。另外,预训练进度评分器的跨任务复用虽展示了初步潜力,但测试仍限于相近领域,跨域泛化的鲁棒性未得到系统评估,对复杂的长期任务能否保持有效信号有待进一步探究。
论文Yuriy Maksyuta2026-07-02原文

相关内容