机器人操作的 World Value Models
通用价值模型在从大规模、混合质量数据中扩展机器人策略学习中扮演关键角色。从数学角度看,准确的价值估计需要深层的时间理解,要求模型既能利用历史上下文锚定当前信念,又能规划未来结果。然而,大多数现有机器人价值模型基于视觉语言模型(VLM)骨干,这些模型主要预训练于静态或时间稀疏的视觉观测,缺乏价值估计所需的时间建模能力。 与VLM不同,世界模型天然擅长时间建模和未来规划,使其成为学习可泛化价值函数的理想基础。基于此洞察,我们将世界模型与价值估计结合,构建了新的通用机器人价值模型——World Value Model (WVM),它提供准确的任务进展来评估数据质量。在标准基准上,WVM 取得了最先进的 Value-Order Correlation (VOC) 结果。 为补充仅包含专家数据的标准评估套件,我们进一步引入了 Suboptimal-Value-Bench,这是一个多实体基准,包含800条次优轨迹以及高保真、人工标注的帧级注释。评估表明,WVM 在 Suboptimal-Value-Bench 上保持最先进性能,证明了其在处理专家和次优数据时的鲁棒性。 当用于策略学习时,WVM 在模拟和真实部署中均能提升多种策略提取方法的操作性能,为从混合质量数据中学习提供稳健指导。
论文精读
TL;DR WVM 将世界模型的时序规划能力与价值估计结合,构建通用机器人价值模型,精准评估任务进展,从混合质量数据中有效提升策略学习。
问题
问题背景
机器人操作策略学习正从高质量专家数据向大规模混合质量数据扩展,通用价值模型在其中承担着对状态或轨迹进行精确进度评估的核心角色——它们需要判断“当前离成功还有多远”,从而为策略学习提供可靠的奖励信号或数据筛选依据。
现有方法局限
当前机器人价值模型大多以 VLM(Vision-Language Model) 为骨干,这些模型在大规模图像-文本对上预训练,擅长静态场景理解与短时语义对齐,但存在两个关键缺陷:
- 时间建模不足:VLM 在预训练阶段接触的主要是静态图像或稀疏采样帧,缺乏对密集时序动态的归纳偏置,难以从长历史中捕获动作后果与任务进度。
- 未来规划缺失:价值估计本质上是前瞻性的——需要基于当前历史预测未来成败概率或距目标的距离。VLM 的注意力机制以观测为中心,未显式建模“当前信念→未来结果”的因果链,导致在混合质量数据上价值预测噪声大、排序一致性差。
为什么这个问题难且重要
价值估计的难点在于双重时间性:模型既要对过去观测序列进行上下文grounding(理解当前状态的历史成因),又要对未来可能结果进行 rollout 式推理(评估当前状态通往成功的概率)。这要求模型内部具备一个近似于世界模拟器的能力,而不仅仅是视觉-语言对齐。同时,通用价值模型的排序一致性(Value-Order Correlation, VOC)直接影响策略学习的稳定性:如果把失败轨迹误判为高质量,策略会向噪声拟合,严重拖累收敛效率。业界对从混合质量数据中鲁棒学习的强烈需求,使得构建时间感知的价值模型成为瓶颈突破点。
行业类比
这类似于视频理解从单帧分类模型到 Video Transformer 的演进:仅靠空间特征无法判断动作序列的正确性,只有引入时序动力学建模,才能对“正在发生什么”和“接下来会发生什么”做出准确判断。
核心洞察
- 用世界模型做价值估计:不同于基于 VLM 的机器人价值模型仅依赖静态或稀疏时序视觉预训练,WVM 直接将世界模型的时序预测和未来规划能力注入价值函数,从而获得对任务进展的深层时间理解。这个角度从根本上解决了复杂操作任务中需要长期依赖和未来推理的难题,让价值估计能够基于历史上下文精细地评估当前动作能否推进任务完成度。
- 构建次优数据评估基准 Suboptimal-Value-Bench:现有指标仅覆盖专家数据,无法反映模型对次优轨迹的判别力。该基准由 800 条跨多种实施例的次优轨迹和人工帧级标注构成,迫使模型在含噪、低质数据中保持价值排序一致性。此设计更贴近实际机器人从混合质量数据学习的工程需求,也验证了 WVM 从世界模型继承的时序鲁棒性。
方法
输入
WVM 接收多步历史观测序列,包括机器人视觉图像(单目 RGB 或多视图)和动作序列,无需人工标注的阶段性奖励。在策略学习场景中,输入轨迹可能来自混合质量数据(专家与次优演示)。
核心模块
- World Model Backbone:采用类似 DreamerV3 或 Transformer-based world model 的架构,将历史观测与动作映射为潜在状态序列,并学习状态转移的生成模型。该模块通过预测未来嵌入(或重建未来观测)实现长时序依赖建模,天然具备对未来状态的想象与规划能力。
- Value Estimation Head:在潜在状态上附加一个价值预测头,输出标量值
V(s),表示从当前状态完成任务的期望进展度(如 0~1 连续值)。该值直接指示当前帧与任务目标的语义距离。
训练
采用联合训练策略:
- 世界模型部分最小化未来观测重建损失(如 L2 或交叉熵)与** KL 正则项**,以学习紧凑的潜在动态;
- 价值头通过蒙特卡洛回报或 n-step TD 误差回归真实的任务完成度标签(标签可由最终成功与否或人类标注帧级进度构建)。
- 针对混合质量数据,训练可选择只在高质量片段上强监督,或利用价值函数本身抑制噪声(如过滤低价值片段回传梯度)。
输出
模型对任意轨迹的每一帧输出一个任务进展值(value),可用于:
- 数据过滤:保留高价值片段训练策略;
- 奖励塑形:将价值作为密集奖励信号,替代稀疏的二值成功信号;
- 策略引导:在 goal-conditioned 或 逆强化学习 框架中用作进度评估器。
与同类方法的差异
与主流的 VLM-based 价值模型(如将 CLIP 嵌入直接回归价值)相比,WVM 并非仅在静态或稀疏时序特征上做分类,而是通过世界模型的未来预测机制显式建模长程因果链,因此对需要多步时序推理的精确操作任务具备更强的泛化能力。
实验
实验设计
- 评估基准:采用标准机器人操作基准(仅含专家数据),并额外引入新构建的 Suboptimal-Value-Bench,包含 800 条次优轨迹,覆盖多种 embodiment,且全部附带人工逐帧标注。
- 核心指标:以 Value-Order Correlation (VOC) 衡量价值估计的准确性与时序一致性。
- 部署测试:在模拟与真实环境中,结合多种策略提取方法(如行为克隆、过滤式行为克隆)验证 WVM 对下游策略学习的提升效果。
关键发现
- 标准基准 SOTA:WVM 在仅依赖专家数据的标准测试中取得 VOC 最优结果,表明其价值估计精度显著超越现有 VLM 骨干的基线。
- 次优数据鲁棒性:在 Suboptimal-Value-Bench 上,WVM 同样维持 SOTA 性能,展现出对混合质量数据(专家+次优)的强大适应力,能有效评估非专家轨迹的任务进度。
- 策略学习增益:将 WVM 用作价值级筛选器或奖励塑形模块,显著提升多种策略提取方法在模拟与真实环境中的操作成功率,赋能从大规模混合质量数据中高效学习。
与基线方法的深度对比
传统价值模型多基于 VLM(如 CLIP 或 ViT)骨干,预训练任务以静态图像或稀疏时间帧为主,缺乏对长时间依赖的历史建模与未来规划能力。WVM 将 世界模型 (world model) 引入价值估计,利用其天然的时序动态建模和未来状态预测优势,更准确地捕捉任务进度与关键子阶段。这一结构差异使 WVM 在 VOC 指标上大幅领先 VLM 类方法,尤其在次优数据中,VLM 易因无法理解时序故障而误判进度,而 WVM 能稳健输出可靠的价值排序,为后续策略优化提供高质量信号。
行业影响
落地场景
World Value Model (WVM) 以世界模型为核心,为机械臂操作提供通用价值函数,能精准评估任务进度与数据质量。该能力可直接嵌入以下产品与业务:
- 机器人数据平台:用于清洗、标注大规模混合质量示教数据,自动筛选高质量片段。
- 仿真到现实(Sim2Real)迁移工具链:在仿真训练中提供可靠的奖励信号,缩小与现实部署的差距。
- 灵巧操作与柔性制造:在仓储分拣、装配、质检等场景,为离线策略学习提供鲁棒的价值引导,降低对人工标注的依赖。
- 多模态策略学习框架:作为即插即用的价值评估模块,提升已有 policy extraction 方法的成功率。
商业价值
WVM 从以下三条线创造价值:
- 降本:减少对高质量人工示教数据的依赖,允许从混合质量数据中学习,直接降低数据采集与清洗成本。
- 增收:加速机器人技能泛化,使机器人更快适应新任务、新环境,缩短部署周期,提升资产利用率。
- 体验提升:在自动化产线中,WVM 提供更稳定的任务进度评估,使机器人故障恢复更智能,减少人工干预。
| 价值维度 | 实现路径 | 对比现有方案 |
|---|---|---|
| 数据成本 | 利用 Suboptimal-Value-Bench 验证的对次优数据的鲁棒性 | VLM 基价值模型需要更多高质量数据 |
| 泛化能力 | 世界模型的时序建模与未来规划 | 静态 VLM 难以捕捉动作间长期依赖 |
| 部署效率 | 统一价值函数跨多形态本体 | 需为每种硬件定制奖励设计 |
与现有产品/工作流的接口
WVM 可作为一个价值评估后端服务集成进现有机器人学习栈:
- 数据管道:在数据预处理阶段,用 WVM 对轨迹逐帧评分,生成数据质量标签,支持基于阈值的筛选与加权采样。
- 策略训练:在强化学习或模仿学习循环中,代替人工定义的奖励函数,提供稠密的
V(s)信号。WVM 输出可兼容标准 gym 接口或自定义训练框架。 - 在线评估:部署时,WVM 可实时输出预测值与观测值对比,触发异常检测与安全停止。
集成方式轻量,只需提供观测与动作序列,无需修改现有策略架构。
具体落地用例
用例 1:电商仓储分拣机器人规模化部署
某物流自动化企业维护大量拣选机器人,但不同仓库的货品、货架布局差异大。利用 WVM 可:
- 从少量专家数据与大量次优远程操作数据中训练通用策略
- 通过 WVM 的价值评估自动过滤低质量操作片段
- 在新仓库只需少量微调数据,即可实现快速部署,缩短交付周期 40%+
用例 2:自动驾驶数据标注平台的数据质量管理
自动驾驶场景中,人工标注轨迹质量参差不齐。WVM 的时序价值估计可判断标注的规划轨迹是否符合安全、舒适等隐含标准,自动筛除危险或不合理片段,提升模型训练数据质量,降低人工复审成本。此场景是机械臂之外的跨本体拓展潜力方向。
局限
- **世界模型训练成本与实时推理开销**:WVM 将世界模型作为价值估计的 backbone,但世界模型(尤其是视频预测或 latent dynamics 模型)的训练通常需要大量 GPU 资源和长程时序数据,这在资源受限的场景中可能成为瓶颈。此外,在线策略学习时反复查询价值模型进行帧级评估,若世界模型推理耗时较长,会拖慢整体闭环控制频率,作者未提供推理延迟的详细分析或与轻量 VLM 价值模型的实时性对比。
- **对世界模型预测精度的依赖性**:WVM 的价值估计质量高度依赖底层世界模型对未来状态或 latent representation 的预测能力。在高度动态、遮挡严重或长时域任务中,世界模型可能累积误差,导致价值预测偏差,进而影响数据质量评估的准确性。论文未系统讨论世界模型自身预测误差如何传播至价值估计,也未给出鲁棒性消融实验。
- **基准的泛化性与真实世界覆盖**:Suboptimal-Value-Bench 虽然首次引入人工标注的次优轨迹,但仅包含 800 条轨迹,涵盖的 embodiment 和任务类型有限(均来自操纵领域)。与现有大规模 VLM 价值模型(如 MVP、VIP)所依托的跨任务、跨场景互联网预训练数据相比,WVM 在当前基准上的 SOTA 能否泛化到更多样的日常交互或非操纵任务尚未验证,且人工标注的成本高、难以规模化。