论文

Foresight: 基于动作条件世界模型潜变量的长期机器人操作故障检测

Foresight: 基于动作条件世界模型潜变量的长期机器人操作故障检测

长期机器人任务(如多步操作)中的故障检测面临两大难点:故障信号出现时机模糊且缺乏密集时间标注。现有方法多依赖手工特征或密集监督,难以推广。 我们提出Foresight框架,利用动作条件世界模型在轨迹执行过程中提取潜变量表示(action-conditioned world model latents),以监测操作是否偏离成功轨迹。该方法仅需最终任务级成功/失败标签训练,无需中间帧标注。通过功能共形预测(FCP,functional conformal prediction)自适应校准检测阈值,实现跨不同策略的统一故障检测。 在LIBERO-Long、ManiSkill-Long和BEHAVIOR-1K三个仿真基准上,Foresight与最新的视觉-语言-动作策略(vision-language-action policies)结合,对比SOTA故障检测方法均取得更优结果。真实机器人实验中,分别在ReactorX-200机械臂(3个长期任务)和Franka机械臂(1个任务)上验证了方法的有效性。结论表明,动作条件世界模型嵌入为长期操作中的可靠故障监控提供了可扩展的表示方案。

论文精读

TL;DR Foresight 通过动作条件世界模型的预测潜在表示与功能共形预测,仅需最终成败标签即可实现长时域机器人操作故障的实时检测,具备跨策略泛化能力。

问题

问题背景

长周期机器人操作任务(如整理房间、多步装配)是真实部署的常见场景。然而,针对此类任务的故障检测研究仍相对滞后。随着视觉-语言-动作(VLA)策略的进步,机器人可执行数百步的任务,但一旦中途出错,缺乏有效监控将导致任务失败且难以恢复。业界亟需一种仅依赖最终成功/失败标签即可对任意策略进行实时故障监测的通用方案。

现有方法的局限

当前故障检测方法主要分为三类,均存在明显不足:

  • 基于单步监督学习:需要密集逐帧人工标注异常帧,在长周期任务中成本极高,且故障的起始时刻往往模糊难定义。
  • 基于成功率预测:直接使用历史图像序列预测最终结果,但缺乏对动作影响的显式建模,难以区分策略固有偏差与环境异常,泛化性弱。
  • 基于重建误差:利用视频预测模型的重构残差判异,对视觉噪声敏感,且在跨策略场景中易因分布偏移产生大量误报。 这些方法普遍假设训练与测试策略相同,无法应对策略切换或零样本升级,与实际部署中的多策略混合场景脱节。

为什么该问题重要且困难

长周期故障检测的核心挑战在于早期信号弱、标签稀疏策略多样性的并存。早期失败迹象(如物体微小位移)易被忽略,而仅有的稀疏终局标签迫使检测器必须从弱监督中学习时序关联。同时,不同 VLA 策略的轨迹分布差异巨大,如何构建一个策略无关的表示空间是关键难点。从工程价值看,可靠的故障检测能提升自主系统在无人值守时的鲁棒性,降低因中途失败导致的安全风险与重复计算成本,是机器人从实验室走向规模化部署的必要组件。

行业类比

类似自动驾驶中的碰撞预警系统,在长程任务里,故障检测相当于“提前刹车”,让机器人在无法挽回前主动停止或请求干预,而非被动等待全局任务崩溃。

核心洞察

  • **世界模型的预测性潜在表示提供了比原始观测更前置的故障信号。** 不同于常规的基于当前状态的故障检测,Foresight 提取动作条件未来状态的隐嵌入,这些嵌入编码了“执行动作后即将发生什么”的信息,因此能够在实际失败发生前更早地识别风险。这比直接用观测图像或低级状态特征的方法更有预见性,因为世界模型学会了模拟动态规律,其内部表示天然聚焦于趋势性偏差。
  • **仅靠任务最终成功 / 失败标签即可训练,免去了昂贵且主观的逐帧标注。** 长期任务中,失败究竟发生在哪一帧往往模糊且标注成本极高。Foresight 利用函数型共形预测,将检测问题转化为对嵌入序列的异常检测,并通过校准非共性比来自动设定阈值。这使得方法能够直接在稀疏监督下工作,无需人工判断故障起始点,比需要密集时序标注的基线(如需要标注故障瞬时点的监督学习)大大降低了数据准备门槛。
  • **跨策略泛化得益于世界模型嵌入的任务无关性。** Foresight 不依赖策略内部结构,而是基于对环境的通用动态预测,因此同一个检测器可以监控不同 VLA 策略(如 π0.5、GR00T 等)的执行,而无需为每个策略重新训练。这区别于策略特定型故障检测器,后者在更换底层策略时往往失效。

方法

输入与表示

Foresight 的输入为机器人操作轨迹,包括 RGB 图像观测序列和对应的动作序列。系统不依赖任何密集的逐帧失败标注,仅需要任务结束时整体的成功或失败标签

关键模块

1. 动作条件世界模型特征提取

采用预训练的 动作条件世界模型(如 Cosmos-Predict),输入当前图像和动作,生成对下一时刻的预测,并提取其预测阶段的潜在表示。这些嵌入编码了“给定动作后环境将如何变化”的动态信息,相比单纯的状态编码,对动作执行效果异常更敏感。

2. 因果序列模型失败打分

将世界模型提取的潜在表示序列输入一个因果序列模型(例如单向 Transformer 或 TCN)。该模型对每个时间步输出一个连续失败分数,反映当前轨迹偏离成功模式的程度。训练时,利用整个序列的最终标签进行监督:成功轨迹鼓励所有分数趋近 0,失败轨迹则惩罚高分数的时间步。损失函数采用 序数回归或对比损失,确保对异常片段产生高响应。

3. 功能符合预测阈值校准

为避免固定阈值对任务和策略的敏感性,引入 Functional Conformal Prediction (FCP)。在留出的校准集上,FCP 基于失败分数的经验分布,自适应生成与用户指定风险水平 α 对应的检测阈值。这使得在早期检测和高准确率之间取得平衡,且提供统计意义上的决策置信度

输出

在线部署时,对于每个新到来的时间步,系统实时输出失败与否的二元决策以及校准后的置信度。该框架跨不同策略(如 VLA 模型)共享世界模型和检测器,实现统一监控。

差异点

与传统失败检测方法依赖手工定义误差状态或逐帧标注不同,Foresight 通过学习动作条件的预测性表示和仅使用任务级标签,在长时序任务中实现了可扩展的异常检测,并引入 FCP 提供自适应阈值,降低跨任务调参成本。

实验

实验设计概述

Foresight 在 三个长序列仿真基准(LIBERO-Long、ManiSkill-Long、BEHAVIOR-1K)以及 真实机械臂(ReactorX-200 三个任务、Franka 一个任务)上验证失败检测能力。评估结合 SOTA 视觉-语言-动作策略(如 ACT、π0.5、GR00T N1.5),仅使用最终任务成败标签训练,不依赖密集时序标注。核心流程为:

  1. 冻结的 动作条件世界模型(Cosmos-Predict)提取观测-动作对的预测隐表示;
  2. 因果序列模型(如 Transformer)对隐序列进行失败打分;
  3. 功能共形预测(FCP) 自适应校准决策阈值,控制误报率。

关键发现

  • 动作条件隐表示显著优于隐状态:消融实验表明,相比直接使用世界模型的隐状态,动作条件预测的隐特征 在 ROC-AUC 与 Balanced Accuracy 上均有提升,验证了预测性表征对失败前兆的敏感度。
  • 跨策略泛化性强:Foresight 作为独立于策略的监控器,在 ACT、π0.5、SmolVLA 等不同策略下均保持稳健的失败检测性能,无需针对特定策略微调。
  • 真实环境可靠滚动监控:在长序列操作中,Foresight 能在失败发生早期发出预警,且 FCP 阈值提供了严格统计保证,避免过度误报。

基线对比解读

端到端失败分类器基于重构误差的方法 相比,Foresight 仅需任务级标签,数据需求低得多。其核心优势源自 预测世界模型嵌入 蕴含的前向动态信息,使模型能捕捉与任务无关的异常模式。同时,FCP 替代固定阈值,使得检测在长序列的不同阶段可自适应调整灵敏度。实验表明,该方法在长序列任务上一致优于现有 SOTA 失败检测方法,尤其在高噪声、多步骤任务中鲁棒性突出。

行业影响

落地场景

Foresight 提供的长程机器人操作故障检测能力,可直接嵌入各类需要长时间自主运行的机器人部署中,如仓储物流的货物分拣、电商仓库的订单履行、制造业的柔性装配线,以及服务机器人在酒店、医院等场景的多步骤任务。在这些场景中,机器人执行的动作序列可能长达数十步,任务级成功反馈稀疏,Foresight 能实时监控轨迹、提前预警异常,避免任务完全失败后才被发现。

商业价值

  • 降低运营成本:减少人工监控与干预频率,避免因故障未及时发现导致的物料浪费、设备损坏和生产停工,尤其对 24/7 运行的自动化产线意义重大。
  • 提升系统吞吐:实时故障检测使系统能快速触发重试或恢复策略,缩短任务中断时间,提高整体作业效率。
  • 增强跨策略适配:基于动作条件世界模型的潜表示不依赖特定策略,可统一不同 VLA 策略(如 π0.5、GR00T N1.5)的故障监控,便于企业在多源机器人平台或策略升级时复用,降低维护成本。

与现有产品 / 工作流的接口

Foresight 设计为轻量级在线监控模块,可无缝集成到现有机器人软件栈:

  • 它仅需从推断阶段的世界模型获取隐状态,无需额外密集标注,只需任务级成功/失败标签。训练过程可离线进行,产出故障评分模型校准阈值
  • 部署时,模块持续接收策略输出(观测、动作),并行推断故障概率,并通过 FCP 动态阈值输出告警信号。该信号可直接对接 ROS 的 diagnostic_aggregator 或自定义决策引擎,触发安全的停止、人工请求或策略回退。
  • 世界模型可采用 Cosmos-Predict 等基础模型,与现有基于世界模型的规划或仿真框架共享特征提取,减少冗余计算。

具体落地用例

  • 电商仓库拣选系统:在大型履约中心,移动操作臂执行“分拣—放置—打包”的长程任务。Foresight 监控每一次抓取和移动,一旦检测到抓取不稳定或放置位姿偏移,立即暂停并请求视觉重定位,避免错误包裹流出,显著降低退货率。
  • 制造装配中的自适应重试:在汽车部件装配线上,机器人需按特定顺序拧紧螺丝、插入连接器。当 Foresight 检测到操作偏离预期时,可触发细粒度的恢复策略(如重新对准、力控搜索),而不用等待整个装配序列完成后才发现错误,节省大量线体节拍。

局限

  • Foresight 依赖预训练的动作条件世界模型提取潜在表示,训练此世界模型本身需要大量数据与计算资源,可能限制其在新环境或不同机器人平台上的快速部署。此外,世界模型的泛化能力若不足,可能影响失败检测的准确性。
  • 方法仅使用最终任务级成功/失败标签进行训练,没有利用更细粒度的时间标注,因此可能难以检测到细微的或渐进的失败过程,而对突然的灾难性失败更敏感。在需要精确阶段监控的任务中可能不足。
  • 实验虽然覆盖三个仿真基准和两个真实机器人平台,但任务种类和规模有限(最多20个长时域任务),且评估的策略主要是VLA模型(ACT, π0.5等),对更多样化的操纵策略和非桌面场景的泛化仍需验证。
论文Haoran Zhang2026-06-22原文

相关内容