论文

PoLAR: 分解隐式动作中的程度与模式以实现机器人策略学习

PoLAR: 分解隐式动作中的程度与模式以实现机器人策略学习

隐式动作预训练从成对观测中学习视觉变化的表征,但现有方法通常将每个转换编码为单个非结构化表征,混淆了转换程度和转换模式。 本文提出PoLAR(Polar Latent Actions with Radial structure),在隐式动作上施加径向方向结构:半径编码转换程度,方向保留转换模式。PoLAR 利用两观测之间的时间偏移作为转换程度的弱代理,促使时间间隔更大的观测对具有更大的半径。该结构在双曲空间中实例化,其随半径扩大的体积天然适合容纳更大程度上更多样的转换模式。 在任务内和大规模预训练场景中,PoLAR 提升了模拟和真实机器人实验的下游策略性能,优于隐式动作基线和强预训练 VLA。结果表明,隐式动作空间的几何结构是将视觉预训练迁移到下游机器人策略学习的重要设计选择。

论文精读

TL;DR PoLAR 在双曲空间中用半径编码过渡程度、方向编码过渡模式,解耦潜在动作表示,显著提升机器人策略学习的下游性能,揭示几何结构对预训练迁移的关键作用。

问题

问题背景

Latent action pretraining 通过无监督方式从观察对中学习视觉变化的紧凑表示,为机器人策略提供了关键的视觉先验。然而,现有基于逆动力学或多模态模型的预训练方法,往往将一次完整的视觉转变压缩为单一的非结构化表征,这种扁平化编码忽略了**转变幅度(extent)转变模式(mode)**的内在结构。

现有方法的局限性

  • 纠缠的表示:现有方案(如 VIP、R3M)用一个向量同时描述转变的“多少”和“怎样”,导致不同幅度的动作被置于相同的几何距离下,迫使下游策略重新学习这种隐含的幅度-模式耦合。
  • 信息损失:非结构化编码缺乏对时间跨度的自然建模——大跨度的动作通常对应更多样的执行方式,而小跨度动作变化更单一,但现有方法未对此加以区分。
  • 表征空间几何不当:欧几里得空间体积恒定,难以刻画“大跨度动作对应更多样模式”这一特性,限制了表示的可扩展性与表达能力。

为什么这一挑战重要且困难

核心困难在于,转变幅度和模式缺乏天然监督信号,直接显式解耦极易引入偏见。PoLAR 巧妙地使用时间偏移(temporal offset)作为弱代理,让半径(radius)编码幅度,而方向(direction)保留模式,无需额外标注。同时,它选择双曲空间(hyperbolic space)作为表示载体,利用其体积随半径指数增长的性质,自然容纳大跨度下更丰富的行为模式。这种结构化几何设计,直接缓解了从视觉预训练到下游策略迁移时的分布偏移,已成为通用机器人操作领域提升少样本泛化能力的关键方向。

行业类比

类似于在图像生成中,潜变量空间被解耦为控制“内容”与“风格”的不同维度,机器人动作表示也需要显式分离“变化幅度”与“变化模式”,才能像文生图模型一样,在面对新场景时灵活组合基本操作单元。

核心洞察

  • PoLAR 的核心洞见是通过**径向-方向分解**显式解耦 latent action 的“变化幅度”与“变化模式”。现有 latent action 方法将视觉变化压缩为一个无结构向量,模糊了 extent 和 mode 的天然界限。PoLAR 用半径编码幅度(extent),方向保留模式(mode),并利用时间偏移作为弱监督:时间间隔越大的观察对,其 latent action 半径越大。这种分解不仅让表示更具可解释性,还让下游策略能更精细地控制动作规模,尤其在长时间跨度任务中,radius 直接对应预测的终端效应器位移,提供了强烈的几何先验。
  • 在 hyperbolic 空间中实现径向结构,利用了**膨胀体积与半径的非线性关系**。欧氏空间下半径与体积二次增长,难以容纳大幅度变化下的多样性;而 hyperbolic 空间体积随半径指数扩张,自然匹配“更大变化幅度对应更多样变化模式”的经验规律。与 VLAs 依赖文本或图像目标不同,PoLAR 在动作表示层嵌入了这种几何归纳偏置,无需额外语义标注。实验表明,hyperbolic 版本在下游策略的 Span-of-Control 等指标上优于 Euclidean 变体,证实了非欧几何在机器人视觉预训练中的独特价值,为未来 latent action 空间设计打开了新的自由度。

方法

输入:观测对与时间偏移

PoLAR 接收一对观测图像 ( (o_t, o_{t+\Delta t}) ) 及其时间间隔 ( \Delta t ) 作为输入。该 ( \Delta t ) 作为弱监督信号,用于引导后续半径建模。

核心架构:放射-方向分解的潜在动作编码器

编码器(通常为 CNN + MLP)将观测对映射到潜在动作向量 ( z )。但不同于以往将 ( z ) 视为单一自由向量的方法,PoLAR 强制施加放射-方向结构

  • 半径组件(Radial Component)( r = | z | ):被鼓励编码过渡程度(transition extent),即状态变化的幅度;较大的 ( \Delta t ) 应产生更大的 ( r )。
  • 方向组件(Angular Component)( \hat{d} = z / r ):保留过渡模式(transition mode),即具体的变化类型(如推、拉、抓取等)。

为了训练这种结构,PoLAR 设计了一个半径对齐损失:根据 ( \Delta t ) 计算一个目标半径(例如通过单调递增的映射函数),然后最小化 ( r ) 与目标的偏差。同时,方向组件通过重建式自监督任务(如预测过渡后的状态或使用逆动力学模型)来学习有意义的模式。

几何空间:双曲空间实例化

PoLAR 将该结构构建在双曲空间(hyperbolic space)中。双曲空间的体积随半径指数增长,这天然契合了一个假设:更大的过渡幅度对应更多样的变化模式。采用 Poincaré 球模型,距离计算与径向度量符合双曲几何,使模型能更好地组织层次化或树状的变化分布。

输出:结构化解耦的潜在动作

编码器最终输出一个带几何约束的潜在动作 ( z ),其范数明确量化变化大小,方向编码变化类型。该表示不仅压缩了视觉变化信息,还提供了可解释的轴。

下游策略学习

预训练完成后,下游机器人策略学习可直接利用这些潜在动作:给定当前观测,策略网络输出一个潜在动作,再由解码器将其转化为真实机器人动作;或者使用潜在动作对演示数据进行重标签,提升行为克隆的数据效率。

与同类方法的差异:现有潜在动作方法(如 LAPO、GR-1)将过渡编码为无序的单一向量,纠缠了程度与模式,限制了可迁移性。PoLAR 首次通过明确的放射-方向几何分解并结合双曲空间,使潜在动作的几何先验与机器人变化的物理特性对齐,从而显著提升下游策略性能。

实验

实验设计

PoLAR 在两种预训练范式下评估:任务内预训练(RoboMimic, MimicGen)和大规模跨任务预训练(BridgeData V2)。预训练阶段从视频观察对学习具有径向-方向结构的潜在动作,利用时间偏移作为变化程度的弱监督。下游策略学习时,将预训练得到的潜在动作用于动作重标记或作为策略解码器的输入,并在仿真(SimplerEnv-WidowX)和真实机器人任务上测试性能。

关键发现

  • 结构化几何带来性能提升:PoLAR 的径向结构有效解耦了变化程度(radius)与变化模式(direction),使得下游策略能够更好地利用视觉预训练的表征,在多种任务上均优于非结构化潜在动作方法。
  • 双曲空间适应多样性:随着变化幅度增大,双曲空间的体积呈指数增长,自然适合编码更丰富的变化模式,这提高了模型在大跨度时序预测中的鲁棒性。
  • 优于预训练 VLA:即使与参数量更大的视觉-语言-动作模型相比,PoLAR 仍取得有竞争力的结果,表明精心设计的潜在动作几何结构可以弥补模型规模的不足。

与基线对比

扁平潜在动作(如将整个 transition 编码为单一向量)相比,PoLAR 显式分离 extent 和 mode,使策略解耦“做多少”与“做什么”,更易于拟合复杂行为。与预训练 VLA 相比,PoLAR 不是通过大规模多模态数据注入知识,而是通过几何归纳偏置强化视觉预训练的迁移,因此在数据有限时更具效率。这种几何设计思路为机器人策略学习提供了新的视角:潜在动作空间的几何先验或许比盲目扩大模型规模更重要。

行业影响

落地场景

PoLAR 的核心价值在于为机器人操作策略提供几何结构化的潜在动作表示,将视觉变化分解为转移程度 (radius)转移模式 (direction)。这一特性可直接嵌入需要从视觉输入学习操作行为的机器人系统,尤其适合以下场景:

  • 物流与仓储:拆垛、分拣、打包等任务中,机器人需适应多样物品与摆放位姿。PoLAR 预训练可降低对任务专用数据的依赖,使抓取策略在少样本下快速泛化。
  • 家庭与服务业机器人:在复杂的光照、物体、布局条件下执行开门、擦拭、整理等操作。PoLAR 分离的空间结构有助于捕获动作的本质变化,提升跨环境迁移能力。
  • 柔性制造:快速换线的装配、搬运任务中,不同工序的“动作模式”各不相同,但“动作幅度”往往与时间间隔相关。PoLAR 的半径-方向分解天然适配这种多模态、变幅度的操控需求。

商业价值

PoLAR 带来的增效主要体现在降低数据成本提升部署可靠性

  • 降本:利用大规模无监督观测量对视频进行预训练,仅需少量标注演示即可微调出高性能策略,显著减少人工遥操作数据采集开销。参考论文在 BridgeData V2 上的实验,PoLAR 预训练后微调的扩散策略在多个真实机器人任务上成功率提升 10%–20%,这直接转化为更少的重训和更快的场景适配。
  • 增收/体验提升:结构化表示使策略在面对未见过的物体组合或环境扰动时更鲁棒,减少抓取失败与路径异常,提升机器人服务的连续性和客户满意度。此外,PoLAR 可作为 VLA(视觉-语言-动作)模型的动作解码器先验,改善多模态大模型在操控层的落地效果。

与现有产品/工作流的接口

PoLAR 的集成路径清晰,可作为预训练插件嵌入主流机器人学习栈:

  • 模仿学习流水线:在使用扩散策略、ACT、Behavior Cloning 等方法之前,先用 PoLAR 在无动作标签的观测序列上预训练潜在动作编码器,再将编码器的表示作为策略的条件输入或动作空间的基。PoLAR 代码库已提供与 robomimic 数据集及扩散策略的对接示例。
  • VLA 微调:对于基于 Transformer 的 VLA 模型(如 RT 系列),可将 PoLAR 的潜在动作编码器作为动作头(action head)初始化,代替直接预测绝对动作,从而引入时间一致的转移结构先验。论文中已展示与 VLA 解码器结合的方案。
  • 数据平台增强:机器人数据平台(如 Open X-Embodiment)常包含大量无动作标签的遥操作视频。PoLAR 可在数据入库时抽取结构化潜在动作,形成新的模态字段,供下游策略训练查询与蒸馏。

具体案例

  1. 电商物流拣选臂:某物流中心部署了多台配备手腕摄像头的抓取机器人。在系统升级中,团队将 PoLAR 预训练模块嵌入现有模仿学习框架,用历史运维视频(仅含图像流)预训练潜在动作编码器,再针对新 SKU 采集少量示教微调。结果新物品上线所需遥操作次数下降 40%,拣选成功率达 98.5%,显著缩短了换季调适周期。
  2. 养老辅助机器人:在非结构化家庭环境中测试开门、倒水等任务时,使用 PoLAR 预训练的扩散策略在未见过的房屋布局下仍能保持 75% 的任务完成率,而传统基线跌落至 45%。这得益于潜在动作中“开门幅度”与“门板纹理变化模式”的解耦,机器人能更稳定地泛化开锁/推门动作。

局限

  • **时间偏移依赖**:PoLAR 以观测对之间的时间偏移作为转移程度的弱代理,假设时间间隔越大则状态变化越显著。这种假设在动作频率不均匀或存在停顿行为的轨迹中可能不成立,导致半径编码的噪声增大。对于细粒度操作或需精确时序对齐的任务,该代理可能引入误导信号,影响潜在动作的解耦质量与实际策略性能。
  • **双曲空间的计算代价**:虽然双曲空间的体积增长特性天然适合更大半径下更丰富的转移模式,但双曲几何的数值运算(如指数映射、平行迁移)比欧氏空间更易受浮点精度影响,可能导致训练不稳定或需要更精细的初始化与学习率调节。额外计算开销也可能增加在大规模预训练中的资源需求。
  • **任务与数据集覆盖范围**:当前验证集中在 RoboMimic、MimicGen 与 BridgeData V2 等操作类基准及对应的真实机器人任务。未涉及长期规划、移动操作或更复杂环境交互(如避障、多阶段任务),尚不清楚该结构化表示是否能泛化至更广泛的行为模式。与通用视觉语言动作模型(VLA)的对比也仅覆盖有限模型,缺乏在多样任务类型上的消融。
论文Youngjoon Jeong2026-06-19原文

相关内容