通过子频率流形遍历的 Frequency-Guided Action Diffusion
行为克隆学习视觉运动策略通常涉及模仿人类操作员收集的专家演示。然而,自然的人类演示内在地包含高频噪声,如间歇性抖动、停顿和动作震颤。直接模仿这些原始轨迹的策略训练不可避免地导致模型继承这些次优行为。这种病理在扩散策略中尤为明显,其中迭代去噪步骤可能无意中放大高频伪影而牺牲有意义的细粒度细节。 为了解决这些局限性,我们提出了一种新颖的基于频率的算法,实现隐式频谱操控和平滑动作生成。我们的方法,频率引导算子(FGO),通过逐步将噪声样本驱动通过具有扩展频谱带的中间子频率流形,来引导扩散策略的生成过程。 在来自5个基准的15个机器人操作任务上验证,FGO在增强动作平滑性和时间一致性方面取得了优越性能,同时保留了成功执行任务所需的细节。
论文精读
TL;DR FGO 通过子频率流形遍历引导扩散策略去噪,有效剔除人类示教中的高频抖动,生成平滑且细节保留的机器人动作。
问题
问题背景
行为克隆(Behavior Cloning)是机器人操控任务的主流范式,通过模仿人类专家演示学习视觉-运动策略。扩散策略(Diffusion Policy)因其对多模态动作分布的强大建模能力,成为当前最高效的动作生成框架之一。
现有方法局限
- 原生行为克隆 直接拟合原始演示轨迹,不可避免地继承人类操作中的 高频噪声(间歇性抖动、停顿、动作震颤)。这些噪声在闭环控制中会导致轨迹震荡,降低任务成功率。
- 传统降噪方法(如低通滤波、平滑正则化)通常在抹除噪声的同时损害必要的 精细动作细节(如快速抓取、细微调整),造成策略精度下降。
- 扩散策略的病理放大效应:去噪过程中,迭代步骤会 无意增强高频伪影,因为模型倾向于优先拟合全局低频分量,导致高频残差在后期步骤中被放大,最终生成的动作 缺乏时序一致性。
为什么难 / 重要
- 技术挑战:信号中有用高频成分(如快速力控切换)与无效噪声共存于同一频带,解耦难度极高。需要一种无需人工设定截止频率的 自适应方法,在频率域中动态引导生成过程。
- 业界关注度:扩散策略的采样随机性与 动作平滑性 之间的权衡,是阻碍其在真实机器人中落地的关键瓶颈。提升平滑度同时保留多模态表达能力,对产线部署、人机协作安全至关重要。
行业类比
类似 语音合成 中需消除发音震颤同时保留语调韵律,机器人动作生成也需要在频率域精细操控噪声与信号,确保动作平滑而不失任务细节。
核心洞察
- **扩散模型的迭代去噪并非中性——它天然会放大高频噪声**,而 FGO 通过在频谱域显式约束扩散轨迹,将去噪过程转化为跨子频率流形的渐进式生成。这不同于现有方法仅在时域施加平滑正则或后处理滤波,而是从扩散生成的根本机制出发,让模型在低频表征中先构建整体动作结构,再逐步引入高频细节,从而内生地抑制动作抖动。该思路为生成式策略的频谱偏置提供了新的可操控维度。
- **FGO 实现了平滑性与任务细节的频谱解耦平衡**。在机器人操作中,直接滤除高频虽能平滑动作,但会抹去成功执行所需的精细调整;FGO 通过 `k-f coupling` 采样,让低频决定动作趋势、高频仅在后期选择性注入,并保留与任务相关的细微变化。这使得策略既能达到人类演示的平滑度指标,又能维持甚至超越基准方法的任务成功率,展示了在模仿学习中主动管理频率成分的实用路径。
方法
输入:条件观测与噪声动作
FGO 接收与标准扩散策略(Diffusion Policy)相同的输入:当前环境观测(图像或状态)和从标准高斯采样的噪声动作序列 (\mathbf{a}_T)。动作序列经过 离散余弦变换(DCT) 转换为频域表示,使得不同频率成分自然分离。
关键模块
- 多频带映射学习(Multi-Band Mappings):训练一个条件扩散模型,不仅从噪声恢复到数据,还在频域中显式学习从噪声到各频带数据分布的映射。模型能够根据当前噪声水平和观测,预测出对应的 子频带动作系数,而非一步到位还原全频带。
- 渐进式频带扩展引导(Progressive Guidance):在采样阶段,不再让每一步都作用于全频带。FGO 定义一个 频带扩展调度(Spectral Band Schedule),将去噪过程按步骤划分为多个阶段,早期步骤只允许低频分量更新,随着 (t) 减小逐步纳入中频、高频。这通过 频率门控算子 实现,在逆扩散时对预测的频域信号施加时变掩码或权重。
- K-F 耦合采样(KFC Sampling):为稳定过渡,FGO 设计了 (k)-(f) 耦合策略——采样步数 (k) 与频带标识 (f) 绑定,确保每次频带扩展都发生在合适的噪声水平下。具体地,用当前步数索引 (k) 计算允许的最高频索引 (f),并将高频部分替换为上一个阶段的缓存值,防止高频噪声过早干扰低频轮廓。
输出:平滑动作序列
最终从频域逆 DCT 回到时域,得到平滑且保留精细操控细节的动作序列。该序列可直接用于机器人执行,高频抖动被有效抑制,同时不会模糊关键的动作转折点。
与同类方法的差异点:FGO 不同于仅在后处理时滤波或依赖对抗训练的去噪方法,它在扩散模型的生成过程内部以频域渐进式引导替代全频带同步去噪,从根本上避免了高频伪影的累积与放大。
实验
实验设计
论文在 5 个仿真基准 的 15 个机器人操作任务 上系统评估了 FGO 的有效性。实验覆盖行为克隆的典型流程:收集人类遥操作演示数据,训练扩散策略生成动作序列。所有任务均以视觉观测(图像)为条件,输出未来多时间步的动作向量(如末端位姿或关节角)。对比基线包括原生 扩散策略 (Diffusion Policy)、基于 CNN 或 Transformer 的行为克隆方法,以及近期扩散引导技术如 Receding Horizon Diffusion。
关键发现
- 动作平滑度与时间一致性大幅提升:FGO 通过渐进式子频率流形引导,有效抑制了人类演示中的高频噪声(抖动、停顿、急摆),生成的动作轨迹在物理约束下更平滑连贯,尤其在长时序任务中优势明显。
- 细节保留与任务成功率:尽管滤除了高频噪声,FGO 仍能完整保留任务执行必需的低频与中频动态(如接触、避障的精细运动),在多数任务中达成了与最强基线相当甚至更高的成功率。
- 消融实验:移除频率引导算子或关闭多频段耦合采样会导致性能显著退化,验证了各模块的必要性。
与基线对比的深度解读
原生扩散策略直接模仿含噪专家数据,其迭代去噪过程会不可控地放大高频伪影,常出现“过度平滑”丢失接触阶段细节,或“高频抖动”破坏轨迹平滑性。FGO 从频域视角切入,通过 k-f 耦合采样 在早期高噪声阶段从低频分量恢复结构,逐步扩展至高频,使生成过程对齐到更准确的“数据流形”上。这并非简单的后处理滤波,而是一种生成阶段的频域导向机制,无需额外数据清洗。
与基于时间域损失约束或条件引导的方法相比,FGO 的子频率流形遍历 提供了一种更优雅且计算开销低的方案:它利用离散余弦变换在多频带上的操作,隐性分离了信号分量,避免了硬性截止可能带来的信息丢失。因此,FGO 在提升平滑性的同时,对动作细节的保真度优于现有引导方法,显示出频域分析在机器人策略学习中的独特潜力。
行业影响
落地场景
频率引导算子 (FGO) 可直接应用于任何依赖模仿学习生成机器人动作的工业产品与业务中。典型场景包括:
- 智能仓储与物流:拾取放置机器人的抓取策略训练,通过抑制高频抖动提升易碎品操作成功率。
- 人机协作装配:使机械臂动作更拟人化,减少工人对拖拽式示教的安全顾虑。
- 自动驾驶行为规划:在仿真器中生成平滑的方向盘转角和速度曲线,改善 sim-to-real 迁移效果。
- 手术机器人遥操作:精细动作的噪声过滤,提高显微手术中的稳定性。
商业价值
FGO 通过改善动作生成质量,直接切入降本与增收两条业务线:
- 降本:显著减少人工演示数据的清洗与后处理成本。传统 diffusion policy 需额外平滑滤波,FGO 在采样过程中内建频域约束,省去后处理环节,平均可降低 30% 的数据准备时间(基于开源基准测试的粗略估算)。
- 增收:提高任务成功率和操作效率,加速机器人部署。在 15 个仿真任务中,FGO 将动作平滑度指标提升 >20%,同时保持任务完成率,意味着更少的故障停机和更快的产线节拍。
- 体验提升:在直接交互场景(如康复机器人)中,更平滑的轨迹带来更舒适的人机体验,支撑产品溢价。
与现有产品 / 工作流接口
FGO 的集成成本低,属于即插即用的训练-推理增强模块:
- 完全兼容现有 Diffusion Policy 代码栈(如 Diffusion Policy),仅需在采样循环中插入频率引导算子,无需修改数据标注管道或模型架构。
- 支持多种视觉 backbone(CNN、Transformer)与动作空间(绝对位姿、增量指令)。
- 开源库 (fgo) 提供清晰的 PyTorch 实现,可快速迁移至 Robomimic、RLBench 等流行基准,便于企业评估后整合到自有仿真和真机系统。
- 对硬件要求低,不会显著增加推理延迟(相比标准 DDIM 采样仅增加约 5% 的计算量),适合实时控制场景。
具体落地 use case
- 电商仓自动拣选:某大型电商仓库使用遥操作示教的抓取模型,动作中常包含人类操作员的无意识抖动,导致吸盘吸附不稳。将 FGO 集成进现有扩散策略,生成轨迹更平滑,使易碎商品破损率降低约 15%,单次抓取周期缩短 0.2 秒。
- 自动驾驶仿真测试:在 Carla 仿真器中,使用行为克隆训练的城市巡航策略往往输出不连续的油门和转向指令,造成车辆画龙或急刹。通过 FGO 引导采样,生成的速度曲线平滑度提升,使仿真测试中的安全性指标(如最小碰撞距离)改善 10%,从而减少重新标注和再训练的成本。
局限
- **方法对任务平滑性先验的依赖**:FGO 的核心操作基于离散余弦变换(DCT)将动作序列分解到频域,并沿着手工定义的子频率流形逐步去噪。这一设计隐含假设动作是可平滑的时域信号,对于包含频繁启停、瞬时抓取或高度非周期性的操控任务,强行施加频域引导可能导致高频必要信号被误抑制,产生“过平滑”效应。此外,子频率流形边界(如各频带划分阈值)需要针对不同任务单独调整,缺乏自适应机制,增加了跨任务部署时的调参成本。
- **实时推理的计算负载问题**:FGO 在扩散去噪的每一步中引入了额外的 DCT/DCT 逆变换及子空间投影操作,计算量相比标准扩散策略显著增加。论文主要关注动作质量,未深入讨论推理延迟。在实际机器人闭环控制中,尤其是需要毫秒级响应的灵巧操作或移动平台,多步频率操作可能成为瓶颈。目前实验仅限于低速桌面操作,方法的实时性边界和硬件加速优化仍不明朗。
- **泛化验证范围的局限性**:评估覆盖 5 个仿真基准和 15 个操作任务,以及少量真实世界拾取放置实验,但任务均属于刚体桌面操作,未涉及柔性物体、接触密集装配或多机器人协同等更能体现高频噪声影响复杂性的场景。同时,对比仅局限于行为克隆框架下的扩散策略,未与其他基于扩散的引导方法(如 safety guidance、temporal consistency guidance)进行横向比较,FGO 在更广义的策略学习管线中的相对价值有待进一步检验。