论文

TacForcing:执行时触觉反馈的流式动作生成

TacForcing:执行时触觉反馈的流式动作生成

接触丰富的操控要求适应动作区间内快速演变的接触状态。然而,基于块的视觉-语言-动作模型从执行前采集的观测中预测完整动作块,导致执行期间触觉条件陈旧。现有触觉反应式方法通常依赖独立的高频控制器,增加了架构与训练复杂度。 本文提出 TacForcing,一种有效集成执行时触觉反馈的流式动作生成框架。TacForcing 不采用独立反应式控制器,而是以流式动作专家替换标准动作专家,依据执行过程中不断演变的触觉观测生成动作。同时引入 执行感知触觉注意力 (EATA),将触觉条件限制在临近执行的动作上,缩小触觉获取与动作执行的时域失配。 在 6 个模拟 UniVTAC 任务和 3 个真实接触丰富操控任务上,TacForcing 分别取得 65% 和 69% 的平均成功率,显著优于强基线。

论文精读

TL;DR TacForcing 通过流式动作生成与执行感知触觉注意力,将执行时触觉反馈与临近动作对齐,无需额外高频控制器即可显著提升接触丰富操作成功率。

问题

问题背景:接触丰富操作(contact-rich manipulation) 是机器人学习核心场景,依赖视觉-语言-动作(VLA)模型来结合语义理解与动作生成。

现有方法局限:主流 chunk-based VLA 模型在执行前一次性推理完整动作块(action chunk),触觉观测在动作执行期间不更新,导致 tactile conditioning 陈旧,无法响应接触力的实时变化。现有触觉反应方法通常引入独立的高频 PID/MPC 控制器与 VLA 并行,虽然利用了触觉反馈,但增加系统架构与训练复杂度,且难以端到端优化。

为什么这个问题难/重要:在精密装配、零件插入等任务中,接触状态(如摩擦力、滑动、刚接触瞬间)在单个 action horizon 内可能显著演化。要求动作生成与触觉采集在时间上紧密对齐,但触觉信号频率高、噪声大、与视觉/语言模态异构。业界对通用机器人操作模型(VLA foundation models)需求迫切,但缺乏轻量、端到端的触觉流式集成方案,限制了模型在真实接触场景中的可靠性。

行业类比:这一问题类似于 LLM 从一次性文本生成转向流式 token 解码,以在生成过程中融入实时反馈;TacForcing 使动作生成也能“边执行边感知”。

核心洞察

  • 将触觉反馈内建于流式动作生成器,替代独立的反应式控制器。TacForcing 的流式动作专家直接在生成过程中以实时触觉观察为条件,无需额外的 PID 或阻抗控制器来处理接触事件。这消除了传统触觉反应管线的架构冗余与训练耦合,使触觉信息成为动作概率建模的一部分,更利于端到端优化和任务泛化。
  • Execution-Aware Tactile Attention 引入时间对齐条件化,缓解触觉数据与动作执行间的时序错位。该机制仅允许触觉信号在对应动作临近生成时注入,避免过时触觉污染当前预测。相比固定条件化或全块条件化,这种方法更贴合接触状态快速演变的物理特性,显著提升接触丰富操作的成功率,且不依赖手工设计的高频回路。

方法

输入与输出

TacForcing 接收语言指令、视觉观察(如 RGB 图像序列)以及执行时触觉观察(如触觉图像或力特征)。输出为动作序列(chunk),但以流式方式生成:每个动作块在执行前才生成,因此能利用最新的触觉反馈。

关键模块

  1. Streaming Action Expert:替代 VLA 中标准的 action expert,采用 Flow Matching 作为生成模型。通过 block-wise flow scheduling 将完整动作序列划分为多个时间块,按执行顺序迭代生成每个块的动作。每个块的生成条件包括语言特征、视觉历史以及该块开始前采集到的触觉观测。
  2. Execution-Aware Tactile Attention (EATA):在 Transformer 注意力层引入时间掩码,限制每个动作 token 只能关注与其执行时间相近或早于其执行的触觉 token。具体地,动作块 i 仅关注触觉观测 t ≤ τ_i,其中 τ_i 为该块的执行起始时刻。这避免未来触觉信息泄露,也屏蔽过时触觉带来的噪声,从而缓解触觉采集与动作执行之间的 temporal mismatch。
  3. 训练:端到端训练,使用 flow matching 的回归损失(如预测速度场)优化动作生成;EATA 掩码在训练时通过因果注意力实现,无需额外监督。整个框架不依赖分离的高频反馈控制器。

与同类方法的差异

现有 tactile-reactive 方法通常采用独立的高频控制器(如外环阻抗/力控)与 VLA 级联,而 TacForcing 将触觉闭环集成在单一生成模型内部,通过流式调度与时间对齐注意力实现,架构更简洁、训练更统一。

实验

实验设计

TacForcing 在六个模拟 UniVTAC 任务和三个真实世界接触丰富操作任务上进行评估,基线包括 chunk-based VLA 模型和采用分离高频控制器的 tactile-reactive 方法。评估指标为任务成功率。

关键发现

  • 模拟平均成功率 65%,真实世界平均成功率 69%,均优于所比较的强基线。
  • Execution-Aware Tactile Attention (EATA) 通过将触觉条件限制到临近执行的动作,显著缓解了触觉获取与动作执行之间的时间不匹配,从而提升接触状态适应能力。

与基线对比

相比依赖分离高频控制器的方案,TacForcing 的流式动作专家不需要额外控制器,降低了架构复杂度和训练难度,同时通过执行时触觉更新实现实时反应。工程上这意味着更简单的部署流程和更直接的端到端训练,尤其适合需要快速适应接触状态变化的精密操作任务。

行业影响

落地场景

TacForcing 适用于需要实时接触反馈的机器人操作,如精密装配、接插件插拔、液体转移和表面擦拭。在 3C 电子组装、汽车线束插接、实验室移液工作站等业务中可直接落地。流式动作生成避免了传统 chunk 模型对执行中触觉状态变化的滞后响应,提升任务成功率。

商业价值

  • 降本:减少因触觉反馈滞后导致的装配失败率,降低重复尝试与物料损耗;无需额外高频控制器,简化系统架构与训练成本。
  • 增收:提高产线节拍,支持更复杂的任务与快速换型,扩大机器人可服务场景。
  • 体验提升:操作更稳定柔顺,减少人工干预,提升人机协作安全性。

与现有工作流接口

TacForcing 可作为 VLA 动作专家的即插即用替换。流式动作专家直接接收传感器流,通过 EATA 机制对齐触觉与执行时间。训练可复用现有 vision-language 编码器,仅替换动作解码部分。部署时可通过 ROS 2 节点封装,订阅触觉话题,实时输出增量动作。

具体场景示例:在电子制造产线的精密装配工位,实时调整插入角度,降低卡滞故障率;在电商履约中心的包裹抓取打包环节,利用触觉反馈判断抓取力度,减少物品损坏。

局限

  • 论文未明确讨论实时推理的计算开销与延迟敏感性。TacForcing 要求在执行期间持续接收触觉观测并生成后续动作,这意味着模型部署需要满足严格的实时性约束。虽然替换了高频控制器降低了复杂度,但流式生成仍需在毫秒级内完成,触觉传感器采样率、通信延迟和推理延迟都可能影响性能。论文没有提供系统延迟分析或实际机器人上的延迟指标,对于实际工程部署的可行性仍存疑。与现有离线 chunk 预测相比,在线推理对硬件要求更高,可能限制在嵌入式计算平台上的应用。
  • 实验规模有限且任务类型较为单一。论文在 6 个仿真任务和 3 个真实任务上验证,但均属于接触丰富的操作(如站立瓶子、转移液体、擦拭等),缺少更广泛的接触类型和操作场景(如高精度装配、柔性物体操作)。此外,真实世界任务仅 3 个,每个任务的成功率可能受环境光照、传感器安装等影响,未报告多次重复实验或误差条。与一些大规模触觉操作数据集训练的模型相比,TacForcing 的泛化能力尚未得到充分验证。
  • EATA 机制限制触觉条件只作用于接近执行的动作,虽然减少了时序不匹配,但可能牺牲了利用远期触觉历史信息进行预测的能力。在某些需要长期接触规划的任务中(如需要预测后续接触序列的复杂操作),该设计可能阻碍模型充分利用触觉序列中的全局信息。论文未与允许全局触觉注意力的变体进行对比,缺乏对 EATA 取舍的深入分析。另外,流式动作专家替代标准动作专家后,模型参数量和训练难度可能增加,论文未提供训练效率对比。
论文Jianbo Zhou2026-08-26原文

相关内容