论文

SoftVTBench: 面向可变形物体操作的形变感知视觉-触觉数据集与基准

SoftVTBench: 面向可变形物体操作的形变感知视觉-触觉数据集与基准

物理交互质量对可变形物体操作至关重要,但多数基准仅评估任务成功与否,策略可能在完成任务的同时产生滑动或过度压缩。其核心瓶颈在于缺乏将策略可见的接触观测与独立物理真值在同一任务中配对的视觉-触觉数据集。为此,我们提出 SoftVTBench,一个面向物理交互感知的可变形物体操作视觉-触觉数据集,包含 4,000 条专家演示和 50 余个资源,涵盖体积可变形物体及其视觉匹配的刚性孪生体。在 20 Hz 下,每条 episode 同步记录多视角 RGB、双指触觉 RGB 与标记运动、本体感觉、语言、二值与连续夹爪动作,以及仅评估器可用的有限元 (FEM) 状态。 基于该数据集,我们建立了一个闭环基准,通过固定的物体特定标定定义 形变感知成功率 (DSR),仅当 rollout 完成任务且峰值归一化形变保持在容差内才算成功。在 Diffusion Policy、π{0.5} 和 FastWAM 上,所有 12 个分布内配置均包含违反形变容差的成功 rollout,占各配置成功率的 0.7%–24%。在分布偏移下,视觉-触觉变体在所有六项策略–套件比较中取得更高的任务成功率,并在五项中取得更高 DSR,而其分布内收益则好坏参半。结果表明,仅提供触觉并不能确保有效的多模态融合。因此, SoftVTBench 提供了一个公共视觉-触觉资源,不仅用于研究策略是否成功,还用于研究其如何与可变形物体进行物理交互,以及触觉何时能改善这种交互。

论文精读

TL;DR SoftVTBench 提供同步视觉-触觉与 FEM 物理真值的数据集,并以变形感知成功率(DSR)评估交互质量,揭示现有策略虽能完成任务却常伴过量压缩或滑移。

问题

机器人操作评测正从刚体成功判定 转向可变形物体交互质量,但多数基准仍以二元任务成功为核心指标,导致策略优化偏向“完成即可”,而忽略接触过程中的滑移与过度压缩。

现有方法的主要局限在于:评估协议缺少过程级物理真值。策略完成抓取或放置时,可能已产生不可接受的变形或滑动,而现有数据集很少将策略可见的 visuo-tactile 接触观测 与独立的 FEM 变形状态 等真值同步对齐。触觉数据的采集与标注成本高,且多模态同步困难,导致触觉融合策略的训练和评测缺乏统一基准,研究者无法回答“触摸是否真正改善了交互质量”。

这一问题的难点在于:可变形物体的接触动力学高度非线性,状态空间连续高维,微小抓取差异可能引起显著变形差异。建立 Deformation-aware Success Rate(DSR) 等过程级指标需要可靠的 per-object 标定和评估接口。业界关注点正在从“能完成任务”升级为“安全、可控地完成任务”,尤其涉及食品处理、医疗器械、柔性材料装配等场景,这些场景中交互质量与任务成功同等重要。

类比自动驾驶中的端到端模型:到达目的地不等于驾驶合规,还需评估平顺性、车道保持与干预频率;可变形操作同样需要过程级评分,否则任务成功可能掩盖物理交互失败。

核心洞察

  • 过程级评分指标(DSR)将变形合规性纳入成功判定,揭示仅评估任务完成会漏掉滑移或过度压缩等物理交互缺陷。其独特之处在于,SoftVTBench 利用评估者专用的有限元状态建立独立物理真值,使成功不仅取决于最终结果,还取决于操作过程的质量。实验表明,在全部 12 个分布内配置中,有 0.7% 至 24% 的 rollout 虽然完成任务却违反变形容差,说明传统成功指标掩盖了交互质量差异。
  • 触觉信息在分布偏移下提供更一致的收益,但在分布内收益混合,表明多模态融合不能靠简单拼接触觉解决。该发现独特地通过系统对比 visuo-tactile 与纯视觉策略在 in-distribution 和 out-of-distribution 下的表现得出:OOD 下触觉在 6 组 policy-suite 比较中提升了全部 task success 和 5 组 DSR,而 ID 下收益不稳定。这挑战了“提供触觉即自动改善操作”的假设,并指向需专门设计触觉融合策略。

方法

输入

SoftVTBench 构建在仿真环境中,输入包含超过 50 个资产,其中既有体积可变形物体,也有视觉匹配的刚性孪生,用于控制物体材质变量。每个回合同步记录 20 Hz 的多模态观测:多视角 RGB、双指触觉 RGB 与标记运动、本体感觉、语言指令,以及二值和连续的夹爪动作。

关键模块

  1. 数据采集与物理真值:收集 4,000 条专家演示,所有流严格同步。评估器额外记录仅自身可见的有限元(FEM)状态,作为独立的物理交互真值,避免策略观测与评估目标之间的信息泄露。
  2. 变形校准:针对每个物体建立固定的对象特定校准,将 FEM 状态映射为归一化变形量,使不同材质、几何的物体在同一尺度下比较。
  3. 闭环评估与 DSR:定义任务成功谓词和变形合规阈值,组合为变形感知成功率(DSR)。一个 rollout 只有在同时满足“完成任务”和“峰值归一化变形在容差内”时才计为成功;这弥补了传统仅看任务完成率的局限,能捕捉滑移或过度压缩等过程交互失败。
  4. 协议设计:采用分布内与分布外协议,分别评估策略在已见与未见配置下的表现。

输出

最终得到 SoftVTBench 数据集与基准结果。实验显示,在分布内 12 个配置中,成功 rollout 中有 0.7%–24% 违反变形容差;在分布外,视觉-触觉变体在 6 个策略–套件比较中任务成功更高,DSR 在 5 个更高,但分布内优势不一,说明触觉信息本身并不自动带来有效的多模态融合。

差异点:与仅评测任务完成率的传统机器人基准不同,SoftVTBench 为可变形物体操作引入独立于策略观测的物理真值,并将过程级变形合规纳入闭环判定,从而能用统一指标解耦任务成功与交互质量。

实验

实验设计

SoftVTBench 提供 4,000 条专家演示、超过 50 个资产,并以 20Hz 同步多视角 RGB、双指触觉 RGB、marker 运动、本体感知、语言、二值/连续夹爪动作,以及仅评估器可用的 FEM 状态。闭环评测通过固定物体标定定义 Deformation-aware Success Rate (DSR),仅当任务完成且峰值归一化形变在容差内才算成功。基线包括 Diffusion Policy、π_{0.5}、FastWAM。

关键发现

  • 12 个分布内配置都出现了任务成功但违反形变容差的 rollout,占各配置成功次数的 0.7–24%。
  • 在分布转移下,视觉-触觉变体在 6/6 的策略-套件对比中任务成功率更高,在 5/6 中 DSR 更高。
  • 分布内收益好坏参半,说明提供触觉并不自动保证有效的多模态融合。

与基线的对比解读

相比只看任务成功的基准,DSR 额外捕捉了过程级交互质量;触觉感知本身的收益与 控制粒度 可能分离。对工程落地而言,需要独立物理真值来标定“过度压缩/滑移”,并在融合架构上做针对性设计,而非简单增加触觉输入。

行业影响

落地场景

SoftVTBench 面向可变形物体操作,典型业务场景包括:

  • 电商仓储与物流分拣:食品、服装、软包装商品自动化抓取与装箱。
  • 医疗手术机器人:模拟软组织牵拉、缝合中的力控策略验证。
  • 家庭服务机器人:叠衣物、整理床铺等接触任务。
  • 人机协作装配:带触觉反馈的夹爪处理线束、密封件。

商业价值

  • 降低成本:通过 Deformation-aware Success Rate 提前暴露过度压缩与滑移风险,减少真实环境中产品损坏与物料浪费。
  • 提升收入:更稳健的触觉融合策略提高任务成功率,在分布漂移场景下 visuo-tactile 变体在六项策略套件比较中五次获得更高 DSR,可转化为更高的自动化吞吐与订单交付能力。
  • 体验优化:物理交互质量评分(而非二元成功)能约束策略生成更安全、更柔顺的动作,提升人机共融场景下的用户信任。

与现有产品/工作流的接口

  • 数据管线:数据集提供同步多模态流(多视角 RGB、双指触觉 RGB、FEM 状态),可直接扩展为 PyTorch Dataset 用于 Diffusion Policy、π0.5、FastWAM 等策略训练。
  • 评估层:将 DSR 指标作为仿真或真机回归测试的一环,替代成功率单点检查;通过固定物体特定校准,可在现有 Isaac Sim 或 MuJoCo 等仿真环境中快速部署。
  • 基准集成:标准 leaderboard 格式便于团队横向对比策略在“任务完成”与“交互质量”两个维度上的表现,推动从 task success 到 interaction-aware 的评测升级。

具体 use case:

  1. 生鲜电商仓库:软质水果(如草莓、番茄)抓取,利用触觉反馈与 DSR 约束,减少抓痕破损,提升品相并降低退货率。
  2. 医疗机器人培训:外科手术模拟器中软组织操作,使用该数据集训练策略,防止过度夹持导致组织损伤,加速产品迭代验证。

局限

  • **仿真与真实传感器域差**:SoftVTBench 的数据与评估均基于仿真环境,有限元(FEM)状态作为变形真值仅在仿真中可获取,导致 **Deformation-aware Success Rate**(DSR) 在现实部署时难以直接复现。触觉渲染管线虽然模拟了传感器形变与接触,但真实触觉传感器的噪声分布、弹性体老化、接触非线性等因素未被完整建模,因此本文观察到的“触觉收益”可能高估或低估真实场景中的触觉价值。同时,50+ 资产和 12 个分布内配置的规模在多样性与复杂度上仍有限,难以覆盖细粒度材质、复杂形态和动态环境,限制了结论的普适性。
  • **DSR 校准与标量变形指标的局限**:DSR 依赖固定对象特定校准来确定变形容差,这需要为每个新物体执行预校准以获取标称变形分布,在开放世界或少量演示条件下扩展性不足。此外,变形容差是标量阈值,只关注峰值归一化变形,忽略了变形位置、方向、时间演化等空间/时序信息,可能将局部过度压缩或拉伸、不均匀变形等影响物理交互质量的情况误判为合规。标量指标也可能对任务完成路径的差异不敏感,使得某些通过不同策略达到同样峰值但交互过程明显不同的 rollout 获得相同 DSR。
  • **策略覆盖面与多模态融合指导不足**:本文仅评估了 **Diffusion Policy**、`π0.5` 和 **FastWAM** 三种策略,未包含基于 Transformer 的自回归策略或逆强化学习等方法,策略选择可能偏差;且所有策略基于同一专家演示训练,演示的收集方式可能限制探索空间。更重要的是,论文核心结论指出“提供触觉并不自动保证有效多模态融合”,但没有提出任何改进融合机制或训练策略的方案,因此 benchmark 本身不能指导从业者如何设计更好的触觉利用方式。未来需要在此数据集上开展更系统的融合架构消融研究。
论文Bowen Jing2026-08-19原文

相关内容