Deform360: 用于可变形世界模型的大规模多视图触觉数据集
预测物体动力学(即世界建模)是机器人操作的基本挑战,而由于可变形物体具有高维状态空间和复杂材料属性,对其建模尤为困难。当前世界模型主要通过两种不同范式来解决:在2D像素空间上学习动力学,或在更显式的3D几何空间中学习。然而,由于缺乏多样化的大规模真实世界数据,对其相对优势和局限性的系统性理解仍然难以实现。 为解决此问题,我们提出了Deform360,一个大规模视触觉数据集,包含198个日常物体、1,980个交互序列,以及来自41个环视摄像头和双手触觉抓取器的超过215小时观测数据,以捕捉全局运动和接触引起的局部形变。利用一种新颖的无标记视触觉3D跟踪流水线来提取密集几何与运动,我们系统评估了当前最先进的世界模型,比较了2D视频模型与3D粒子模型。 最后,我们通过执行可变形物体上的机器人规划任务,初步展示了数据集在真实世界中的适用性。我们的分析揭示了结构先验与可扩展性之间的权衡的关键见解,为未来可泛化的以物体为中心的可变形物体世界建模研究提供了坚实的基准。
论文精读
TL;DR Deform360 构建了大规模多视角视触觉数据集,系统对比 2D 视频与 3D 粒子世界模型对可变形物体动态的建模,揭示了结构先验与可扩展性的关键权衡,为机器人操作提供基准。
问题
问题背景
机器人操作领域正从刚性物体向可变形物体(如布料、食物、纸制品)拓展,其核心挑战在于构建精准的世界模型(world model)——即预测物体在外部作用下的动力学变化。
现有方法局限
当前世界模型主要分为两类范式:
- 2D 视频模型:在像素空间学习动力学,可扩展性强,但缺乏对三维几何和物理约束的显式建模,长期预测易出现漂移和细节失真。
- 3D 粒子模型:在显式几何空间建模,利用结构先验提升精度,但通常依赖简化假设或受限的场景规模,难以泛化到复杂的真实世界可变形物体。
这两类方法各自的优缺点尚未被系统量化,主要原因在于缺乏多样化、大规模的真实世界数据集,尤其是同步提供多视角视觉与触觉接触信息(visuotactile)的数据,无法捕获接触引致的局部精细形变。
为什么这个问题难且重要
可变形物体动力学建模的技术难点在于:
- 高维状态空间:布料褶皱、面团塑形等需要描述无数粒子或连续介质变形。
- 复杂材料属性:不同物体(硅胶、毛绒、橡胶)表现出截然不同的非线性响应。
- 视觉与触觉的协同:仅靠外观难以推断内部应力分布和接触状态,多模态感知的融合是突破关键。
业界对通用可变形物体操作(如叠衣、备菜、柔性组装)的需求日益迫切,但缺乏像 ImageNet 或 Drive360 那样的基准数据,导致模型研发缺乏统一的衡量标尺。
行业类比
类似自动驾驶领域依靠大规模多模态数据集(如 nuScenes、Waymo Open Dataset)推动了感知和预测模型的跃升,可变形物体操作也急需同等级的、包含多视角视觉与触觉的数据集,来催化下一代世界模型的进展。
核心洞察
- 数据集规模与多样性:Deform360 包含198个日常物体、1980个交互序列和超过215小时的多视角触觉观测,覆盖1D、2D和3D变形类别。这为变形物体世界模型研究提供了前所未有的大规模真实世界基准,使得系统比较2D像素空间与3D几何空间的动力学学习成为可能,避免了以往小规模数据集无法揭示的可扩展性与泛化性问题。
- 无标记触觉3D跟踪管线:论文提出了一套 markerless 的触觉-视觉联合3D重建与粒子追踪方法,直接从原始触觉图像和环绕相机中提取密集几何与运动信息。这一管线克服了传统标记法在变形物体上部署困难和易受遮挡的局限,为大规模数据集的自动化标注提供了工程可行的方案,并确保了数据质量的可靠性与可复现性。
- 结构先验与可扩展性的量化权衡:通过在 Deform360 上的全面基准测试,作者首次系统对比了2D视频模型与3D粒子模型在预测变形物体动力学上的表现,揭示了前者在扩展性和零样本泛化上的优势,以及后者在长期几何一致性上的强归纳偏置。这一洞察为未来通用变形世界模型的设计指明了方向——需要平衡数据驱动可扩展性与显式几何理解,避免陷入单一范式的局限。
方法
整体流程
Deform360 方法以多视角 RGB 视频、触觉读数和机器人末端执行器动作为输入,构建一套从原始传感数据到可变形物体动态预测的完整流水线,最终输出未来状态的预测(图像或 3D 粒子轨迹)并用于机器人规划。流程分为数据标注、世界模型训练与规划三阶段。
数据采集与标注管道
采集系统:围绕操作台部署 41 台环绕视角 RGB 相机,配合双臂触觉夹爪(记录接触形变),以 30 Hz 同步采集。动作空间包含夹爪 6-DoF 位姿和开合度。
标注管道将原始数据转化为可学习的表示:
- 视觉触觉预处理:时间同步、相机标定与去畸变。
- 动态几何重建:利用多视角立体视觉恢复物体表面稠密点云,并估计每帧的 3D 流场。
- 无标记粒子追踪:在物体表面采样一组虚拟粒子,通过 3D 流场传播其位置,实现无需物理标记的长期跟踪,获得粒子轨迹作为物体状态的紧凑表示。
该追踪方案完全摆脱标记依赖,可泛化到任意未见物体,是数据集可扩展性的关键。
世界模型基准测试
基于标注好的粒子轨迹和同步图像,作者系统对比两类世界模型:
- 2D 视频模型:以历史帧和动作为条件,直接预测未来 RGB 图像(像素空间预测)。具备良好的可扩展性,但对几何约束隐式建模。
- 3D 粒子模型:在粒子坐标空间学习动力学(如 GNS、DPI-Net 等基于图的网络),预测未来粒子位置。显式利用物理归纳偏置,但泛化到复杂拓扑较难。
评估在单物体和跨物体泛化两种设定下进行,指标包括预测粒子位置的均方根误差(RMSE)和未来图像的结构相似性(SSIM)等。
机器人规划验证
在真实机器人上,使用数据集训练的 3D 粒子模型作为世界模型,结合模型预测控制(MPC)执行可变形物体操控任务(如挤压、弯曲),验证了 sim‑to‑real 迁移的有效性。
与同类工作的差异
不同于以往仅提供视觉或稀疏触觉的小规模数据集,Deform360 首次同时提供高密度环绕视图与触觉配对、无标记 3D 追踪的大规模真实世界数据,并直接在同一基准上对齐像素空间和几何空间的动态模型,为理解两类范式在可变形物体建模上的互补性提供了实证基础。
实验
实验设计
实验基于 Deform360 数据集,覆盖 198 类日常物体、1980 条交互序列,使用 41 个环绕视角相机与双手触觉夹爪记录超过 215 小时的观测。
评估流程分为四个阶段:
- 重建与跟踪质量评估:验证无标记视觉触觉 3D 跟踪管线提取的稠密几何与运动数据的准确性,为后续任务提供可靠 ground truth。
- 视觉触觉接触预测:利用多视角视觉和触觉信号预测物体表面的接触区域与局部形变,考察多模态融合的有效性。
- 世界模型基准测试:系统对比 2D 视频模型(像素空间动力学学习)与 3D 粒子模型(显式几何空间动力学),在相同交互序列上训练,衡量长期预测误差、几何一致性以及对新物体 / 新动作的泛化能力。
- 真实机器人规划:在真实机械臂操作形变物体任务中部署预训练的世界模型,验证数据集的 sim-to-real 迁移价值。
关键发现
- 3D 粒子模型 在需要精确几何推理的场景中表现更强,例如预测揉捏、弯折等接触诱导的局部形变,长期预测累积误差更低,且更符合物理约束。
- 2D 视频模型 在视觉保真度和大规模可扩展性上占优,能生成自然且细节丰富的 RGB 未来帧,但对未见过的物体类别容易产生非物理形变,缺乏显式 3D 理解。
- 结构性先验与可扩展性之间存在本质权衡:粒子模型的精心设计状态表示限制了物体多样性覆盖,而视频模型虽易扩增数据,但物理直觉不足。Deform360 的多视角视觉触觉数据让这一权衡具象化:单一范式难以同时满足高精度几何推理与广泛物体泛化。
与基线对比的深度解读
以往世界模型评估多局限于小规模合成数据或单一模态(纯视觉或仿真粒子),Deform360 首次在真实世界、多视角、含触觉的大规模数据集上提供了公平对比。结果表明,单纯追求像素级预测质量(如 PSNR / SSIM)会掩盖物理不一致性;而显式 3D 粒子模型虽物理可靠,但面对变形多样的日常物体时,其手工设计的状态空间难以泛化。该基准为未来混合范式(如神经场 + 粒子、隐式结构化先验)指明了方向,也提醒研究者:世界模型的选择应视下游任务对几何精度与泛化性的要求而定,而非一刀切。
行业影响
落地场景
Deform360 提供的多视角视触觉数据,可直接用于训练机器人对可变形物体(如衣物、食品、软包装)的操控策略,覆盖仓储物流分拣、制造业柔性装配、服务机器人整理等场景。在医疗领域,可辅助手术机器人模拟软组织交互,提升操作精度。内容创作与 AR/VR 领域,利用数据训练的世界模型 能增强虚拟物体与环境的真实物理交互。
商业价值
- 降低定制化成本:通过大规模预训练的世界模型,减少针对特定可变形物体的数据采集与模型调试成本,加速机器人部署。
- 提升机器人泛化能力:基于丰富材质和交互的数据,模型能适应未见物体,提高自动化作业的覆盖率和成功率,直接带来运营效率提升。
- 体验升级:在交互式应用中(如虚拟试衣、游戏),更逼真的物理模拟能增强用户沉浸感,促进用户留存与转化。
与现有工作流的集成
该数据集及配套标注管线可集成到机器人仿真平台(如 NVIDIA Isaac Sim、MuJoCo)中,作为粒子动力学模型 或视频预测模型 的训练源。开发者可将重建的 3D 几何和运动轨迹导入现有的 imitation learning / reinforcement learning 管道,或直接使用预训练的 world model 作为仿真环境的替代,加速策略学习。对于触觉感知模块,数据集提供的触觉信号可作为多模态输入的benchmark,接入到已有的触觉传感器方案(如 GelSight)的校准与训练流程。
具体用例:
- 电商仓储软包装分拣:集成到机械臂视觉系统,实时预测包装形变,规划稳定抓取点,减少破损率。
- 手术机器人训练:利用器官组织变形的 3D 粒子模型,在仿真中训练缝合或牵拉等精细操作,降低实物训练成本。
局限
- - **交互动作与环境单一**:数据集中的交互序列主要为抓取和放置动作,并由双臂重复采集,缺乏切、揉捏、拉伸等更复杂的操作类型。实验场景固定在光照受控的实验室环境,未涵盖真实家庭或工业场景的多样性。这可能导致基于此数据训练的世界模型在面对复杂操控任务时泛化能力不足,限制了其在实际机器人应用中的直接部署。
- - **无标记跟踪的精度瓶颈**:所提出的无标记视觉触觉 3D 跟踪pipeline 依赖于物体表面纹理和几何特征,对于高透明、均匀色泽或极度柔软变形的物体,重建与跟踪精度可能下降。此外,触觉信号仅作为监督信号用于评估,尚未被显式融合进世界模型的动力学学习过程,其模态价值未能充分挖掘。