论文

TableVerse: 一个大规模桌面数据集,具有真实世界布局,用于通用操作

TableVerse: 一个大规模桌面数据集,具有真实世界布局,用于通用操作

通用机器人操控策略的发展本质上受限于大规模、高保真场景数据的可用性。尽管近年来的自动合成方法试图通过文本到布局的幻觉或简化的程序化生成来弥补这一差距,但它们常常存在物理上不可行的问题,且无法捕捉真实人类环境中复杂、密集的杂乱。 本文引入了 TableVerse,一个完全自动化的 Real2Sim 流水线,它将范式从想象性布局生成转变为从非结构化的野外图像数据进行确定性重建。我们的框架无缝处理无脚本的互联网媒体,生成高保真、仿真就绪的桌面环境,具有精确的度量尺度、真实的拓扑结构和经过验证的机械稳定性。此外,集成了一个自动化任务条件下的轨迹生成框架,以合成高质量、无碰撞的拾取和放置演示。 利用这一完整流水线,我们构建了 TableVerse-100K 数据集,这是一个大规模语料库,包含 100,000 个独特、物理一致的环境,并配有交互式操控轨迹。通过捕获多样化的资产组合、现实的空间分布和高质量的演示,TableVerse-100K 建立了一个高度可扩展且高保真的数据基础,为未来通用机器人操控任务的研究提供了重要价值。

论文精读

TL;DR TableVerse 提出从互联网图像自动重建真实桌面场景的 Real2Sim 管线,构建 10 万物理一致环境的 TableVerse-100K 数据集,为通用操作策略提供高保真数据基础。

问题

问题背景

机器人操作策略的泛化能力强烈依赖大规模、高保真场景数据,然而真实世界数据的采集成本高昂,因此基于模拟的自动化数据生成成为推动具身智能发展的重要方向。

现有方法局限

当前主流方法主要分为两类:

  • 文本到布局幻觉(text-to-layout hallucination):利用语言模型生成场景布局缺乏物理约束,导致物体悬空、穿透等不真实现象;
  • 程序化生成(procedural generation):依赖人工设计的规则库,无法覆盖真实人类环境中复杂、密集的物体堆叠与空间语义。 二者共同缺陷是物理合理性不足,难以反映“in-the-wild”场景下的杂乱度与多样性,使训练出的策略在真实世界中泛化失败。

技术挑战与重要性

从非结构化的野外图像直接重建物理一致的桌面环境存在三大难点:

  1. 开放词汇检测与实例级提取:需要从任意互联网图像中准确分割、识别各类未知物体;
  2. 布局校正与稳定性验证:原始图像仅为二维投影,须恢复物体三维位姿并解决碰撞、悬空等物理矛盾;
  3. 任务导向的高质量轨迹生成:在重建的杂乱环境中合成无碰撞的抓取放置序列仍具挑战。 业界对能够低成本、大规模、高保真地构建模拟场景的方案高度关注,因为这直接决定了通用操控策略的训练效率与迁移性能。

行业类比

类似自动驾驶领域用真实路采数据构建仿真场景来训练感知决策模型,机器人操控也需要从真实视觉数据中提取物理世界结构,以实现从模拟到现实的可靠迁移。

核心洞察

  • 从生成式布局到确定性重建的范式转变:不同于现有方法依靠文本到场景、程序化规则生成虚构布局,TableVerse 直接从非结构化的互联网图像中提取场景,重建具有准确尺度、真实拓扑和物理稳定性的桌面环境。这种 Real2Sim 路线从根本上解决了合成场景的物理不合理与真实杂乱度缺失,使得生成的数据更贴近真实人类环境,为训练通用操作策略提供了高质量、高保真的数据基础。
  • 全自动端到端管线实现规模化数据生产:TableVerse 将实例级物体提取、布局碰撞矫正、以及任务条件轨迹生成整合为单一自动化流程,无需人工标注即可从网络媒体产出带高质量抓取-放置演示的交互式场景。这突破了以往桌面数据集规模受限、多样性不足的瓶颈,以 10 万级独特场景支撑 scalable manipulation learning,显著降低了获取大规模真实感操作数据的门槛。

方法

方法流程:从真实图像到可操作仿真场景

TableVerse 构建了一条全自动 Real2Sim 管线,将无结构互联网图像转化为物理一致的桌面仿真环境,并生成可执行的操作轨迹。其核心分为四个阶段:

  1. 3D 实例级对象提取
    输入为单张或多视角 RGB 图像。管线首先使用开放式词汇混合检测(Seed-1.8 Hybrid Detection)识别场景中的物体,结合提示词与后处理 Mask 生成精细的分割。通过组合式对象生成处理遮挡、重叠等复杂情况,提取物体的姿态与度量尺度,得到初始 3D 布局。

  2. 布局一致性碰撞修正
    初始布局可能存在穿透、悬空等物理错误。本阶段通过三层递进式优化:

    • 层次化接触分组与落地:将物体按接触关系聚类并稳固放置在桌面;
    • 径向图构建与水平校正:利用空间关系图消除水平方向的碰撞;
    • 垂直解缠与物理稳定:逐层调整高度,最终通过物理引擎验证稳定性。
      该过程确保所有物体达到无穿透、稳定支撑的物理合理状态。
  3. TableVerse-100K 数据集生成
    对大量真实图像重复上述流程,构建包含 100000 个唯一场景 的数据集,每个场景均附带准确的 3D 布局、物体资产与物理稳定性验证。

  4. 任务条件轨迹生成
    基于重构场景,自动合成高质量的 Pick-and-Place 演示:

    • 自上而下 6D 抓取优先级:先生成候选抓取,再结合任务需求选择合理的抓取点;
    • 关系约束放置与运动规划:根据物体间语义关系(如“放在杯子里”)计算放置域,并规划无碰撞轨迹。

输出为可直接用于模仿学习或强化学习训练的 (状态, 动作) 序列。

与同类方法的差异:相比基于文本到布局的幻觉生成(如 SceneMaker),TableVerse 从真实图像重建布局,天然保留了人类环境的杂乱度与空间分布,并通过严格的物理碰撞修正确保数据可信度,而非依赖简化规则或人工标注。

实验

实验设计

TableVerse 构建了一个包含 10 万场景的 TableVerse-100K 数据集,每个场景都经过真实图像重建和物理稳定性验证,并配以自动生成的任务条件化轨迹。实验主要对比了现有的自动化合成方法(如 SceneMaker),这些方法通常依赖文本到布局的生成或简化过程化建模。评估从布局合理性、任务成功率、轨迹碰撞率等维度进行。同时通过消融研究,考察了分层碰撞矫正关系约束放置复合物体生成等模块的贡献。

关键发现

  • 从互联网真实图像重建的场景在物体分布、杂乱度和拓扑结构上明显优于基于规则生成的方法,更接近实际人类工作台环境。
  • 自动化轨迹生成框架结合了 Top-Down 优先级抓取关系约束放置,显著降低了碰撞率,提高了演示质量。
  • 物理稳定性验证和布局一致的碰撞矫正确保了仿真环境可直接用于机器人策略训练,无需额外人工清理。

与基线对比的解读

SceneMaker 等基于语言模型的方法相比,TableVerse 的 Real2Sim 管道从重建出发而非从想象出发,避免了物理不合理布局(如悬浮、穿模)的问题。这一根本性差异使得后续训练的策略在真实世界部署时具有更强的泛化能力,因为仿真中的场景分布更贴近实际。消融实验进一步表明,移除任何核心模块都会导致布局质量或轨迹成功率的显著下降,印证了重建–矫正–轨迹生成整体流程的必要性。

行业影响

落地场景

TableVerse 通过 Real2Sim 管道从互联网图像自动重建高保真桌面环境,并生成任务条件轨迹,直接赋能机器人操作策略训练。典型应用包括:

  • 仓储物流自动化:生成海量杂乱货架抓取演示,训练通用拣选机器人,适应不同 SKU 形状、堆叠与物理属性。
  • 服务机器人研发:为家用机器人提供多样化厨房、办公桌场景,提升对未知物体的操作泛化能力。
  • AR/VR 内容生成:快速构建逼真交互式桌面环境,降低人工建模成本。

商业价值

  • 降本:数据集自动化构建(100K 环境)消除对昂贵人工标注与真实场景采集的依赖,单场景成本趋近于零。
  • 增效:高质量物理一致场景与轨迹可加速策略迭代,缩短从仿真训练到真实部署的周期(Sim2Real Gap 减小)。
  • 体验提升:通用抓取策略在复杂杂波中成功率更高,直接改善客户订单履约速度与机器人交互流畅度。

与现有产品/工作流的集成

TableVerse 可作为数据生成模块嵌入机器人开发栈:

  1. 仿真环境:直接复用 Isaac Sim / PyBullet 等平台,通过统一接口输出 USD/SDF 场景文件。
  2. 训练管线:与行为克隆(BC)、强化学习(RL)框架(如 Robomimic、RLBench)无缝对接,提供预训练数据集。
  3. 验证环节:生成的环境自带物理稳定性校验,减少手动修正工作量。

具体落地 Use Case

  1. 电商仓库灵活拣选:某跨国电商部署通用拣选机器人,利用 TableVerse 训练策略以应对促销季大量新进商品组合。管道输出包含 pick-and-place 轨迹,直接用于 6-DoF 抓取规划,减少每新增 SKU 需重新标定相机与路径规划的人力。
  2. 跨平台机器人操作系统:作为 ROS/ROS2 节点 发布合成场景流,供不同硬件平台(机械臂、移动抓取平台)在环仿真测试,加速从原型到量产的迁移。

局限

  • **场景类别受限**:TableVerse 聚焦于静态桌面环境,物体的空间分布、堆叠关系与背景均以桌面操作任务为中心。对于非桌面环境(如地面散落场景、货架操作等)或需要移动基座的操作任务,该数据集与方法无法直接覆盖;其重建流水线对平面假设(桌面)依赖较强,若迁移到更复杂几何结构场景,物理稳定性验证和碰撞纠正的有效性可能显著下降。
  • **感知与重建鲁棒性依赖上游模型**:流水线中使用了开放词汇检测、分割及深度估计等预训练模型,这些模型在极端视角、严重遮挡或罕见物体上的性能波动会直接传导至重建质量。论文未对上游模型失效情况下的整体鲁棒性进行系统分析,且对透明、反光等困难物体的处理仅作简要讨论,实际部署时这类物体可能导致布局错误或物理不稳定性。
  • **任务多样性有限**:虽然数据集提供了拾放(pick-and-place)轨迹,但操作种类较为单一,未涉及灵巧操作、工具使用或接触丰富动作。轨迹生成框架中的关系约束放置域主要用于避免碰撞,对复杂任务语义(如“将杯子放在碟子左侧”)的表达能力不足。与同时期一些支持语言指令和更多操作类型的仿真数据集相比,TableVerse 在任务粒度和指令多样性上仍有提升空间。
论文Boyuan Wang2026-07-23原文

相关内容