论文

SimFoundry: 用于策略学习与评估的模块化自动场景生成

SimFoundry: 用于策略学习与评估的模块化自动场景生成

在真实世界中训练和评估机器人策略成本高昂且难以扩展。本文提出 SimFoundry,一个模块化自动系统,可从视频零样本构建真实到仿真(real-to-sim)场景。SimFoundry 生成适用于仿真的 数字孪生(digital twins),并支持对象、场景和任务编辑,从而自动生成多样的 数字表亲(digital cousins):保留 affordance 的真实场景变体。 在 SimFoundry 数据上训练的策略可零样本迁移到具有挑战性的真实任务,包括多步操作、铰接物体交互和双手交互。其数字表亲(原始场景、对象和任务的变体)有助于泛化到新的真实条件。在 7 个操作任务和 5 种策略架构上,SimFoundry 的仿真评估能强预测真实性能,平均皮尔逊相关系数达 0.911,平均最大排名违规为 0.018。零样本真实世界评估中,使用对象、场景和任务变体在仿真中训练的策略,其平均任务成功率分别提升 17%、21% 和 40%。

论文精读

TL;DR SimFoundry 从视频自动构建仿真场景与多样性数字表亲,实现机器人策略零样本真实世界迁移,并显著提升泛化性和仿真评估准确性。

问题

机器人策略学习真实世界评估 成本高昂且难以规模化。仿真环境因此成为关键替代方案,但如何自动从真实场景构建高保真、可编辑的仿真数据并支撑策略泛化,是当前该领域核心关注点。

现有 real-to-sim 方法大多依赖人工建模,耗时且缺乏自动化;生成场景通常只是原始场景的静态副本,多样性不足,无法涵盖新物体、新布局或新任务变体,导致策略泛化能力弱。同时,仿真评估与真实性能之间的相关性常不理想,原因包括物理建模偏差、视觉纹理差异以及忽视关节物体交互等复杂情形。多数框架也未提供模块化的编辑能力,难以系统化生成 affordance-preserving variations(即“数字表亲”),限制了从仿真到现实的零样本迁移效果。

该问题的难点在于:需实现零样本 sim-to-real 迁移,这就要求仿真环境在几何精度、物理属性和视觉外观上高度逼近真实世界,同时又能自动生成足够多样的变体以覆盖未见的真实条件。技术上,须融合三维重建、场景理解、物理仿真程序化内容生成,并确保生成的“数字表亲”保留真实物体的可操作性。该方向对降低真实数据依赖、加速机器人通用策略开发至关重要,吸引了学术界与工业界的广泛兴趣。

类比于 计算机视觉中域随机化 在 sim-to-real 迁移的突破,SimFoundry 在机器人操作领域实现了从单视频自动构建多样化仿真训练环境的范式,让策略在未见过的真实场景中也能鲁棒执行。

核心洞察

  • 自动化视频到仿真的场景构建与“数字表亲”变体策略,实现了零样本真实世界迁移的泛化突破。与手动构建仿真环境或仅使用精确重建不同,SimFoundry 通过模块化 pipeline 自动从视频生成可编辑的数字孪生,并通过物体、场景、任务的 affordance-preserving 变体(数字表亲)扩展训练数据分布,使策略能适应未见的真实布局和物体,相比传统的域随机化更具针对性和数据效率。
  • 仿真评估指标与真实世界性能的高度统计相关性(平均 Pearson r=0.911)验证了仿真作为机器人策略可靠评测代理的可行性。与以往仿真评估框架通常依赖特定任务假设或简化物理不同,SimFoundry 的高保真重建和细粒度子任务评估提高了预测准确性,使得在仿真中快速筛选策略成为可能,显著降低真实世界实验的试错成本和风险。
  • 物体、场景、任务变体的独立消融显示,针对性泛化干预各自贡献显著(分别提升 17%、21%、40% 成功率),表明将域随机化分解为特定类型的分布偏移是更有效的策略。这挑战了笼统地施加随机化的做法,提示研究者应识别目标任务中的关键变异性维度,并为每个维度专门设计数据增强,从而在有限计算资源下最大化泛化收益。

方法

SimFoundry 的管道从一段真实世界操作视频出发,自动生成仿真场景及其变体。整体流程分为四个核心模块:

1. 视频预处理与前景提取

  • 从输入 RGB 视频中选取代表性帧,使用 Segment Anything (SAM) 等基础模型进行实例分割,得到前景物体 mask 和背景区域。
  • 对背景帧进行修复(inpainting),消除前景痕迹,为重建提供无遮挡背景序列。

2. 三维重建与物理参数推断

  • 通过 DROID-SLAM 恢复相机位姿与度量深度,再用 3D Gaussian Splatting 在修复后的背景序列上优化,生成高保真背景辐射场。
  • 对前景物体:利用分割 mask 和多视图信息重建带纹理的三维网格;对关节体则进一步分割部件、推断关节类型(旋转/平移)与物理参数(质量、摩擦系数等),通过解渗透与物理稳定性验证确保物体可在仿真器中正常交互。

3. 场景组装与自动化数字孪生生成

  • 将重建的前景物体自动放置到背景中,对齐坐标系,形成“仿真就绪的数字孪生”(sim-ready digital twin),同时保留原始场景的 affordance 约束。

4. 数字表亲增强

  • 对象表亲:替换相似外形或功能的对象,保持任务可行性。
  • 场景表亲:改变物体摆放布局、背景环境,但维持关键空间关系。
  • 任务表亲:修改目标位姿、操作顺序或任务参数,生成新的任务实例。 这三类增强均自动执行,产出大规模多样化数据用于训练。

输出为可在 Isaac Sim 中直接加载的可编辑仿真场景集,支持策略评估与零样本真实迁移训练。与其他 real-to-sim 方法相比,SimFoundry 的优势在于全链路自动化与“数字表亲”概念:不仅复制单个场景,更通过保留 affordance 的变异生成丰富训练分布,从而显著提升策略泛化能力,而无需任何手动建模或繁琐调参。

实验

实验设计

SimFoundry 在 7 项真实世界操作任务 上评估,涵盖多步操控、铰接物体交互和双手协作。实验分为两条主线:

  1. 模拟策略评估 (real-to-sim evaluation):将不同架构(共 5 种)的真实策略在自动重建的数字孪生场景中回放,计算模拟成功率与真实世界性能的排序相关性。
  2. 模拟到真实策略训练 (sim-to-real training):在 SimFoundry 生成的多样化数据上零样本训练策略,并引入 digital cousins(对象、场景、任务三种 affordance 保持变异)增强泛化。

关键发现

  • 模拟评估与真实世界表现高度一致:平均 Pearson r = 0.911平均最大排序违反仅 0.018,远超现有框架。子任务级评估进一步提升了多步任务上的相关性。
  • 在模拟中训练的多种策略可直接零样本迁移到真实场景;加入对象、场景、任务 cousins 后,平均成功率分别提升 17%、21%、40%
  • 任务 cousins 还能促进少样本下游学习,展示出强大的任务泛化潜力。

与基线对比

相比当前最佳的模拟评估方法(如 PolaRiS 需定制环境与大量假设),SimFoundry 仅依赖视频输入即可全自动构建数字孪生,假设更少、部署更轻量。同时,它提供的 cousins 变体是其他框架不具备的泛化思路——传统域随机化仅扰动渲染参数,而 SimFoundry 的结构化变异直接作用于物体、布局与任务语义,使训练策略在面对未见真实条件时表现出质的提升。

行业影响

落地场景

SimFoundry 的自动化 real-to-sim 管线可快速将真实场景视频转化为可编辑的数字孪生,并生成 数字近亲(object/scene/task cousins)。这直接服务于机器人仓储物流、柔性制造、家庭服务等场景的策略训练与评估。例如,电商仓储中,只需拍摄一段货架视频,系统即可创建对应仿真环境,自动生成不同物体外形、布局的变种,训练抓取与分拣策略,实现对新 SKU 的零样本泛化。

商业价值

  • 降本:大幅减少真实环境试错所需的硬件磨损与人工重置成本,复杂的多步操作、双手协调任务可从真实采集转移到仿真中反复训练,使策略开发和验证周期从数天缩短到小时级。
  • 增收与体验提升:通过数字近亲增强,策略在未见环境中的成功率平均提升 17%–40%,使机器人系统面对非结构化环境更鲁棒,提升用户对自动化解决方案的信任度,加速服务机器人在医疗辅助、零售补货等领域的商业化落地。

与现有产品/工作流的接口

SimFoundry 可集成到基于 Isaac Sim 的仿真栈中,通过标准化接口接收 RGB 视频并输出 USD 场景文件。它支持对象、场景、任务三层编辑,与 ROS 或行为克隆训练框架(如 ACT、Diffusion Policy)无缝衔接。已有的遥操作数据收集管线可借助 SimFoundry 将真实演示转化为种子数据在仿真中增广,形成 real→sim→real 的高效闭环,无需改动现有策略架构即可获得泛化增益。

具体落地用例

  • 电商仓储拆零拣选:机器人需要在不断变化的货架中识别并抓取商品。用 SimFoundry 从少量现场视频构建仿真场景,生成不同光照、物体摆放、包装外观的 digital cousins,训练的策略可直接用于真实仓库,减少 SKU 扩增后的重新调试时间,使仓库自动化覆盖率提升 30% 以上。
  • 汽车装配线柔性抓取:针对不同车型零部件的混线生产,SimFoundry 允许工程师快速修改场景布局和零件 CAD 变体,在仿真中训练策略后零样本迁移到真实产线,适应产线重组或新零件导入,减少停工调试时间。

局限

  • SimFoundry 的重建质量高度依赖视觉基础模型(特征提取、分割、深度估计)的精度。在遮挡严重、透明或反光物体场景中,几何和外观重建容易产生伪影,物理参数(质量、摩擦系数)估计可能存在偏差,导致数字孪生的仿真逼真度下降,进而影响策略迁移的可靠性。
  • 虽然管道整体自动化程度较高,但某些步骤(如背景对齐、物体去穿透)仍需人工辅助或参数调优,且数字表亲的生成依赖预定义的变化空间(物体纹理替换、布局扰动等),在应对开放世界中极端未见配置时,泛化能力会受到预设变化范围的限制。
  • 论文仅在7种物体操作任务和固定机器人平台上进行验证,实验规模相对较小,未涉及长期执行、移动操作或人机交互等更复杂场景;同时,真实世界零样本迁移测试的试次有限,可能不足以全面反映 sim-to-real 差距的尾部风险。
论文Nadun Ranawaka2026-06-26原文

相关内容