DeformSmith: 物理约束引导的可形变资产分层生成,用于机器人操控
为机器人操控创建可形变资产,需要同时确定其几何、外观与物理属性。这对可形变物体尤为困难:文本和图像几乎无法说明它们如何变形、如何响应接触,而这些响应恰恰决定了它们是否适合交互。因此,自动化生成必须解决相互耦合的物理需求,并用交互证据来引导构建与迭代。 我们提出 DeformSmith,一个能从文本或单张图像自动生成可交互、物理可信的可形变资产的框架。它通过分层式智能体构建与一个共享的物理约束 harness,逐步构建、测试并精炼几何、物理模型、材质行为与机器人交互,直到生成的资产可用于仿真与操控。机器人交互通过操控反馈与可回放的交互数据闭合生成回路。 实验表明,DeformSmith 生成的资产在视觉质量与物理合理性上均优于 PhysGen3D、PhysGM、PhysX-Omni 等当前最优基线,并支持为可形变物体的机器人操控合成数据。项目主页:https://can-lee.github.io/deformsmith-web/
论文精读
TL;DR DeformSmith 从文本或单图自动生成物理可信的可变形物体资产,经分层构建、物理仿真测试与机器人交互闭环优化,视觉与物理合理性优于现有 SOTA。
问题
问题背景
机器人操作仿真依赖大量多样化数字资产,可变形对象因其高维形变状态和接触响应,对资产生成提出更高要求。从文本或单图像自动生成此类资产,能显著降低仿真数据采集成本。
现有方法局限
现有生成方法(如 PhysGen3D、PhysGM、PhysX-Omni)通常将重点放在几何与外观重建,对物理属性建模不足或仅做后验推断:
- 难以联合优化几何、材质与接触参数,导致生成资产外观合理但物理行为失真;
- 缺乏交互证据闭环,生成结果无法通过机器人操作反馈进行迭代修正;
- 对可变形对象的各向异性材料、非线性形变和自碰撞等特性处理粗糙,仿真稳定性差。
为什么这个问题难/重要
可变形物体的形变响应直接影响抓取、搬运和释放的成功率,但文本和图像只提供静态外观证据,无法直接观测其在受力下的行为。生成体系必须解决 物理约束耦合、交互验证 两个核心难题:既要保证几何、材质、接触参数相互一致,又要通过仿真测试驱动迭代改进。这在机器人策略学习、sim-to-real 迁移和数据合成中具有高价值,业界普遍关注可交互、可重放的仿真资产生成。
行业类比
类似自动驾驶仿真中需要生成物理真实感的路面与障碍物资产,机器人操作领域也需要可变形资产来支撑策略训练与测试。
核心洞察
- **物理交互验证是生成可形变资产的必要闭环**。仅从文本或图像生成可形变物体,其几何、材质与形变响应高度耦合,静态视觉线索无法提供足够的接触行为证据;DeformSmith 通过共享 physics-grounded harness 执行机器人交互测试,将操纵反馈作为生成信号,从而筛选出可抓取、可转移的资产。这与 PhysGen3D 等仅做视觉生成或简单物理模拟的方法形成本质差异,为机器人仿真数据管线的自动化提供了可复用的验证范式。
- **层级化 agentic construction 解耦复杂物理属性与几何外观**。DeformSmith 将资产构建拆分为几何、物理模型、材料行为、机器人交互等多个子任务,由 agent 逐步生成和优化,而非端到端一次性输出。这种模块化策略降低了联合优化的难度,使得每个环节可以独立测试和修正,相比 PhysGM 等统一生成模型更易于调试和扩展,对工程落地中需要局部调整材质或控制参数的场景尤为重要。
- **可回放交互数据生成支持机器人操作数据合成**。DeformSmith 不仅能生成资产,还能记录并回放交互过程,形成带物理标注的操作数据。这为 deformable object manipulation 的数据稀缺问题提供了一种自动扩增方案,相比于直接采集真实数据或手工设计仿真场景,显著降低成本和门槛,且保证了物理一致性。
方法
输入
DeformSmith 接受文本描述或单张图像作为输入,无需预先测量物体物理参数。
关键模块
- 层次化智能体构建
多个专用 agent 分工协作:负责几何生成、物理模型构建、材质行为设定。它们通过迭代对话协调设计,逐步完善资产属性。 - 共享物理仿真 Harness
统一物理引擎作为评测环境,在生成过程中反复验证资产在接触、抓取、变形下的响应,量化物理可信度。 - 机器人交互闭环
引入操作反馈:机器人尝试抓取、移动、释放资产,交互数据(力、变形、成功与否)被记录并回放,用于驱动 agent 进一步细化物理参数与几何。
输出
最终产出可交互、物理可信的变形资产(包含几何、外观、材质物理模型),以及可回放的交互数据集,直接用于机器人操作仿真与训练。
与同类方法差异
对比 PhysGen3D、PhysGM、PhysX-Omni 等一次性生成或依赖静态物理先验的基线,DeformSmith 的核心差异在于:通过共享物理 harness 与机器人交互反馈构成闭环迭代,用实际交互证据不断校正资产,而非仅依赖生成模型先验。
实验
实验设计
- 输入模态:文本或单张图像。
- 对比基线:PhysGen3D、PhysGM、PhysX-Omni。
- 评估维度:视觉质量、物理合理性,以及生成资产在机器人操纵模拟中的可用性。
- 附加验证:通过机器人交互闭环生成可回放数据,用于下游策略验证。
关键发现
- DeformSmith 在视觉质量和物理合理性上优于三个基线。
- 层级式代理构建与共享物理接地测试架共同保证了几何、材质、形变响应满足耦合物理需求。
- 生成的交互数据可复现,并支持机器人操纵数据合成。
与基线对比的深度解读
- 基线方法通常侧重外观生成或物理模拟的单一方面,缺乏交互证据引导。
- DeformSmith 的“构建—测试—优化”闭环以机器人操作反馈为依据,直接优化资产的可交互性,从而获得更高的物理可信度。
行业影响
落地场景
DeformSmith 可直接用于机器人操作仿真数据生成,尤其面向衣物、食品、线缆等变形物体。电商平台可自动生成商品的可交互 3D 资产,用于虚拟试穿与 AR 展示;内容平台或游戏团队能快速产出物理可信的毛绒玩具、软体道具,降低手动建模成本。
商业价值
- 降本:替代手工建模与物理参数调试,单资产制作时间从数小时缩短至分钟级,显著降低数字资产生产成本。
- 增收:加速机器人抓取/操作算法的训练数据合成,缩短产品迭代周期;同时提升电商/AR 内容的交互真实感,提高转化率。
- 体验提升:资产在按压、抓取时呈现合理形变,增强用户沉浸感。
与现有工作流的接口
DeformSmith 生成的资产可导出为 URDF/SDF 等标准格式,直接接入 Isaac Sim、MuJoCo、PyBullet 等机器人仿真环境。作为生成式 3D 管线的物理后处理模块,它可与 3D Gaussian Splatting 或 NeRF 重建结果结合,补齐物理属性。在机器人数据闭环中,可作为数据合成引擎,与模仿学习或强化学习框架对接,批量生成带交互反馈的变形物体操作数据。与 PhysGen3D 等基线相比,DeformSmith 强调闭环交互反馈,更适合需要物理一致性的操作场景。
具体用例:电商平台的虚拟试衣间可使用 DeformSmith 从单张服装图片生成可变形 3D 服装,用户拖拽时呈现真实褶皱;物流机器人团队可批量生成不同软包货物的抓取仿真数据,训练视觉-触觉策略。
局限
- - **依赖上游生成质量**:DeformSmith 采用分层 agentic 构建,初始几何与外观由基础模型生成,若输入文本描述模糊或图像存在遮挡,可能产生不合理初始资产,后续物理精化虽能部分修正,但无法完全消除上游误差。这一点在论文实验中未对极端输入(如严重遮挡 / 抽象描述)进行消融,实际部署时可能需人工干预或额外过滤。
- - **仿真依赖与计算开销**:共享物理 harness 需多次迭代仿真与机器人交互反馈,生成单个资产的计算成本可能显著高于一次性生成方法。论文未给出具体耗时对比,且方法绑定特定物理引擎(如 MuJoCo / Isaac Sim),跨仿真器可移植性未验证,限制了在轻量级实时场景中的直接应用。
- - **复杂变形与材料多样性泛化有限**:实验主要覆盖常见可变形物体(绳索、布料、弹性体),对非均匀材料、多相物体或极端大变形场景表现未知。与 PhysGen3D 等相比在可变形物体上达 SOTA,但可能牺牲刚性物体生成性能,故通用性需进一步验证。