论文

Tetris3D: 物体相互契合的 3D 场景生成

Tetris3D: 物体相互契合的 3D 场景生成

现有单图 3D 场景重建方法常独立生成物体或仅隐式耦合,难以保证相互交互的相邻物体之间细粒度空间兼容性。 为此,我们提出 Tetris3D,一个以周围物体几何与物理关系为显式条件的生成框架,引导每个物体的形状与位姿在场景中保持几何和物理合理。同时,我们构建了 ComOb,一个基于物理仿真的数据集,包含 1.2M 个场景、跨类别物理交互、逐物体网格以及成对物理关系标注。 在合成与真实场景上的综合实验表明,Tetris3D 即使在交互区域被遮挡时,也能恢复连贯的物体形状与位姿,并在生成质量和物理稳定性上达到 state-of-the-art 性能。

论文精读

TL;DR Tetris3D 从单张图像重建 3D 场景,显式建模物体间几何与物理关系,让每个物体的形状和位姿与邻近物体自然契合,并在 1.2M 物理仿真数据集 ComOb 上训练,实现遮挡区域下的稳健生成。

问题

问题背景

从单张 RGB 图像恢复完整 3D 场景 是当前生成式 AI 的重要方向,核心目标不仅是每个物体的几何外观,而是让物体作为 场景整体 在空间与物理上相互协调。

现有方法局限

  • 早期工作将物体 独立生成 后拼装,缺乏对相邻物体接触面的约束,常出现穿插、悬浮或不贴合。
  • 一些方法通过 隐式耦合 生成场景,但耦合发生在全局特征层面,难以传导到局部几何,无法保证 细粒度空间兼容。
  • 当物体之间存在遮挡或物理交互(如堆放、插入)时,现有模型对未观测区域的 amodal 补全 缺乏显式引导,容易产生穿模或无法稳定支撑的结构。

为什么难 / 重要

核心难点在于:可见像素只提供部分信息,而物体间 物理关系(支撑、接触、堆叠)需要推断不可见几何。同时,监督数据稀缺:现有场景数据集要么不含真实交互,要么缺少逐物体网格和 成对物理关系标注。业界对 可交互 3D 场景 需求强烈,涉及 AR/VR 内容生成、机器人操作仿真、具身智能训练环境构建。若生成场景物理不稳定,下游应用会直接失败。

行业类比

这与 自动驾驶中从单帧推断被遮挡车辆完整姿态 的场景类似,都需要从部分观测中重建物理合理且几何一致的物体关系。

核心洞察

  • Tetris3D 的核心在于显式地将物体生成条件化于周围物体的几何形状与成对物理关系,从而确保场景中相邻物体在形状和姿态上相互适配。与以往独立生成每个物体或仅通过隐式特征耦合的方法不同,Tetris3D 直接注入周围物体的体素几何和关系类型(如支撑、接触)作为条件,引导生成网络输出与之兼容的形状和位姿,在物理合理性上显著优于 baseline。
  • ComOb 数据集通过物理模拟生成 1.2M 个具有真实物理交互的场景,并为每个物体提供网格和成对关系标注,为训练几何-物理一致性生成模型提供了关键监督信号。现有 3D 场景数据集通常缺乏细粒度物理关系标注,难以训练模型理解物体间相互作用;ComOb 利用物理引擎自动合成多样化场景并记录稳定后的位姿与关系,使模型能够直接学习 “物体如何 fit together”,这也是 Tetris3D 能取得 SOTA 物理稳定性的重要原因。

方法

输入与预处理

给定单张 RGB 图像,Tetris3D 首先利用 TRELLIS.2 作为 3D 生成先验,对场景中的物体进行检测、分割与初始潜空间编码,并构建物理依赖图,表示物体间的支撑、接触、堆叠等关系。

关键生成模块

  • Pose-Aligned Object Generation:每个物体的生成都在场景坐标系下与已生成/真实姿态对齐,避免独立坐标系下的错位。
  • Object Interaction-Aware Generation:生成时注入三类条件——空间上下文:周围物体的几何占用、关系类型:物理关系标签、交互条件:需要保持的接触/支撑约束。
  • Voxel-Aligned Condition Injection:将相邻物体的几何信息体素化并对齐到当前物体的生成空间,作为显式条件输入,指导形状和姿态保持局部兼容。
  • V2I Attention:通过可见区域到不可见区域的注意力机制,在交互区域被遮挡时进行非模态补全,确保接触面形状合理。

训练与数据

训练使用 ComOb 数据集,包含 120 万物理仿真场景及逐物体网格、成对物理关系标注;采用遮挡课程训练(curriculum training with occlusion)和深度增强(depth augmentation)提升鲁棒性。

输出与差异

最终输出逐物体 3D 网格及其在场景中的姿态,整体恢复物理稳定的 3D 场景。与既有方法独立生成或隐式耦合不同,Tetris3D 显式建模物体间物理关系并以相邻几何为条件,从而在遮挡交互区域也能保持细粒度空间一致性。

实验

实验设计

  • 在自建物理交互数据集 ComOb(120 万场景,含逐物体网格与成对物理关系标注)及合成、真实世界场景上评估。
  • 对比基线包括独立生成物体或隐式耦合的现有方法,评估生成质量与物理稳定性。
  • 指标覆盖几何精度(如 Chamfer Distance、F-Score)、空间对齐(Bounding-box IoU、Rotation Error)及物理合理性(Penetration Depth、Mean Displacement、Peak Kinetic Energy)。

关键发现

  • Tetris3D 在交互区域被遮挡时仍能恢复物理与几何上连贯的物体形状和位姿。
  • 在生成质量和物理稳定性两个维度均达到 SOTA 水平。
  • 显式条件生成机制使物体能“像俄罗斯方块一样”契合邻居,避免穿插与悬空。

与基线对比

  • 基线方法常独立生成或隐式耦合物体,缺乏对相邻物体间细粒度空间兼容性的明确指导,导致交互区域易出现几何冲突或物理不稳定。
  • Tetris3D 通过逐物体条件生成,注入邻居几何与物理关系(如支撑、接触、遮挡),直接约束形状与位姿,从源头提升空间一致性。
  • 该差异在遮挡场景中尤为显著,证明显式物理感知建模优于隐式耦合策略。

工程启示:对交互式场景生成,建议将物理关系作为显式条件而非后处理,以保障生成结果的可物理仿真性。

行业影响

落地场景

Tetris3D 的核心能力是从单张图像重建物理与几何一致的 3D 场景,尤其适合电商商品展示与 AR 试摆。例如,家居电商可上传单张房间照片,自动生成可交互的 3D 房间布局,支持用户替换家具并实时验证尺寸与碰撞。另一场景是工业仿真:从产品实拍图生成带物理约束的 3D 装配场景,用于机器人抓取训练或数字孪生。

商业价值

现有单图 3D 生成普遍忽略物体间物理交互,导致输出模型在应用中穿模、悬空,需要人工修复。Tetris3D 通过显式条件生成和物理关系数据集 ComOb,显著降低后处理成本,并提升生成结果在电商预览、游戏资产搭建中的直接可用性。对电商平台,更真实的 3D 场景可提高用户停留与转化;对内容制作团队,可减少 3D 美术的重复修正工作。

与现有工作流接口

该方法基于 TRELLIS.2 架构,可作为现有 3D 生成管线的增强组件。集成时,可在输入单图后增加物理依赖图构建与可见性注意力模块,输出对象网格及成对物理关系标注。与 Blender、Unity 或 NVIDIA Omniverse 等工具打通后,可直接导入场景进行物理模拟或交互编辑。建议团队先在小规模自有数据上验证物理一致性收益,再替换原有独立生成模块。

局限

  • **单图像输入的固有限制**:方法依赖单张图像进行 3D 场景重建,当物体间存在严重遮挡或视角不利时,即使通过 **V2I Attention** 进行 amodal completion,仍可能无法准确恢复被完全隐藏的几何细节,导致生成的物体形状或位姿偏离真实物理关系,尤其在物体交互区域被大面积遮挡时,物理合理性难以保证。
  • **仿真数据集与真实世界差异**:**ComOb** 数据集基于物理模拟生成,其物体属性(如摩擦系数、质量分布)和碰撞处理采用简化模型,与真实世界物体的复杂物理行为存在 gap;模型在合成数据上表现良好,但迁移到真实图像时,对于材质、变形或非刚性交互的泛化能力尚未验证,可能导致物理稳定性指标下降。
  • **关系推断的级联错误风险**:方法需要预先推断物体间的物理关系类型(如 support、contact),若该推断模块出错,后续显式条件生成会基于错误关系执行,造成连锁错误;此外,对训练集中未出现的新物体类别或复杂交互组合,关系推断的准确性和泛化性存疑,限制了方法在开放场景中的适用性。
论文Jaeyeong Kim2026-10-07原文

相关内容