OcclusionFormer: 为基于布局的图像生成安排 Z-order
近期布局到图像模型在空间可控性方面取得显著进展,但仍面临对象间遮挡问题。当边界框重叠时,多数现有方法缺乏显式遮挡信息,导致交叉区域生成存在歧义,难以确定复杂遮挡关系,常产生纹理纠缠或物理不一致的分层。 为应对该问题,我们首先构建SA-Z数据集,包含显式遮挡顺序与像素级标注。随后提出OcclusionFormer框架,基于扩散 Transformer解耦实例并通过体积渲染组装,显式建模 Z-order 优先级。此外,引入查询对齐损失(queried alignment loss)以细粒度监督各实例,增强语义一致性。 实验表明,该方法显著减少重叠区域歧义,强制正确遮挡依赖,保持结构完整性,在多种场景中取得准确性提升。
论文精读
TL;DR OcclusionFormer 通过显式建模 Z-order 优先级与体积渲染合成实例,解决布局生图的物体遮挡歧义,生成物理一致的前后叠层。
问题
问题背景
布局到图像生成(layout-to-image generation)近年大幅提升了空间可控性,允许用户通过 2D/3D 边界框 或实例分割掩码精确指定对象位置。但在多对象场景中,如何处理相互遮挡(inter-object occlusion)仍是一个关键瓶颈。
现有方法局限
主流方法大多将布局视为一组平行边界框,缺少显式的深度次序(Z-order) 信息。当边界框发生重叠时,模型对交叉区域的内容没有明确的前后关系指引,仅依靠隐式的交叉注意力或布局编码来推断遮挡。这会导致:
- 纹理纠缠(entangled textures):重叠区出现不同对象的混合纹理,视觉效果混乱。
- 物理不一致的层次:物体前后关系错乱,本应被遮挡的物体反而出现在上层。
- 复杂遮挡场景失效:在面对三个以上物体、非凸重叠区域时,现有方法几乎无法生成合理遮挡。
这些问题的根源在于训练数据 缺乏像素级遮挡标注 以及模型架构 未将遮挡建模为显式先验,而将重叠区的责任完全交给生成模型的隐式学习。
挑战与重要性
遮挡关系的正确建模面临双重挑战:一是 数据获取成本极高,需要大量带有像素级遮挡次序标注的图像,手动标注不可行;二是 生成架构需同时兼顾空间精度与遮挡一致性,将离散的 Z-order 先验注入连续生成过程易导致优化不稳定。在自动驾驶场景理解、AR/VR 内容创作及可控图像编辑等应用中,正确的遮挡是空间真实感的基础,业界对 空间可控且物理一致 的生成需求日益强烈。
行业类比
这一问题类似于 神经渲染中不透明物体的次序无关透明度合成——若半透明层顺序错误,混合颜色会失真。Layout-to-image 模型也需要将实例视为有序“图层”,按 Z-order 进行体积渲染式合成,才能消除重叠歧义。
核心洞察
- 显式建模 Z-order 是突破布局生成中遮挡模糊性的关键。以往方法仅在重叠区域隐式融合特征,无法保证物体间正确的遮挡顺序,导致纹理纠缠或物理不一致。OcclusionFormer 通过解耦实例并为每个物体分配明确的深度优先级,然后利用体积渲染按序合成,从根本上消除了重叠区域的歧义,使生成结果符合真实遮挡关系。
- 解耦实例生成 + 体积渲染合成提供了一种新的高可控布局生成范式。与直接融合多物体特征的 baseline 相比,OcclusionFormer 先独立预测每个实例的掩码和内容,再依据 Z-order 在透视角下进行体积合成,类似神经辐射场的体渲染。这种显式组合方式不仅保留了每个物体的结构完整性,还避免了跨物体属性污染,显著提升了空间精度和语义一致性。
方法
输入与条件
OcclusionFormer 接受以 2D 边界框与对象类别构成的布局作为主要空间约束,并额外引入 Z-order 遮挡顺序 标签。布局中的每个实例被分配一个归一化的深度优先级,该信息在训练时由 SA-Z 数据集 提供——该数据集包含逐像素的实例掩码与遮挡排序标注,使得模型能学习从布局到有序可见性的映射。
关键模块与生成流程
1. 实例解耦与 Z 轴延拓
模型首先将布局中的每个对象实例独立编码成特征表示:以边界框坐标、类别嵌入和深度值融合后,通过可学习的 InstanceDecoupling 模块将各实例投影到高维隐空间,得到一组解耦的实例特征向量。这一步显式为每个对象构建独立的“Z 轴”表征,避免传统方法将多个对象信息混合导致的混淆。
2. Z-Order 排序与体渲染合成
基于已知的遮挡顺序,特征按深度从小到大排序(或按优先级),之后送入一个可微的体积渲染器。该渲染器模拟射线穿过多个半透明层的物理过程:为每个实例预测不透明度与颜色,再沿深度方向按 over 操作合成,最终输出一张统一的 2D 特征图。此阶段直接决定了重叠区域的可见性分配,保证前景特征覆盖背景,且梯度能反向传播到各实例的参数。
3. 查询对齐损失与扩散生成
合成特征图与 timestep 嵌入一同注入到 Diffusion Transformer (DiT) 骨架中,通过流匹配(Flow Matching)的方式迭代去噪生成潜变量图像。为加强实例级空间精度,训练时额外引入 Queried Alignment Loss:在 Transformer 的注意力模块中,用可学习查询向量监督每个实例的分割掩码及语义一致性,迫使模型关注重叠区的正确归属。最终解码器将潜变量上采样得到 RGB 输出。
4. 训练策略
整体训练目标为扩散损失与查询对齐损失之和,后者权重通过实验调节。模型端到端训练,无需两阶段处理或外部掩码预测网络。
与同类方法的差异
相较于以往仅依赖空间注意力融合边界框的布局到图像生成方案,OcclusionFormer 通过显式实例解耦与体积渲染,将遮挡建模为物理可解释的 Z-order 先验,从而在重叠区域实现清晰且一致的层级关系,消除了纹理纠缠和物理不一致问题。
实验
实验设置
实验基于新构建的 SA-Z 数据集,该数据集在 SACap-1M 基础上为每张图像补充了实例级 Z-order 标注与像素级遮挡掩码,确保训练和评估时具有明确的遮挡先验。评估采用布局到图像生成任务标准协议:给定场景布局(类别标签+边界框),模型生成对应图像。对比基线包括既有布局可控生成方法(如 LayoutDiffusion、GLIGEN、ControlNet 等),以及不使用遮挡建模的 Diffusion Transformer 基线。定量指标涵盖生成质量 FID、布局一致性 mIoU、遮挡准确率等。
关键发现
OcclusionFormer 在所有重叠区域的遮挡一致性上取得大幅提升,能正确恢复遮挡关系,避免纹理纠缠。消融实验表明:
- 移除 Z-order 排序后,生成结果在重叠区域出现明显模糊和错误层次;
- 单独使用体渲染或查询对齐损失均能带来增益,但联合使用效果最佳;
- 查询对齐损失对提升实例语义保真度和边界精确性至关重要。
定性结果中,OcclusionFormer 渲染的前后遮挡关系自然,物体边界清晰,而基线方法在遮挡区域常产生不合理的混合纹理。
与基线对比的深度解读
现有布局到图像方法普遍将遮挡隐含在特征交互中,当边界框重叠时,生成模型被迫从模糊的上下文推断层次,导致物理不一致。OcclusionFormer 通过解耦实例、显式赋予 Z-order 优先级,并采用体渲染合成,将遮挡建模从生成主干中分离出来,从而根本性解决歧义。这一设计使得模型在复杂多物体场景中能够保持空间结构的严谨性,并有望扩展到 3D 场景理解与神经渲染等任务。
行业影响
落地场景
OcclusionFormer 解决的布局生成遮挡歧义问题,直接适用于需要精细空间控制的视觉内容生产场景。例如:
- 电商广告创意:给定多商品的位置与层级,自动合成符合物理遮挡的营销图,避免鞋盒穿模桌子等错误。
- 游戏/影视概念设计:按照设定的前景/中景/后景布局快速迭代场景草图,保证遮挡逻辑一致。
- UI/海报自动排版:内容平台(如社交媒体、新闻App)根据标题、图片、装饰元素的位置和Z序生成封面,减少人工调层。
- 数据增强:为检测/分割模型构建带遮挡的真值图像,提升模型对重叠场景的鲁棒性。
商业价值
- 降本:将原本需要设计师手动调整图层的重复劳动自动化,尤其在海量物料生成(如Feed流封面、商品主图)时,大幅减少人力成本。
- 增收:更高的生成质量提升广告点击率和转化率;同时结构化布局控制(含Z序)使A/B测试创意变体更快捷,加速素材迭代。
- 体验提升:消除重叠区域的纹理纠缠和物理不一致,使AI生成结果达到可用级水准,直接用于线上展示,减少人工检视概率。
与现有产品/工作流的接口
OcclusionFormer 基于扩散Transformer,可作为现有扩散模型(如Stable Diffusion)的可插拔条件模块集成。
- 输入接口:接受文本prompt + 2D边界框 + Z序(或从布局排序算法自动推断),输出高保真图像。
- 流程嵌入:在创意工具中增加“层级面板”,用户拖拽调整对象前后关系后,模型实时生成符合新遮挡的图像,与Figma、Canva等设计工具流程兼容。
- 推理管线:可部署为云端API,接收布局JSON,返回生成图像;或蒸馏为轻量模型嵌入移动端,供本地实时预览。其queried alignment loss可单独监督实例,便于与现有分割/检测模型联动,形成闭环标注。
具体用例:
- 电商旺季促销海报生成:运营人员指定多个商品包围促销文字,设置文字在最前、商品按重要性分层。OcclusionFormer 直接产出无穿模的可用图片,生产效率提升数倍。
- 自动化广告变体制作:广告投放平台依据不同受众和尺寸,自动重排元素布局和遮挡关系生成千套创意图,避免人工一一核对图层错误。
局限
- **高质量遮挡标注依赖**:SA-Z 数据集依赖像素级实例掩码与 Z-order 先验,构建成本高且难以覆盖开放世界中所有遮挡模式。虽然比现有布局数据集更精细,但其标注范式仍难轻易迁移到无监督或弱监督场景,限制了方法在大规模无标注数据上的扩展性。
- **计算开销与推理速度**:框架同时引入扩散 Transformer 与体积渲染,并在训练时附加 queried alignment loss,模型复杂度显著高于常规 layout-to-image 基线(如 GLIGEN、LayoutDiffusion)。论文仅在单卡设置下测试,未与其他方法进行系统的效率对比,对实时交互式生成场景的适用性存疑。
- **泛化到极端遮挡与域外布局**:实验主要在 SA-Z 和 COCO 等受控分割上开展,对严重重叠、小目标密集遮挡或非同源分布下的布局(如漫画分镜、遥感图像)未做评估。显式的 Z-order 建模在面对数量可变的实例及非线性遮挡关系时,适应性仍待验证。