MRT: Masked Region Transformer 用于大规模分层图像生成与编辑
分层图像生成与编辑是一种基础能力,允许对生成的视觉内容进行逐层重用、编辑和组合,类似于自然语言中的单词级编辑。尽管其重要性,这在规模化方面仍是一个未被充分探索的领域。为填补这一空白,我们提出了 MRT,一个 20B 参数的 掩码区域扩散模型,专门用于多层透明图像生成与编辑,在超过 10M 多语言设计样本上训练,涵盖多样的宽高比和文本提示。为充分利用这一规模,我们做出两项关键技术贡献。 首先,我们在一个共享的掩码区域扩散框架中统一了三个互补任务:文本到层、图像到层 和 层到层,其中选择性令牌掩码实现了灵活的逐层生成与编辑。其次,为实现溢出层生成,我们引入了 溢出感知画布层,它处理边界不一致性并支持半透明背景合成,从而可以生成超出可见画布边界的完整可编辑层。此外,我们应用 扩散蒸馏 实现了 8 步、实时的多层生成,质量损失极小。 大量实验表明,我们的框架在所有三个任务上显著优于先前最先进的方法(包括各种商业系统),为多层透明图像生成建立了新基准。值得注意的是,根据用户研究结果,我们的模型在图像到层质量上显著优于同期模型 Qwen-Image-Layered,同时在图像到层推理中实现了 10-100 倍 加速,并将激活 GPU 内存消耗降低了 50-90%。
论文精读
TL;DR MRT 是一个 20B 参数的掩码区域扩散模型,统一了文字/图像到图层、图层间编辑等任务,通过溢出感知画布支持图层超出边界,并蒸馏至 8 步实时生成,性能大幅超越此前方案。
问题
在视觉内容生成领域,分层图像生成与编辑 正逐渐成为核心需求,它允许像处理文本中的词语一样对图像元素进行独立修改和组合。然而,现有方法多聚焦于生成单一扁平图像,缺乏层级结构,难以支持灵活的后编辑操作。少数支持分层输出的模型要么受限于固定图层数,要么无法处理半透明背景 和画布外溢出内容,导致生成的图层不完整、不可用。此外,当前工作中文本到层 (text-to-layers)、图像到层 (image-to-layers)、层到层 (layers-to-layers) 等任务通常独立设计,未形成统一框架,造成模型复用性差、推理效率低。
这一问题的困难在于:多层生成需同时保证层间一致性、透明度处理 以及动态层数支持;大规模训练数据稀缺,标注成本极高;且商业设计工具对实时编辑性能要求严苛。该领域的重要性则体现在AI 辅助设计 的海量应用场景,如海报、Logo、界面原型和商品展示等,这些场景迫切需求可直接使用的可编辑分层资产。
类比而言,分层图像生成之于视觉创作,就如同词级编辑 之于自然语言处理:它不仅提升了内容生成的精确度,更让自动化设计系统真正具备对象级操控力。
核心洞察
- **统一掩码区域生成框架** 将文本到图层、图像到图层、图层到图层三个任务无缝整合进单一 20B 扩散模型,通过选择性 token 掩码实现灵活条件控制。这种任务统一打破了以往分层生成方法各自为政的局面,使模型能够共享参数与表征,不仅降低了维护多个专用模型的工程成本,还为跨任务迁移学习提供了可能,是实际大规模部署中的架构创新。
- **溢出感知画布层** 引入 Overflow-Aware Canvas Layer 专门处理图层元素超出可见画布边界的合成难题,支持半透明背景下的完整可编辑图层生成。相比现有方法受限于裁剪边界导致的不完整输出,该设计使生成结果真正具备工业级可复用性,允许后续自由编辑与重组,对于需要精细分层的设计工具而言,解决了边界完整性这一核心痛点。
- **扩散蒸馏实现实时生成** 将 20B 参数模型的推理从多步降至仅需 8 步,同时保持质量损失最小,在图像到图层任务中相比同期 Qwen-Image-Layered 实现 10–100 倍加速与 50–90% 显存节省。这种部署友好型优化证明了大容量生成模型可通过蒸馏大幅降低计算门槛,为分层图像生成走向实际产品集成扫清了效率障碍。
方法
输入与任务统一
MRT 支持三类输入与对应任务:文本提示(text-to-layers)、参考图像(image-to-layers,从扁平图像自动分层)、现有图层组(layers-to-layers,进行层编辑与重绘)。所有任务共享同一模型权重,通过不同的掩码模式区分。
核心模块:掩码区域扩散
模型基于 Transformer 架构,将多层图像表示为区域 token 序列,并融入选择性 token 掩码。训练时,随机掩码某些图层的部分 token,要求模型依据未掩码的文本、图像或图层 token 预测被掩码部分。这样,
- 若掩码所有图层 token,则实现从文本生成全新图层组;
- 若仅给定稀疏参考图 token 并掩码其余,则实现图像到图层的分解;
- 若掩码部分图层 token 而保留其他,则实现图层级别的编辑与重绘。
框架引入溢出感知画布层:在标准画布外额外定义一扩大的“溢出层”,使模型能生成超出可见边界的图层内容,并支持半透明背景合成,确保图层完整可编辑,消除传统方法中边界截断的不一致性。
加速推理
通过扩散蒸馏,将原本高步数(例如 50 步)的采样过程压缩至 8 步,大幅降低延迟至实时交互级别,同时借助蒸馏损失保持生成质量。
输出与工程优势
最终输出为多层透明图像,各层可独立导出。与常见逐层单独训练的模型相比,MRT 的统一掩码范式消除了多模型部署的冗余;溢出画布设计直接解决了生产环境中图层越界的痛点;蒸馏使模型能在资源受限场景下快速运行,推理速度比同期模型快 10–100 倍,显存占用降低 50%–90%。
实验
实验设计与评估协议
MRT 在 文本到图层、图像到图层 和 图层到图层 三个任务上统一评估,覆盖生成与编辑能力。训练数据为超 1000 万多语言设计样本,支持宽高比和文本提示多样化。评估采用用户研究(偏好投票)与客观指标结合的方式,对比对象包括现有最佳方法及多个商业系统,特别是同期工作 Qwen-Image-Layered。
关键发现
- 全面领先:MRT 在所有三个任务上均显著超越先前 SOTA,包括商业系统,树立了多层透明图像生成的新基准。
- 速度与内存优势:在图像到图层任务上,较 Qwen-Image-Layered 推理速度提升 10-100 倍,GPU 显存占用降低 50-90%,这得益于扩散蒸馏至 8 步实时生成,且质量损失极小。
- 溢出感知画布层:新设计的溢出层有效处理边界不一致性,支持半透明背景合成,可生成超出可见边界的完整可编辑图层,解决了实际设计中的拼接痛点。
- 任务统一范式:通过共享掩码区域扩散框架与选择性令牌掩码,三任务协同训练,不仅简化了系统设计,还提升了各子任务的生成质量与灵活性。
与基线的深度对比
MRT 相对于传统分层生成方法的优势来自规模与架构创新的结合。20B 参数的大模型充分吸收了海量设计数据中的图层结构与语义关系,而掩码区域扩散机制允许模型在推理时灵活控制哪些部分生成、保留或编辑,这是先前专用模型难以实现的。
特别地,与 Qwen-Image-Layered 的对比凸显了蒸馏策略的巨大价值:在用户研究中质量明显胜出的同时,推理效率实现数量级提升,这使得实时交互式设计工具成为可能。此外,溢出层的引入解决了多图层拼接时的内容溢出这一长期工程痛点,商业系统中往往依赖后处理,而 MRT 将其融入端到端生成框架,从源头生成更一致、可直接使用的素材。
行业影响
落地场景
MRT 的分层图像生成与编辑能力可直接嵌入图形设计平台(如 Canva、Figma)、电商商品图制作(广告图、Banner 的图层级生成与替换)、内容创作工具(社交媒体模板、游戏资产)以及数字营销自动化流程。其 text-to-layers 模式允许设计师通过自然语言描述直接生成可单独编辑的前景、背景图层;image-to-layers 可将现有平面图智能拆解为多层结构,大幅降低重新分层的时间成本。
商业价值
- 降本:取代大量繁琐的手动分层工作,将设计师从重复性操作中解放,降低外包或人工成本;
- 增收:通过实时生成与编辑加速素材迭代,提升广告物料的 A/B 测试频率,从而优化点击转化率;
- 体验提升:8-step 蒸馏推理实现秒级多层生成,支持终端用户(如 Canva 模板用户)零门槛进行图层级定制,推动低代码设计工具的用户留存与付费转化。
与现有产品/工作流的接口
模型可封装为云端 API 或 本地插件,输入为文本描述或单张图像,输出标准 .psd/.svg 分层文件或带透明通道的各层图像。集成至现有设计工具时,只需在画布侧边栏添加“生成图层”或“智能分层”按钮,调用 MRT 服务后自动插入可编辑图层。其 overflow-aware canvas 特性确保超出画布的元素也能完整保留,与主流合成工作流无缝对齐。
具体落地用例
电商场景:某全球时尚平台的运营方上传一件服饰的白底图,通过 image-to-layers 自动拆分为模特、服装、配饰层,再利用 layers-to-layers 局部编辑(如替换背景、调整颜色),最后组合输出多尺寸的推广图,将制作周期从天级降至分钟级,同时保持图层可复用于后续节日促销改版。
企业营销设计:营销团队在 Canva 中选择模板,使用 text-to-layers 一次性生成多图层素材(标题、CTA 按钮、背景),营销文案人员即可直接修改文本层,无需调用设计师,形成从生成到发布的零摩擦闭环。
局限
- - **模型规模与推理成本**:MRT 参数量达 20B,虽然通过蒸馏将采样步数降至 8 步,显著提升实时性,但模型本体存储和加载仍对显存有较高要求(尤其多图层并行生成时),使得在消费级硬件或移动端上的部署受限。此外,蒸馏带来的质量损失在细致评估下可能仍有体现,作者在消融中列为待优化项。
- - **训练数据偏向性**:模型以超过 10M 多语言设计样本训练,主要源自 Canva 等设计平台,这可能导致生成风格更偏重平面设计、海报、UI 等人工合成场景,而对自然图像(如真实摄影、复杂光照场景)的泛化能力不足。尽管附录展示了一些自然场景分解,但与专用自然图像层分解方法相比仍有差距,可能产生结构错乱或语义不明的中间层。
- - **多层生成的一致性与溢出处理**:溢出感知画布层解决了图层超出边界的部分生成问题,但该机制依赖显式的溢出掩码预测,当层数增多或物体间重叠关系复杂时,容易出现分层不清晰、漏层或背景融合不自然等失败案例(附录 Failure Cases 中提及)。目前模型训练时通常限制图层数量,对任意数量图层的可扩展性未经验证,实际编辑应用中可能需要多次推理或人工后处理。