Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
主体驱动图像生成旨在根据文本指令合成保留给定主体身份的新图像。现有方法通常分别编码文本和参考图像,限制了跨模态推理能力,并导致复制粘贴伪影。近期连接多模态模型与扩散模型的框架改进了指令跟随,但很大程度上忽视了身份保持。为解决这些限制,我们将扩散模型条件建立在联合编码文本和参考图像的多模态大语言模型(MLLM)上,并以基于VAE的身份条件进行增强。设计了一个新颖的双层级聚合(DLA)模块,用于聚合多级MLLM特征以实现最优条件,并采用多阶段去噪策略,在推理时逐步平衡来自MLLM的语义信息与来自VAE的细粒度身份细节。大量实验表明,我们的方法协调了多模态理解与身份保持,减轻了复制粘贴问题,在主体驱动图像生成的人类偏好方面取得了更优性能。项目网站:https://zsh2000.github.io/squeeze-mllm-subject-gen/。
论文精读
TL;DR 用 MLLM 联合编码文本与参考图,结合 VAE 身份条件与双层级聚合,在主体驱动生成中平衡语义理解与身份保真,显著减轻复制粘贴伪影,达到人类偏好最优。
问题
问题背景:受试者驱动图像生成旨在根据参考图像与文本指令合成保留身份细节的新图像,当前领域核心关注在无需逐例微调的前提下兼顾语义遵循与身份保真。
现有方法局限:早期工作如 DreamBooth 和 Textual Inversion 通过微调个性化扩散模型实现高身份保真,但扩展性差。后续免训练方法多采用分离编码:文本与参考图像分别提取特征,再注入扩散模型。这种架构限制了跨模态推理能力,模型难以理解图像内容与文本意图的深层关联,容易直接复制参考图像中的视觉元素,产生**“复制-粘贴”式伪影**。近期将多模态大模型(MLLM)与扩散模型连接的方案虽改善了指令遵循,却往往忽视细粒度身份保持,导致生成结果中主体外观失真或纹理偏移。
为什么这个问题难/重要:核心难点在于语义理解与身份保留的张力。MLLM 的联合编码蕴含丰富语义但缺少像素级身份信息;VAE 身份条件可提供纹理与几何细节,但直接注入会干扰语义布局。因此,如何在去噪的不同阶段平衡两种信号,以及如何从 MLLM 多层特征中聚合出最优条件表示,构成关键挑战。业界对个性化生成需求迫切,广告创意、虚拟试穿等场景要求模型既准确解读多模态指令,又严格维护主体外观一致性,极低的容错率使该问题成为生成式 AI 落地的瓶颈之一。
行业类比:这好比一个智能设计助手,拿到一张产品图和一句“把它放在沙滩上”,需要既生成逼真的沙滩背景,又不能让产品变形或颜色失真——本质上是跨模态理解与视觉一致性之间的精细化权衡。
核心洞察
- 联合编码文本与参考图像的多模态大语言模型(MLLM)作为扩散条件,从根本上改变了主体驱动生成中的信息融合方式。现有主流方法通常将文本和图像特征分开提取,再通过交叉注意力注入扩散模型,这导致跨模态交互有限,容易产生将参考主体直接“粘贴”到生成场景的伪影。本文采用 MLLM 在词符级别融合多模态信息,使模型能推理主体属性与文本指令的关系,从而生成更和谐的合成图像,并显著缓解 copy-paste 问题。这一思路将主体驱动任务从简单的特征注入升级为基于理解的生成,提升了指令遵循与身份保留的一致性。
- 双层级聚合(DLA)模块与多阶段去噪策略的结合,在利用 MLLM 丰富语义的同时保留了 VAE 提供的细粒度身份信息,解决了多模态条件与身份条件难以协同的难题。同类工作要么侧重语义对齐而牺牲身份相似度,要么过度依赖 VAE 身份特征导致编辑灵活性下降。DLA 从 MLLM 不同层提取互补特征进行聚合,为扩散模型提供多层次条件;多阶段去噪则在不同时间步动态调整 MLLM 特征与 VAE 身份特征的贡献比例,早期侧重布局和语义,后期增强细节身份,实现了高质量生成与身份保真度的平衡。这一设计为多条件扩散模型的推理调度提供了新的思路。
方法
输入与条件路径
输入包含一张参考主体图像和一条文本指令(如 “a dog wearing sunglasses”)。条件信号通过两条路径注入 Diffusion Transformer (DiT) 主干:
- 语义路径:由 MLLM(如 LLaVA)联合编码图文对,输出多层 token 特征,保留跨模态对齐能力。
- 身份路径:使用预训练 VAE 对参考图编码,提取细粒度身份特征(纹理、轮廓等)。
关键模块
- Dual Layer Aggregator (DLA):基于 Layerwise Attention Pooling,对 MLLM 每层 token 序列做可学习的 attention 池化,生成该层摘要向量;DLA 再通过可学习权重融合若干选定层的向量,形成最优全局条件。这避免了单层信息不足或后期特征语义弱化的问题。
- Multi‑stage Timestep‑aware Denoising:推理时将去噪过程按 timestep 分段:早期阶段分配更高权重给 MLLM 语义条件,以确定布局和对象关系;后期逐渐增强 VAE 身份条件的权重,精修主体细节。权重由 timestep‑aware 调度器控制,实现平滑过渡。
- Two‑stage Training:第一阶段仅用 MLLM 条件训练基础生成能力;第二阶段加入 DLA 与身份路径,联合微调,避免训练冲突。
输出与差异
生成图像既高度遵循文本指令,又忠实保持主体身份,显著减少 “copy‑paste” 伪影。 与 IP‑Adapter 等分离编码方案相比,本方法依托 MLLM 的联合编码固有地提升了跨模态推理,同时通过 VAE 身份分支弥补 MLLM 对精细身份细节捕捉不足的短板。
实验
实验设计思路
本文实验围绕 主体驱动生成(subject‑driven generation)的核心挑战——语义理解 与 身份保真 的平衡展开。对比基线分为三类:
- 纯文本条件扩散模型(如 Stable Diffusion)
- 独立编码文本与参考图的个性化方法(如 DreamBooth、IP‑Adapter)
- 将多模态模型与扩散模型结合的框架(连接 MLLM 和扩散模型,但弱化身份保持)
实验采用 人类偏好评估 作为主要判据,并定性展示随机样本。消融研究验证了 Dual Layer Aggregation (DLA) 中的跨层特征聚合有效性以及 多阶段时间步感知去噪 在推理中的重要性。
关键发现
- 跨模态推理显著增强:MLLM 联合编码文本与参考图像,使模型能理解复杂指令(如“将主体置于特定场景,同时改变姿态”),生成结果不再出现简单的 “复制‑粘贴”伪影。
- 身份细节通过 VAE 路径精确注入:在扩散过程中,VAE‑based identity conditioning 保证了面部纹理、服饰等细粒度特征的高保真重现,弥补了纯 MLLM 特征在细微身份信息上的不足。
- DLA 模块实现最优特征融合:从 MLLM 浅层(保留空间细节)到深层(富含语义)的多级聚合,比单一层或简单平均更有利于平衡全局语义与局部身份。
- 多阶段去噪策略渐进式平衡信息源:早期去噪步骤更依赖 MLLM 的语义引导,后期则加强 VAE 的身份约束,有效避免了“语义主导时身份模糊”或“身份主导时忽略指令”的问题。
与基线的深度对比
与 DreamBooth 等比,本方法无需逐主体微调(zero‑shot),在部署灵活性上明显占优。相较于 IP‑Adapter 等独立编码的方案,联合编码带来的跨模态注意力使指令遵循更准确,尤其对于涉及属性绑定的复杂描述(例如“给猫戴上太阳镜,放在沙滩椅上”),不再出现属性错配。而与近期直接连接 MLLM 与扩散模型的工作相比,本文通过 VAE 身份分支 解决了它们普遍存在的“主体身份漂移”问题,在人类偏好评分上取得领先,体现出 理解力与身份保真 的协同提升。
行业影响
落地场景
主体驱动生成(subject-driven generation)可直接赋能电商商品图生成、个性化内容创作与虚拟形象定制。例如,输入一张产品照片与一句文字描述“沙滩阳光下摆放”,无需对模型进行任何微调,即可实时产出高质量、多角度的营销素材。内容平台可利用该技术让用户上传自己的宠物、车辆或手办照片,通过自然语言指令生成不同风格、场景的社交分享图片,显著提升互动率。游戏与影视行业则可快速生成特定角色或道具在不同环境下的概念图,加速前期美术迭代。
商业价值
传统主体驱动方法(如 DreamBooth)需要逐主体微调,成本高、速度慢,难以规模化。本工作将多模态大语言模型(MLLM)与扩散模型深度融合,以零样本方式兼顾语义遵从与身份保持,直接降低个性化生成的单位成本。复制‑粘贴伪影的显著减少可大幅降低后期修图人工,尤其适合高频更新的商品图场景。更好的指令遵循与身份保真度能提升广告点击率与电商转化率,创造直接增收。对于提供生成式 AI API 的云服务商,集成该架构可打造更高端的“主体感知”生成能力,实现差异化定价。
与现有工作流的接口
该方法可封装为 Diffusion Transformer(DiT)或 Stable Diffusion 的即插即用条件模块。在 ComfyUI 等节点式工具中,可将Dual Layer Aggregation(DLA)模块与 VAE 身份编码表示作为新增输入节点,下游接标准采样器,无需改动现有管线。对于企业私有部署,可将预训练 MLLM 与扩散模型部署在同一推理节点,通过 多阶段时间步感知去噪 策略平衡语义与细节,支持批处理生成。API 层面可设计 /generations/subject-driven 端点,接受参考图像与文本,返回符合风格、身份一致的图像,轻松融入现有内容生产流水线。
具体落地案例
- 电商商品图:商家拍摄一只手提包,输入“让模特拎着它走在傍晚的巴黎街头”,直接生成可直接投放的广告图,节省棚拍与后期成本。
- 社交平台滤镜:用户上传自家宠物照片,说出“画成吉卜力风格在森林里奔跑”,平台实时返回风格化图像,用于分享或头像,提升 DAU 与留存。
局限
- **计算开销与推理延迟**:方法依赖 **MLLM** 编码与多阶段去噪,推理成本显著高于仅使用 **VAE** 或轻量编码器的方案。这对实时交互场景(如在线图像编辑)可能造成瓶颈,且与边缘设备部署需求存在差距,实际落地时需权衡质量与效率。
- **MLLM 能力上限的约束**:模型的生成质量高度依赖所选 **MLLM** 的跨模态理解能力。若 **MLLM** 对参考图像的语义解析存在偏差,则身份保持可能劣化。论文仅在小范围模型内进行消融,未充分探讨不同规模或架构的 **MLLM** 带来的性能波动,泛化鲁棒性需进一步验证。
- **多主体场景的潜在局限**:论文指出可适配多主体生成,但核心设计(如 **DLA** 聚合与去噪策略)围绕单主体优化。当涉及多个交互复杂的主体时,不同主体间的身份混淆与属性纠缠可能加剧,现有框架能否稳定地逐一维护细粒度身份仍有待深入测试与评估。