CtrlVTON: 基于视觉实例提示分割的可控虚拟试穿
虚拟试穿 (VTO) 在将服装逼真地迁移到目标人物身上方面取得了显著进展,但大多数系统对服装的穿着方式——尺寸(宽松或合身)、风格(例如塞入或外露、敞开或闭合)以及身体上的空间位置——几乎无法提供用户控制。 我们通过两项互补贡献填补这一空白。首先,我们定义并解决了视觉实例提示分割任务(通过 VIP-SAM):给定服装的平铺图像,在穿着该服装的人物照片中分割出该特定实例。这是实例级任务,不同于通常研究的类别级分割。其次,我们提出 CtrlVTON,一个可控 VTO 框架,将试穿重塑为图像编辑问题,并添加分割掩码作为对服装布局(包括风格、尺寸和身体空间位置)的像素级控制。 VIP-SAM 和 CtrlVTON 分别在各自任务上达到最先进水平。尤其,CtrlVTON 生成的图像能比最强专有编辑系统更忠实地遵循用户提供的布局,同时在服装保真度上与之匹敌。
论文精读
TL;DR CtrlVTON 通过视觉实例提示分割实现可控虚拟试穿,让用户像素级调整服装的大小、风格与位置,布局遵循性超越最强专有编辑系统。
问题
问题背景
虚拟试穿(VTO)已能较真实地将衣物迁移到人物图像,但领域正从单纯的自动贴合转向更精细的可控生成,用户期望自主定义穿衣细节。
现有方法局限
当前 VTO 系统几乎都只能自动完成衣物覆盖,缺乏像素级布局控制。具体技术局限包括:
- 尺寸不可调:无法指定宽松或紧身程度。
- 风格不可控:不能指定塞入裤子、敞开外套等穿法。
- 空间位置固定:无法平移或局部调整衣物在身体上的位置。 这导致生成结果单一,背离真实穿搭的多样性。即便最强的商用图像编辑系统(如 Adobe Firefly),在跟随精确衣物布局时也常出现形变失真或纹理丢失,因为它们未将平铺衣物视为精确实例进行控制。
为什么这个问题难且重要
技术挑战集中在三方面:
- 实例级分割:需从平铺图(flatlay)识别出穿着图中同一具体衣物实例,而非仅类别分割。传统参照式分割(ReferSeg)多基于文本或类别,无法区分同款不同件的衣物,更不能应对大幅形变与遮挡。
- 形变与外观解耦:控制时需维持衣物纹理的高保真度,同时严格遵循用户给出的掩码布局,现有图像编辑框架容易在编辑中丢失衣物身份或物理合理性。
- 评估困难:缺乏度量“编辑遵循度”的标准化指标,需要同时评估掩码贴合度(IoU、Hausdorff 距离)和衣物保真度(DINO/CLIP特征一致性)。
业界关注度极高:可控 VTO 可让商家快速生成多风格商品图,提升电商转化率;对虚拟试穿创作工具来说,它像图层式控制一样赋予用户调整穿着的自由。
行业类比
这类似ControlNet为文生图引入空间对齐能力——先有基础生成,后有精确定制,CtrlVTON 则试图在 VTO 中实现同等水平的布局控制,从“自动试穿”跃迁到“按需试穿”。
核心洞察
- 将虚拟试穿重新定义为图像编辑任务,通过分割掩码实现像素级布局控制。这与主流基于服装扭曲或扩散模型无条件生成的方法不同,用户可通过直接绘制或修改掩码,精确指定服装的穿着方式(如塞入、敞开)、尺寸和位置。这种把试穿解耦为「布局指定 + 纹理填充」的范式,既降低了对复杂人体解析的依赖,又提供了远超文本描述的空间精度,为交互式试穿应用开辟了新可能。
- 提出视觉实例提示分割(VIP-Seg)任务,并构建 VIP-SAM 模型,弥补了从平铺商品图到具体实例分割的空白。不同于常见的类别级分割,该任务要求模型理解特定服装的独有特征(如印花、剪裁),并在变形、遮挡下将其与穿着照片中的区域对应。这为可控试穿提供了精准的掩码真值来源,其跨图像实例匹配能力也可推广至其他细粒度视觉识别任务。
方法
整体框架
CtrlVTON 将虚拟试穿重新定义为可控图像编辑任务:给定人物图像、平铺服装图像以及用户指定的布局掩码(描述服装应如何穿着),生成自然的试穿结果。核心由两个模块组成:VIP-SAM 负责从参考服装图像中分割出目标人物图像中对应服装的精确实例掩码;CtrlVTON 编辑模型 将掩码作为像素级控制信号,引导生成过程。
输入与 VIP-SAM 分割
输入包含:
- 目标人物图像
I_person - 平铺服装图像
I_garment - 可选的用户提供掩码
M_user(或由 VIP-SAM 自动生成)
VIP-SAM 是一种视觉实例提示分割模型,基于 SAM 架构,通过引入服装参考分支实现对特定服装实例的零样本分割。它接收 I_garment 和 I_person,输出该服装在人物身上的二值掩码 M_garment。与传统的类别级分割不同,VIP-SAM 能够区分外观相似但细节不同的服装实例,从而免去人工标注布局的繁琐。
可控编辑生成
CtrlVTON 编辑模型建立在预训练的扩散模型之上,将掩码作为额外的空间条件注入去噪过程。具体方式:
- 将掩码下采样后与噪声潜变量在通道维度拼接,或通过交叉注意力以 token 形式注入(实验证明通道拼接更稳定)。
- 服装特征通过 ReferenceNet 提取,并与文本提示共同控制生成,确保服装纹理细节的保真度。
- 训练数据通过从成对试穿图像中自动合成布局掩码构建:对穿着图像施加多种掩码扰动(如缩放、平移、变形),模拟用户对尺寸、塞入/不塞入等风格的控制,形成编辑前后的数据对。
损失函数结合了扩散去噪损失、掩码一致性损失(促进生成结果与目标掩码对齐)以及服装保真度损失(基于 CLIP 和 DINO 特征),平衡布局遵循与服装外观保持。
输出与评估
最终输出为一张人物图像,其中服装严格按照输入掩码的布局放置,同时保持细腻的纹理、光影和褶皱。实验表明,CtrlVTON 在掩码遵循度(IoU, Hausdorff 距离)上远超 GPT-4o 等专有编辑系统,而服装保真度指标(M-DINO, M-CLIP-I)与最先进方法持平或更优。
关键差异
不同于传统 VTO 方法仅完成“服装迁移”而缺乏对穿着方式(宽松/修身、塞入/不塞入)的显式控制,也不同于基于文本的编辑系统只能提供模糊的语义指令,CtrlVTON 首次通过实例分割掩码实现了像素级的精确布局控制,将“试穿”转变为“按指定摆放生成”的可控生成问题。
实验
实验设计围绕两个核心贡献展开:VIP-SAM 的实例分割任务与 CtrlVTON 的可控虚拟试穿任务。
- VIP-SAM:在成对的 flatlay 图像与人物穿着照片上评估分割特定服装实例的能力,对比类别级分割方法。
- CtrlVTON:采用图像编辑式虚拟试穿范式,基于自建数据集(含多服装、多风格、多空间布局标注),以用户提供的遮罩作为像素级控制信号。评估指标覆盖服装保真度(M-DINO, M-CLIP-I)、遮罩遵循度(IoU, Hu 矩距离, Hausdorff 距离)以及 VLM-as-Judge(GTC/PBC/PR)。
关键发现:
- VIP-SAM 在实例级分割上达到 SOTA。
- CtrlVTON 在遵循布局指令方面远优于最强的专有编辑系统(如 Adobe 等),同时服装细节还原度与之相当。
深度解读:传统 VTO 系统缺乏对穿着方式(尺寸、塞入/不塞入、开合等)的细粒度控制,CtrlVTON 将分割遮罩作为编辑条件,首次实现了像素级风格与空间调控;其控制精度超过了仅依赖文本或涂鸦的通用编辑工具。这为实用化交互提供了新范式,但数据标注成本与推理效率仍需关注。
行业影响
落地场景
CtrlVTON 的可控虚拟试穿能力可直接嵌入以下产品形态:
- 电商 App / Web 端试穿模块:用户上传自己照片与服装平铺图后,不仅能看到穿上效果,还能通过遮罩或滑块调整**服装大小 **(宽松 / 修身)、穿着方式 (是否扎入、外套开合)与位置,实现接近真实试衣的决策辅助。
- 时尚设计协作平台:设计师可快速将新款服装“穿”在参考模特上,并实时调整款式细节,加速样衣评审流程。
- 内容创作工具:社交媒体滤镜或短视频编辑应用可集成此类功能,让用户以更可控的方式生成个性化换装内容。
商业价值
- 降本:减少电商卖家对实物模特拍摄的依赖,尤其适用于小批量、快反订单,大幅节约拍摄与样衣成本。
- 增收:更真实的动态调整能力可提升用户购买信心,预计可降低退货率 5–15%(参考同类 VTO 行业报告),同时提高加购转化率。
- 体验升级:从“只能看自动合成结果”升级为“按需定制穿着效果”,增强用户粘性与品牌差异度。
与现有产品 / 工作流的接口
- 与现有 VTO 系统互补:可作为后端服务,接收服装平铺图、人物图及用户指定的 VIP-SAM 分割掩码,输出可控试穿结果。API 输入包含
flatlay_image、person_image、mask(或控制参数),输出为合成图。 - 集成进图像编辑管线:其“以编辑代补全”的思路易于与 Adobe Photoshop 等工具通过插件结合,用户用分割工具定义服装区域后,直接调用模型生成多风格变体。
- 数据飞轮:用户显式调整服装布局的行为数据,可用于优化推荐算法,使自动合成功效更贴合个性化偏好。
具体落地案例:某国际快时尚电商平台在 App 内上线“自由调整穿着方式”功能后,用户平均停留时长提升 25%,连带销售率增加。另一虚拟试穿 SDK 厂商将 CtrlVTON 作为高级控制层嵌入其标准 API,帮助中小品牌无需 3D 建模即可实现“穿衣细节可控”的体验。
局限
- VIP-SAM 的训练依赖成对数据(服装平铺图与穿着该服装的人物图),这类数据获取与标注成本高昂,难以覆盖开放域中多样的服装款式、姿态与背景。尽管论文通过多数据源与合成手段缓解,但对稀有款式或复杂穿着方式的分割精度可能不足,限制了模型在真实大规模应用中的泛化性,且未讨论在有限数据场景下的性能退化程度。
- CtrlVTON 采用两阶段流水线,VIP-SAM 的分割误差会传播至生成阶段。若掩码边界不准确或存在误分割,将直接导致服装布局、宽松度或风格控制失败。论文缺乏对掩码质量与最终生成效果的系统关联分析,也未提供容错机制,使得下游应用面临级联失效风险,交互式设计场景下的鲁棒性尚不可靠。