论文

TryOnCrafter: 通过可渲染4D试穿代理释放相机轨迹以实现逼真视频虚拟试穿

TryOnCrafter: 通过可渲染4D试穿代理释放相机轨迹以实现逼真视频虚拟试穿

尽管视频虚拟试穿(VVT)在合成动态人物上的逼真服装覆盖方面取得了显著进展,现有范式仍受限于对源相机轨迹的被动依赖,无法满足全方位视角探索所需的交互自由度。为解决这一局限,我们定义了一个开创性研究前沿:相机可控视频虚拟试穿(CaM-VVT)。与常规VVT不同,CaM-VVT不仅需要视角无关的纹理幻觉,还要求在任意无约束相机运动下,非刚性人体动态与背景上下文之间的严格结构同步。 为应对这些挑战,我们提出了TryOnCrafter,这是首个专为CaM-VVT任务设计的统一DiT框架。与隐式像素空间操作不同,我们引入了一个可渲染4D试穿代理,将人物主体与环境显式解耦。这通过将高保真2D试穿先验蒸馏为基于3DGS的穿衣化身实现,该化身随后经SMPL-X序列驱动,并度量对齐至重建的背景点云中。该代理建立了具有优越纹理密度和运动完整性的稳健结构基础。我们的代理锚定视频DiT利用这一稳健结构基础作为主要几何锚点,确保合成逼真视频严格受预设轨迹和物理合理形变约束。 得益于4D代理固有的可编辑性,TryOnCrafter支持多种下游应用,包括人体重定位、子弹时间效果以及360度环绕观看。

论文精读

TL;DR TryOnCrafter 利用可渲染 4D 试穿代理,首次实现相机可控的视频虚拟试穿,在任意视角下都能生成动态一致、背景协调的逼真换装视频。

问题

问题背景

视频虚拟试穿(VVT)旨在为动态人物合成逼真的服装叠加,已成为时尚电商与内容生成的核心交互技术,但当前工作大多固守在单一固定相机视角下,无法支持观众自由旋转、缩放的全方位观察需求。

现有方法局限

  1. 相机被动依赖:传统 VVT 范式隐含要求测试时的相机轨迹与源视频严格一致,任何视角偏移都会导致服装纹理错位、人体结构扭曲,无法适应任意相机运动。
  2. 隐式像素操作:主流方法基于 2D 生成模型直接在像素空间合成,缺少对场景几何的显式建模,难以在视角变化时保持非刚性人体动态与背景上下文的结构同步
  3. 纹理幻想闭集性:训练数据多为固定视角,模型不具备视角无关的纹理幻觉能力,换装后的服装在新视角下常出现模糊、拉伸或无中生有的伪影。

技术挑战与业界关注度

  • 技术难点:需要同时处理三个层次的解耦——人体与背景的分离、人体动作与服装纹理的分离、相机位姿与场景表示的分离,这要求将 2D 试穿先验蒸馏到可驱动的 3D 表示中,并在视频生成过程中以几何锚点形式显式约束每一帧的投影一致性。
  • 应用牵引:VR/AR 购物、虚拟走秀、数字人直播等场景迫切需要在任意视角下保持试穿视觉质量,能够为用户提供“环绕观看”的体验,这直接关系到虚拟试穿从工具型演示到沉浸式消费的跨越。

行业类比

类似于 NeRF/3DGS 在静态场景中新视角合成中扮演的几何锚点角色,本工作尝试将这一思想引入动态人体试穿,为视频生成提供可渲染的 4D 代理,实现时空一致性重建。

核心洞察

  • 核心创新:提出可渲染的4D试穿代理,将人物与环境显式解耦,作为视频扩散模型的几何锚点。传统VVT方法隐式地在像素空间操作,依赖固定相机轨迹,无法支持自由视角。TryOnCrafter通过重建背景点云并与动画化3DGS化身对齐,构建出具有精确结构和纹理的4D代理,使生成结果严格遵循任意相机运动,确保了人物变形与背景的物理一致性,为可控视频生成提供了可靠的结构先验。
  • 方法论突破:将2D试穿先验蒸馏到3DGS化身,实现视角无关的纹理生成与动态同步。以往方法难以处理全方位观察下的衣物细节,本工作利用SMPL-X驱动化身,在规范空间生成穿着衣物的高保真化身,并渲染到新视角,从而解耦了纹理生成与相机轨迹。这种设计不仅能产生密集视角下连贯的纹理,还保持了非刚性运动的时序完整性,显著区别于依赖单视角图像或视频修补的基线方法,为真实感试穿开辟了新范式。

方法

输入与整体流程

TryOnCrafter 接受一段带有动态人物的源视频、目标服装图像以及用户指定的自由相机轨迹作为输入,目标是生成在任意视点下保持人物-服装-背景结构一致且纹理逼真的试穿视频。流程分为两大阶段:可渲染4D试穿代理的构建代理锚定的视频生成

可渲染4D试穿代理 (Renderable 4D Try-on Proxy)

该代理显式解耦人物主体与周围环境,构建一个可驱动、可编辑的时空代理体。

  • 场景重建与对齐:首先利用 Structure-from-Motion (SfM) 从源视频重建背景稀疏点云,并通过锚定对齐策略将动态 SMPL-X 人体网格注册到世界坐标系下,获得一致的几何参考。
  • 穿衣化身生成:从2D试穿扩散模型中蒸馏高保真服装纹理先验,结合人体姿态与服装条件,生成一个附着在 3D Gaussian Splatting (3DGS) 表示上的穿衣化身。该化身在规范姿态下优化,具备视角无关的纹理细节。
  • 动画与渲染:通过 SMPL-X 参数序列驱动化身变形,并借助混合渲染策略将动态人物与背景点云融合,可渲染出任一相机位姿下的代理视图(proxy view),提供了严格的几何结构与运动完整性。

代理锚定的视频生成 (Proxy-Anchored Video DiT)

以4D代理渲染结果作为几何锚点,采用基于 Diffusion Transformer (DiT) 的视频生成框架,将代理视图与参考服装帧共同注入去噪网络,实现高保真时空生成。

  • 条件注入:渲染的代理视图与参考帧一起通过 Cross-view Reference Adapter (CRA) 注入,为去噪过程提供精确的结构引导,强制生成视频遵从指定轨迹。
  • 多模态语义控制:引入文本、服装区域等多模态条件,进一步约束外观和布局,保证生成一致性。
  • 输出:最终输出与相机轨迹严格同步、人物运动物理合理且背景无缝融合的逼真试穿视频。

与同类方法的差异:传统 VVT 方法在隐式像素空间操作,严重依赖源视频固定相机,而 TryOnCrafter 通过显式 4D 代理解耦并锚定生成,首次实现相机可控的全方位视点试穿,同时在非刚体运动与动态背景下保持结构同步。

实验

实验设计

论文引入了新的任务场景 Camera-controllable Video Virtual Try-on (CaM-VVT),并为此构建了专用评测基准 CaM-VVTBench,包含不同相机轨迹(如环绕、推拉、平移)与背景环境的组合。实验同时沿用传统 VVT 基准进行对比,以验证模型在标准设定下的保真度。评测维度涵盖纹理生成质量姿态‑衣服‑背景结构同步性视角泛化保真度。消融研究解耦 Renderable 4D Try-on Proxy 各组件,包括 3DGS 化身质量、SMPL‑X 驱动与背景点云对齐。

关键发现

  • 结构一致性突破:4D proxy 显式分离人与环境,结合 Proxy‑Anchored Video DiT,在任意相机轨迹下保持了非刚性人体与背景的物理合理变形,避免了传统 pixel‑space 方法中常见的漂移与撕裂。
  • 视角泛化鲁棒性:通过从 2D 试穿先验蒸馏到 3DGS 化身,模型实现了“只看一面,生成全貌”的纹理幻觉,在 360° 轨道视角下衣物质感连续。
  • 应用扩展性:受益于 4D proxy 的可编辑性,方法可原生支持人物重定位、子弹时间、巡视转圈等下游效果,无需额外训练。

与基线对比的深度解读

传统 VVT 方法(如基于 GAN 或扩散模型的像素空间蒙版替换)强依赖源视频相机轨迹,一旦偏离则严重失真。TryOnCrafter 首次以显式 4D 代理作为几何锚点,将生成过程约束在 3D 一致的流形上,从根本上将“生成一段动态视频”转变为“在可渲染 4D 场景上做回归观照”。相比隐式变形网络,3DGS 化身保证了纹理密度与运动完整性,因此在 CaM‑VVTBench 极端视角下,背景‑人物配合度远超基线,标志着从被动合成向可控探索的范式跃迁。

行业影响

核心落地场景

TryOnCrafter 的 相机可控视频虚拟试穿 (CaM-VVT) 能力可直接应用于 电商与时尚平台的交互式商品展示,让用户从任意视角自由旋转观察虚拟试穿效果,显著提升购买决策信心。此外,其解耦的人体-环境 4D 代理 可被 短视频创作工具 用于生成多机位、动态视角的服装展示内容,或为 虚拟人直播、影视特效 提供实时换装与背景融合的生成管线。

商业价值分析

  • 降低制作成本:传统多视角视频需多台摄像机与多次拍摄,4D 代理一次重建后可按需渲染任意轨迹视频,节省硬件与人力投入。
  • 提升转化率与客单价:支持 360° 环视与 "子弹时间" 效果的交互体验,可增强用户感知真实性,直接拉动电商加购率与高价商品成交。
  • 拓展内容供给:内容平台可利用该框架自动生成海量带有时尚元素的多视角短视频,丰富广告素材库,提高投放效率。

与现有产品/工作流的集成

框架基于 DiT (Diffusion Transformer)3DGS 化身,输出符合物理一致性的视频,可通过以下方式接入现有技术栈:

  1. 电商 3D 商详页:将重建的 4D 代理嵌入商品详情页,前端通过 WebGL 或轻量渲染引擎响应用户拖拽视角,后端调用 DiT 模块实时生成对应视角的试穿画面。
  2. 视频编辑工具链:以 DaVinci Resolve / Blender 插件形式提供,导入 SMPL-X 动作序列与背景点云,一键输出多机位换装视频,直接替代绿幕拍摄与手动合成。
  3. 实时直播引擎:通过 Proxy-Anchored Video DiT 的几何锚定机制,可快速将实时动捕数据映射到背景点云,实现直播中虚拟换装的视角自由切换。

具体工程用例

  • 时尚电商 (如 ASOS, ZALORA):商品页嵌入视角可控试穿,用户旋转可查看服装不同角度的合身度、垂感和细节,减少退换货率。后台利用 UGC 中的单张 buyer 照片 即可生成 4D 代理并渲染多视角视频,无需专业模特拍摄。
  • 短视频平台 (如 TikTok Shop 创作者工具):允许创作者上传一段普通试穿视频,系统自动重建场景并生成带运镜效果的“子弹时间”或环绕视角视频,丰富内容表现力,增加带货视频的完播与转化。

与现有 VVT 方法的关键差异:常规方法被动跟随源视频轨迹,而 TryOnCrafter 将人体与环境显式解耦为可编辑 4D 代理,使生成结果可严格遵循任意新相机路径,并保持背景与人体的结构同步,这为工程落地提供了可复用的几何锚点与更高的一致性保障。

局限

  • **4D proxy 构建依赖高精度几何与纹理重建**:TryOnCrafter 的核心理念是将试穿人体与背景显式解耦,但 4D proxy 的 fidelity 高度受限于 3DGS avatar 的蒸馏质量与场景重建精度。在真实拍摄中,输入视频若存在运动模糊、遮挡或复杂光照,会导致 3DGS 训练产生漂浮物或纹理模糊,进而影响后续变形渲染时的时空一致性。对宽松衣物(如裙摆、风衣)的非刚性变形,SMPL‑X 线性混合蒙皮难以捕捉次级动态,可能出现局部穿透或拉伸失真。这种对前端 3D 重建的强依赖,使得系统在低质量源视频上的鲁棒性存疑,也增大了实际落地的预处理成本。
  • **推理链路长、计算负载高,难以轻量化部署**:从输入视频到出最终可控视频,链路包含稀疏重建、metric alignment、3DGS avatar 生成、SMPL‑X 序列拟合、多视图渲染、DiT 去噪生成等多阶段。论文未详细报告端到端时耗,但可以推断,即使在高端 GPU 上,构建单个 proxy 与生成一段高清视频也可能需要数小时,无法满足实时交互需求。此外,Proxy‑Anchored Video DiT 本质是 2D 扩散模型生成多帧,受限于注意力窗口大小,长视频生成可能存在动作漂移与背景不一致,限制了实际应用中的连续漫游体验。
  • **对新环境与未见姿态的泛化能力有限**:方法依赖预先重建的背景点云,当用户希望将试穿结果放置到完全不同的背景(如更换街道、房间)时,需重新采集和重建该场景,且 metric alignment 步骤要求背景与人体尺度一致性,否则会出现“悬浮”或比例失调。同时,Cross‑view Reference Adapter 虽然能从渲染先验中提取几何线索,但对训练集中未出现过的极端视角(如完全仰视、鸟瞰)的纹理补全可能失效,导致生成视频出现伪影或服装纹理混淆。这限制了其在真正“任意相机路径”开放世界的泛化能力。
论文Hao Sun2026-06-24原文

相关内容