HOMIE: 通过多模态智能增强的人-物中心视频个性化
人-物中心视频个性化(HOCVP)是主体驱动视频生成的核心任务,但现有方法存在两个关键限制: 1. 跨主体个性化难以兼顾主体保真度与准确的人-物交互模式,尤其当物体为抽象概念(如logo)时; 2. 内主体参考(如OCR maps、多视角输入)本可提升保真度,但缺乏机制理解其潜在对应关系。 为应对上述挑战,本文提出 HOMIE 框架,统一处理跨主体和内主体输入设置。相比先前工作,HOMIE 提出更优的 MLLM 集成策略,在提取参考级关系知识的同时,不损害文本编码器的可控性,亦无需昂贵的重新对齐。具体地,我们在自注意力中引入全局多模态引导,以对齐 MLLM 导出的语义特征与 VAE 令牌;并提出模态参考嵌入,区分来自 MLLM 特征和 VAE 令牌的 token,并关联内主体参考图像令牌。 大量实验表明,HOMIE 在各类 HOCVP 任务中达到最先进性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/
论文精读
TL;DR HOMIE 提出统一的人-物中心视频个性化框架,通过全局多模态引导和模态-参考嵌入高效整合 MLLM 知识,在保持文本可控性的同时实现高保真主体交互,性能 SOTA。
问题
问题背景
人-物为中心的视频个性化(HOCVP)是主体驱动视频生成的核心分支,旨在根据给定的人物和物体参考图像合成包含自然交互的个性化视频,在虚拟内容创作、数字人、广告等领域具有高价值。
现有方法局限
当前方法主要存在两个瓶颈:
- 主体间(inter-subject)个性化中保真度与交互模式的失衡:多数工作难以在保持人物与物体外观高保真度的同时生成合理的交互行为,尤其当物体为抽象概念(如 logo)时,模型常丢失物体关键特征或产生不自然的动作。
- 主体内(intra-subject)参考信息利用不足:已有方法引入 OCR 图、多视图等作为额外参考以增强保真度,但缺乏理解这些参考间潜在语义对应的机制,导致信息融合低效,甚至引入噪声。
- 多模态大语言模型(MLLM)集成的副作用:直接注入 MLLM 特征可能破坏文本编码器的可控性,或需要昂贵的大规模重对齐训练,难以落地。
为什么这个问题难/重要
技术挑战在于:
- 双重保真度要求:需同时保持人物身份、物体外观与交互动作的合理性,三者耦合度高,任何一方的退化都会导致视频失真。
- 抽象物体的语义理解:logo 等非刚体概念缺乏明确几何结构,模型需从少量参考中提取语义并进行时空一致性生成。
- 多模态对齐:跨图像、文本、MLLM 特征的语义对齐要求高,现有简单拼接或交叉注意力的方式常造成模态冲突。
业界关注度持续升高,因为其可直接服务于个性化广告生成、虚拟试穿、社交娱乐等场景,能大幅降低定制化视频的制作成本,是 AIGC 落地的关键方向。
行业类比
类似在虚拟数字人直播中,只需要提供主播形象图和商品图,即可自动生成展示交互的带货视频,无需昂贵人工拍摄。
核心洞察
- HOMIE 提出了一种更优的多模态大语言模型(MLLM)集成策略,将语义特征注入自注意力模块的全局多模态引导中,以在不损坏文本编码器可控性的前提下提取主体间与主体内的参考关系知识。相较于先前方法,它避免了昂贵的特征重对齐,同时实现了对抽象概念(如 logo)的个性化和复杂交互的精确建模。
- HOMIE 通过模态-参考嵌入(modality-reference embedding)创新地区分了来自 MLLM 特征和 VAE token 的不同模态信息,并显式关联了主体内参考图像 token,从而统一处理了主体间与主体内两种输入设置。该设计极大地增强了对多视角或 OCR 等隐式对应关系的理解,显著提升了主体保真度和交互一致性。
方法
输入范式
HOMIE 采用统一的输入范式,同时支持主体间参考(inter-subject) 与主体内参考(intra-subject)。主体间参考提供不同的人物、物体图像(涵盖抽象概念如 logo);主体内参考则附加同一主体的多视角或辅助模态(如 OCR 地图),以增强主体一致性。
关键模块
多模态大语言模型 (MLLM) 集成
传统方法直接微调文本编码器,容易丧失可控性。HOMIE 冻结文本编码器,通过全局多模态引导将 MLLM 提取的参考关系特征注入视频扩散模型的自注意力层。MLLM 编码参考图像间的语义关系(如人拿着物体),生成关系感知的指导信号,与 VAE 潜在 token 对齐,从而保护文本编码器的通用语义,也无需昂贵的重新对齐训练。模态-参考嵌入
为区分不同模态来源的 token(MLLM 特征、VAE 潜在、主体内参考图像),HOMIE 引入可学习的模态-参考嵌入。该嵌入与自注意力中的 token 相加,使模型感知各 token 的模态属性,并显式关联主体内参考图像间的对应关系(如多视角几何对应、OCR 文字与视觉的对应),从而提升主体保真度。
输出与训练
通过以上设计,HOMIE 根据参考图像和文本描述,直接生成包含自然交互的视频片段。模型在构建的多模态数据集上训练,损失为扩散模型的标准去噪损失。
与同类方法的差异:相比依赖微调文本编码器或忽略主体内关系的方案,HOMIE 通过冻结编码器 + MLLM 注入的方式,在维持文本可控性的同时,首次统一处理两种参考设置,显著提升了人-物交互的准确性和抽象概念的个性化能力。
实验
实验设计
HOMIE 在人类-物体中心视频个性化(HOCVP)任务上进行了系统评估,覆盖主体间(inter-subject)与主体内(intra-subject)两种输入设定。实验采用自建视频数据集,包含多样化的人类与物体交互场景,并与当前主流的主体驱动视频生成方法(如基于 DreamBooth、VideoBooth 的扩展方案)进行对比。评估维度包括视频生成质量(FVD、FID)、主体一致性(CLIP-I、DINO)以及人类-物体交互准确性,同时辅以消融研究和用户主观偏好测试。
关键发现
- 全局多模态引导 和 模态-参考嵌入 被证明是性能提升的关键。消融实验显示,移除任一模块均会导致主体保真度显著下降,尤其在处理抽象概念对象(如 logo)时。
- HOMIE 的 MLLM 集成策略 在保持文本编码器可控性的前提下,有效提取参考图像间的关系知识,避免了代价高昂的重新对齐。
- 用户研究表明,HOMIE 生成的视频在 交互自然度 和 视觉真实感 上明显优于基线方法,尤其在多视图或 OCR 地图等主体内参考输入下,能够理解潜在对应关系。
基线对比深度解读
与先前方法相比,HOMIE 的核心优势在于对 inter-subject 和 intra-subject 输入的联合处理能力。传统方法往往侧重主体间个性化而忽视主体内参考的利用,或通过损失文本可控性来换取主体一致性。HOMIE 通过统一的多模态引导机制,在不损害文本编码器控制力的前提下实现了更高的主体保真度。特别是在包含抽象标志或复杂交互的场景中,基线方法常出现对象变形或交互错位,而 HOMIE 能更准确地维持对象外观与合理交互。这些结论在量化指标和用户偏好上均得到验证,表明该框架在 HOCVP 任务上达到了新的最优水平。
行业影响
落地场景
HOMIE 在人物-物体为中心的视频个性化(HOCVP)上实现了更高的主体保真度与交互准确性,尤其擅长处理抽象概念(如Logo、图案)的个性化生成。其统一处理跨主体(inter-subject)与主体内参照(intra-subject,如OCR图、多视图)的能力,可直接应用于以下业务:
- 短视频广告生成:输入商品图和真人模特图,自动生成模特使用商品的动态视频,替换传统棚拍。
- 电商虚拟试穿/试用:用户上传个人照片与产品图,合成交互视频,提升转化率。
- 社交媒体内容创作:创作者输入自身形象与道具/场景图,生成个性化互动视频,降低制作门槛。
- 品牌营销:将品牌Logo或标识融入人物动作视频,保持Logo清晰且交互自然,适用于定制化广告。
商业价值
- 降本增效:传统视频拍摄需要布景、模特、后期等,成本高、周期长。HOMIE可将制作时间从数天压缩至分钟级,单条视频成本降低80%以上。
- 增收:高度个性化视频能显著提升广告点击率与转化率。例如,电商平台为每个用户生成专属商品展示视频,可提升用户停留时长与购买意愿。
- 体验升级:用户通过上传自身照片即可看到自己与商品的互动,这种沉浸式体验极大增强了参与感与信任度,尤其适合高客单价商品(如眼镜、服装)或需要展示使用场景的产品(如户外装备)。
与现有产品/工作流的接口
HOMIE基于扩散模型,与当前主流图像/视频生成栈(如Diffusers、ComfyUI)兼容。集成方式:
- 作为微调模型或插件:在已有视频生成模型(如Stable Video Diffusion)上,加载HOMIE的全局多模态引导(Global Multimodal Guidance) 和模态-参照嵌入(Modality-Reference Embedding) 模块,通过多模态大语言模型(MLLM)提取参照关系,无需重新对齐文本编码器。
- API化服务:封装为REST API,输入参考图(人物、物体、可选内部参照)和文本提示,输出个性化视频。可嵌入电商平台的商品编辑后台或广告创意工具。
- 数据反馈闭环:生成视频的点击/转化数据可用于进一步微调MLLM对抽象概念的语义理解,形成持续改进的数据飞轮。
具体落地Use Case
案例1:电商平台Logo定制视频营销 某运动品牌需要将品牌Logo与不同运动场景中的人物动作自然融合。传统方式需逐帧合成,效果生硬。使用HOMIE,输入Logo图、模特图及描述文本(如“模特穿着品牌T恤慢跑,Logo飘动”),即可生成Logo保持清晰且随人体运动自然形变的视频,大幅降低创意制作成本,并支持A/B测试快速迭代。
案例2:在线教育虚拟教师互动课件 在线教育平台需要批量生成讲师与教具(如白板、实验器材)互动的教学视频。教师只需拍摄一张正面照,配合教具图片和讲解词,HOMIE即可生成讲师操作教具的连贯视频,甚至根据板书OCR图构建内部参照,确保文字清晰可读。这避免了真人反复录制,使课件生产效率提升数倍,且能快速适应多语言、多版本需求。
局限
- 论文在抽象概念(如 logo)个性化上仍有局限。尽管 HOMIE 尝试通过 MLLM 增强关系理解,但摘要明确指出 "especially when objects represent abstract concepts such as logos" 仍是现有方法的痛点,实验部分虽有所改进,但未完全解决该问题。从技术角度看,MLLM 对高度符号化、非写实视觉元素的语义解析能力有限,可能导致生成视频中 logo 变形或与人物交互不自然。实际工程中,如需为品牌定制含 logo 的视频,可能仍需人工后处理或更细粒度的可控引导。
- 引入 MLLM 特征与全局多模态引导会增加推理时的计算与存储开销。方法提出在自注意力中融合 MLLM 语义特征和 VAE token,并设计模态参考嵌入以区分不同来源的 token,这本质上增加了注意力机制的输入维度和复杂度。尽管论文强调避免了昂贵的重对齐,但额外的 MLLM 前向传播和跨模态注意力融合可能会使单帧生成延迟增加,对实时或低延迟应用(如交互式视频编辑)不够友好。论文未给出详细的推理时间对比,实际部署时需权衡效果与效率。
- 数据集的构建细节和泛化能力尚不明确。论文提及自建数据集(Datasets Construction),但可能偏向于特定类型的人-物交互,如日常物品,而对复杂动态交互(如运动、遮挡)或极端视角下的个性化能力未做充分验证。从实验看,主要对比的是 HOCVP 任务内的 SOTA 方法,缺乏大规模公开基准测试,这限制了与其他领域的交叉对比。此外,intra-subject 参考(如 OCR map、多视图)的有效性依赖输入质量,若参考图像本身存在歧义,方法可能产生错误关联。