Memento: 通过重建记忆实现一致的长视频生成
长视频生成要求重复出现的主体在不同镜头、视角、动作和场景转换中保持一致。现有的时间分解方法通过逐镜头生成视频来提高可扩展性,但主要关注于优化合理的下一镜头延续,而未验证历史记忆是否保留了主体身份的关键证据。因此,随着生成的进行,重复主体可能被稀释、覆盖或遗忘。 本文提出 Memento,一种主体重建引导的框架,将主体保持视为显式的身份基础问题,其前提是:一个忠实保存主体的记忆库应能仅凭记忆重建该主体。具体而言,Memento 联合训练自回归的下一镜头生成与基于记忆的主体重建,利用历史记忆和全局故事描述恢复目标外观。为区分长程主体证据与短程线索,Memento 引入双查询记忆机制:一个查询检索身份相关记忆,另一个选择短上下文关键帧以实现连贯延续。此外,主体感知的电影数据流水线通过一致、无代词的描述提供精确的重建监督。 实验表明,Memento 在长期主体一致性、跨镜头连贯性和视觉质量上达到最先进性能。
论文精读
TL;DR Memento 把长视频生成中的主体一致性显式建模为记忆重建问题,通过“记住才能重建”约束和双查询记忆机制,让角色在跨镜头中不遗忘、不走样。
问题
问题背景
长视频生成正从「单镜头」走向「多镜头叙事」,要求同一角色或物体在跨越不同机位、动作、光照与场景切换时保持外观与身份一致。业界当前主流方案是时间分解(temporal decomposition),将长视频拆成连续镜头逐段生成,以此突破显存与时长限制。
现有方法局限
现有逐镜头生成方法重心放在「下一镜头合理延续」上,其记忆机制仅关注短期上下文连贯,缺乏对历史记忆中身份关键信息的主动验证。这导致两个典型失效模式:
- 身份稀释:随着生成轮次增加,前一镜头的身份表征被后续信息逐步覆盖,角色长相变形;
- 记忆遗忘:模型无法从记忆库中恢复已被淡化的身份特征,出现「换脸」或「换装」式崩坏。 本质上,这些方法把记忆当作被动存储,而未将其视作可校验的身份锚点。
为何该问题困难且重要
身份一致性的核心难点在于长程身份证据与短程时序线索的纠缠。长镜头间可能相隔数十秒,中间夹杂大量无关场景与动作;模型既要捕捉数十步前的身份细节,又要保持相邻帧的平滑过渡,这两类信号在共享记忆表示中极易互相干扰。从产品化角度看,长视频的可用性直接受制于角色一致性——一旦主角外貌出现漂移,叙事沉浸感即刻崩溃,因此该问题已成为 AI 视频生成领域从「炫技」走向「可交付作品」的关键瓶颈。
行业类比
此挑战类似大模型长上下文问答中的「中间信息丢失」问题——当上下文变长,模型对关键身份的注意力被稀释,需要外挂记忆验证与检索机制来确保回答忠实于原始身份描述。
核心洞察
- 记忆质量的可验证性:Memento 将主体一致性明确转化为身份基础(identity grounding)问题,要求记忆库必须能够仅从历史记忆重建出目标主体。这与现有方法仅优化下一个镜头的合理性而从不检验记忆是否真正编码了身份关键证据形成根本区别。通过联合训练记忆重建与自回归镜头生成,框架迫使模型学习和保留充分的身份表征,从而避免主体在长视频中被稀释或遗忘。这种“重建以记住”的思路为长视频生成中的持续性提供了一种可验证的监督范式。
- 长期身份与短期连贯的解耦:Memento 引入双查询记忆机制,一路查询专门检索身份相关的长期记忆,另一路选择近期关键帧用于镜头间的连贯衔接。在以往工作中,长期主体证据和短期上下文线索常被混入同一记忆流,导致身份留存和镜头过渡相互干扰。双路径解耦使模型能明确区分哪些信息用于维持跨镜头主体一致性,哪些用于保证局部运动的平滑性,从而在不牺牲视觉连贯性的前提下显著提升对往复出现主体的保真度。
方法
Memento 采用 时序分解 + 自回归镜头生成 范式,将长视频生成建模为逐镜头扩展过程,核心思路是“只有能重建主体的记忆才值得信任”。输入为 全局故事描述(story caption)和已生成的前序镜头。
主体感知数据管线
为了提供精确的身份证察,构建了一条电影级数据管线。该管线自动抽取镜头,并对每个镜头生成 无代名词的一致主体描述(如用专有名词标识人物),从而为后续的重建任务提供干净监督信号。
双路径解耦记忆库
记忆库存放历史关键帧,并用 双查询机制 解耦不同角色的信息检索:
- 身份查询(identity query):从记忆库中检索与目标主体强相关的历史帧,用于主体重建;
- 上下文查询(context query):选取邻近镜头的关键帧,为下一镜头的流畅衔接提供短程视觉线索。
主体锚定的多任务训练
训练时同时进行两个任务:
- 自回归下一镜头生成:基于上下文关键帧和全局描述,生成下一镜头视频。
- 基于记忆的主体重建:仅从身份查询获得的历史帧和全局描述出发,恢复当前镜头中目标主体的外观。该重建任务迫使记忆库必须保留可辨识的主体特征,否则重建损失会升高。
两任务共享生成骨干,联合优化。推理时,模型利用记忆库中的身份信息指导生成,并通过重建能力隐式验证记忆质量,从而在长序列中持续锚定主体身份。
与同类方法的差异
以往方法仅优化下一镜头的表面连贯性,历史记忆可能逐渐丢失主体关键特征;Memento 以重建任务显式约束记忆表征,将主体保持从被动延续升级为主动的 identity grounding,显著提升长视频中跨镜头的主体一致性。
实验
实验设计
Memento 围绕三个核心目标设计实验:验证主体一致性保持能力、跨镜头连贯性、整体视觉质量。框架基于时间分解范式,在自回归生成过程中引入双路解耦记忆库 (dual-path disentangled memory bank),其中一个查询检索身份相关记忆,另一个选取短上下文关键帧。训练时联合优化下一镜头生成损失与记忆驱动的主体重建损失,重建目标来自一个精心构建的主体感知电影数据管道,该管道提供无代词、一致的主体描述以作为精确监督。
评估采用多维指标体系:语义一致性(全局/镜头级)、背景一致性、主体一致性、美学质量、以及跨镜头/镜内一致性(基于 ViCLIP、DINOv2 等),并辅以消融实验和用户研究。对比基线为现有仅关注下一镜头合理性的时序分解方法,这些方法缺乏对历史记忆是否保存关键主体证据的验证机制。
关键发现
- 主体遗忘被有效抑制:记忆库驱动的主体重建任务强制模型保留可恢复主体外观的信息,避免了主体细节在长序列生成中被稀释或覆盖。这一显式身份 grounding 策略将主体保留问题转化为可优化的重建目标,而非隐式统计延续。
- 双查询机制成功解耦长短期依赖:身份查询 (identity query) 专注长远主体线索,短上下文查询确保局部连贯性,两者协同使跨镜头变化(视角、动作、场景)下主体仍保持稳定。
- 整体视觉质量不妥协:在引入重建监督后,生成的视频在美学评分上依然保持竞争力,证明记忆强化并没有牺牲单镜头生成质量。
与基线对比的深度解读
当前时序分解方法(如 StreamingT2V 等)的典型缺陷在于其“无回溯”的前向生成:仅基于上一镜头特征预测下一镜头,历史记忆仅作为条件输入但不接受保真度检验。随着步数增加,身份信息衰减不可避免。Memento 通过反向重建任务打破了这一单向流:要求从记忆库中重建目标主体外观,直接度量记忆质量并反向传播梯度,从而将记忆更新从“被动记录”转变为“主动维护”。与简单增加记忆容量的方案不同,Memento 的重建损失是一种可感知的约束,确保记忆中的主体表示具备解码回高保真外观的能力,这使得它在长时间跨度上相比仅做条件注入的方法有显著更低的身份漂移。
行业影响
落地场景
Memento 提供的长视频主体一致性解决方案,可直接赋能虚拟人内容生产、影视预演、游戏过场动画生成、广告创意拍摄等场景。对于需要多镜头、多视角、多场景且反复出现同一主体的视频产品,如虚拟主播、品牌吉祥物动画、产品展示视频,Memento 能避免模型遗忘主体特征,保持形象统一。
商业价值
在成本端,Memento 通过记忆库引导的主体重建显著减少了手动修正主体漂移所需的人力投入,将原本需要人工逐帧调整的重复性劳动自动化,降低长视频制作边际成本。在体验端,一致的主体呈现直接提升观众沉浸感与品牌可信度,对广告点击率和虚拟角色粉丝粘性有正向影响。此外,该框架可与现有视频生成流水线解耦,作为自治的“一致性约束层”集成,避免推倒重建现有工具,加速落地回报周期。
与现有工作流的接口
Memento 的双查询记忆机制可被封装为即插即用的记忆增强模块,对接主流扩散式视频生成框架。其输入为历史记忆、当前镜头描述与关键帧,输出为主体质感一致性增强的隐空间特征。实际集成时,可将 Memento 作为生成模型后处理步骤,或通过适配器将记忆查询模块嵌入现有去噪网络中间层。配合已有的电影级数据管道提供的无代词主体描述,可直接与剧本/分镜工具(如 Storyboarder、FrameForge)对接,将自然语言故事板转化为一致的视频序列。
具体落地用例
- 电商虚拟试播与产品动画:为同一商品生成多角度、多场景的短视频(如开箱、佩戴效果),保持产品外形、材质、颜色在镜头切换中不变。Memento 的记忆库重建机制可避免换角度时产品形状失真,确保营销素材的专业品质,减少后期修图成本。
- 教育类虚拟教师:创建一位虚拟教师,在系列课程视频中跨越不同背景、光照、着装变化而保持人脸身份一致。Memento 的主体重建任务将教师身份特征存入记忆库,每生成新镜头时强制逼近历史证据,防止人物形变,支撑低成本规模化生产个性化课程。
局限
- **计算开销与长期记忆扩展性**:论文采用 dual-query memory bank 存储历史关键帧和主体特征,虽然通过解耦检索提升了短程连贯与长程身份一致性,但并未深入分析记忆库随生成视频长度增长时的存储与检索开销。对于实际 long-form 生成(例如分钟级视频),记忆缩放效率、冗余淘汰策略和在线更新的计算成本仍是工程落地中的核心挑战。
- **主体重建监督的数据依赖性**:Memento 依赖 subject-aware cinematic data pipeline 提供一致且无代词的主体描述作为重建监督,这种数据在现有视频数据集中规模有限,管道本身需要一套语言模型与视觉过滤流程。若真实数据中主体标签噪声较大或缺失,框架的有效性可能显著下降,迁移至开放域视频生成需额外标注成本。
- **复杂多主体交互场景下的泛化**:实验聚焦于单个或少量 recurring subjects,未深入探讨多个主体频繁交互、遮挡或外观剧烈变化(如服装更换、不同年龄阶段)时的鲁棒性。dual-query 机制的解耦虽有助于身份保持,但多主体间的注意分配与身份混淆问题未得到系统验证,相比其他专攻多角色一致性的工作可能存在盲区。