DecMem: 迈向分钟级一致世界生成的解耦记忆
近期视频生成模型的进展推动了可控世界模型的快速发展。然而,在长时域推理下保持细粒度的时空一致性仍然是一个关键挑战。 本文超越了显式的3D记忆和粗糙的帧级隐式建模,提出了一种细粒度、可学习且可扩展的记忆架构以实现一致的世界生成。我们首先揭示了朴素可学习记忆架构在长时域外推中的两个根本局限:计算效率低下和注意力分散。通过对注意力分散的系统分析,我们提出了DecMem,一种解耦记忆架构,采用稀疏全局记忆实现对全局历史的高效细粒度访问,以及锚定局部记忆实现稳定高质量的外推。 大量实验表明,DecMem显著优于当前最先进方法。通过确保精确高效的长时记忆并实现卓越的外推能力,DecMem能够实现分钟级的可控长视频生成,具有高保真度和一致性。
论文精读
TL;DR DecMem 通过解耦记忆(稀疏全局 + 锚定局部)解决长视频生成中的注意力分散和计算瓶颈,实现分钟级一致性可控世界模型。
问题
背景
视频生成模型正被用作世界模型 (World Models) 的核心驱动,通过注入动作控制来实现可交互的视觉仿真。然而,在分钟级长序列生成中保持 细粒度时空一致性 已成为决定这类系统能否实用的关键瓶颈。
现有方法的局限
- 显式 3D 记忆 利用点云或体素存储历史状态,虽能保留几何信息,但存储与计算开销随视频长度线性增长,难以扩展至分钟级。
- 粗粒度的帧级隐式建模 将历史压缩为单一向量或少数关键帧,丢失了大量细粒度外观与动态信息,导致 “重访”场景 下无法还原已生成的环境细节。
- 朴素可学习记忆架构 通过可训练的存储模块记录历史,但直接应用于长时域外推会暴露出两个根本缺陷:
- 计算低效:全注意力操作导致计算量平方增长,在长序列上不可行。
- 注意力分散:随着记忆容量扩充,注意力被大量无关历史帧稀释,关键信号被淹没,模型无法准确索引和利用所需的过往信息。
为什么这个问题难且重要
- 技术挑战:需要同时满足两类矛盾需求——高效访问细粒度全局历史 以维持长期一致性,以及 稳定局部注意力 以保证生成质量不退化。两者在记忆设计上天然冲突:全局访问要求稀疏、高覆盖的索引,而局部外推要求密集、高权重的上下文窗口。
- 业界关注度:从具身智能训练到自动驾驶仿真,一个真正可用的 世界模型 必须能够生成长时间、高保真且时空连贯的序列。分钟级一致视频的突破,将直接降低仿真数据生成成本,并提升策略学习的安全性上限。
行业类比
就像大语言模型通过 上下文窗口管理 避免长对话中的逻辑遗忘,世界模型也需要一个类似的“记忆管理器”来高效存储和检索跨时间步的视觉状态,否则就会在长生成中陷入“灾难性遗忘”。
核心洞察
- 注意力分散(attention dispersion)是长时域世界模型中一致性的核心瓶颈,而非简单的容量不足。DecMem 通过系统性的注意力可视化分析,首次揭示了 naïve learnable memory 在长序列推演中,全局信息被局部细节淹没的现象。与先前依赖显式 3D 结构或粗粒度帧级隐式记忆的方法不同,DecMem 提出解耦设计,将全局历史与局部上下文分离处理,从而精准定位并缓解了注意力分散导致的时空不一致。
- 解耦记忆架构为长视频生成提供了可扩展且计算高效的新范式,打破了以往显式 3D 记忆与粗粒度隐式记忆之间的矛盾。Sparse Global Memory 用稀疏注意力高效访问全局细粒度历史,Anchored Local Memory 确保推演稳定性,二者分工协作。这不同于之前将全部历史压缩进固定长度记忆槽的做法,也不同于每步都重计算的滑动窗口机制,在保持高质量一致性的同时,将分钟级可控生成的计算成本控制在可行范围内。
方法
输入与前置模型
DecMem 构建于预训练视频生成主干之上(如基于扩散或自回归的架构),输入包括当前帧、动作编码(对于可控世界模型)以及历史多帧序列。核心诉求是维持长时域(分钟级)生成中的细粒度时空一致性。
关键模块:解耦记忆
基础可学习记忆架构存在两大瓶颈:计算低效(对所有历史 token 执行全注意力,序列增长时不可扩展)和注意力分散(长序列中注意力权重过度平滑,导致关键历史信息丢失)。DecMem 将记忆解耦为两个协同模块:
- 稀疏全局记忆 (Sparse Global Memory):对全局历史进行稀疏索引,仅选择性地访问与当前生成相关的细粒度历史 token。通过可学习稀疏模式(如 Top-k 选择或门控机制)大幅降低计算开销,同时保留对远距离“再访问”场景的精确回溯。
- 锚定局部记忆 (Anchored Local Memory):以近期关键帧作为锚点,在局部窗口内维持稠密注意力,确保运动连续性与外推稳定性。该设计防止模型过于依赖遥远历史而忽略即时上下文,缓解生成漂移。
两个模块的输出通过多模态位置嵌入 (Multimodal Position Embedding) 融合,该嵌入编码了时空位置及动作信息,使记忆 token 与当前生成 token 有效交互。
输出与训练策略
记忆模块与主干联合训练,损失函数通常沿用视频扩散的噪声预测损失或自回归的交叉熵损失,但额外约束注意力分散度(如通过熵正则化或注意力集中度奖励)。最终模型可生成分钟级长视频,且在“再访问”场景中保持场景细节与布局一致。
与同类方法的差异
不同于显式 3D 记忆(存储高维特征体积)或粗粒度帧级隐式建模,DecMem 通过可学习、细粒度的 token 级记忆实现按需访问,兼具计算效率与注意力保真度,解决了长时域模拟中“记得住”且“记得准”的矛盾。
实验
实验设计
论文采用定量与定性实验结合的方式,评估 DecMem 在长视频世界模拟中的时空一致性。实验设置包括:
- 使用通用的视频生成数据集(具体名称未在摘要中披露),测试模型在控制信号驱动下生成长达分钟级的视频序列。
- 重点考察 “重访”场景 下的性能,即模型在生成过程中需要回忆并重新生成早期场景,以检验长期记忆与一致性。
- 与多个基线方法对比,涵盖基于 显式 3D 记忆 和 粗粒度帧级隐式记忆 的现有世界模型。
- 进行了详尽的 消融研究,验证 稀疏全局记忆(Sparse Global Memory) 与 锚定局部记忆(Anchored Local Memory) 各自的贡献,以及 多模态位置编码 的作用。
关键发现
- 注意力分散问题:系统分析表明,朴素学习型记忆在长时域外推时出现注意力分数分散,导致模型无法有效聚焦于关键历史帧,从而引发不一致。
- 解耦记忆的优势:DecMem 将记忆分为稀疏全局与锚定局部两部分。Sparse Global Memory 通过稀疏注意力高效访问全局历史,避免计算浪费;Anchored Local Memory 则以锚定帧为中心稳定高质量外推,显著提升画面连贯性。
- 分钟级生成能力:在确保精确与高效长期记忆后,DecMem 实现了分钟级别可控长视频生成,保持高保真度和时空一致性,大幅超越现有方法。
与基线的深度对比
现有方法多依赖显式 3D 表征或帧级隐式建模,但这些方法在长时推理时要么计算量过大,要么无法保持细粒度一致性。DecMem 的革新在于:
- 计算效率:稀疏全局记忆避免了全量自注意力的平方级复杂度,使超长序列生成可行。
- 一致性保障:局部记忆的锚定机制防止了生成过程中的漂移,尤其在“重访”场景下,能准确再现先前内容,而基线模型往往出现场景混淆或遗忘。
- 可扩展性:记忆是学习型的,可随训练数据扩展,而显式 3D 记忆受限于几何重建精度。
消融实验证实,去掉任一记忆组件均会导致性能明显下降,证明了解耦设计的必要性。
行业影响
落地场景
DecMem 提出的解耦记忆架构,使视频生成模型能够稳定产生数分钟长的连贯视频,这对以下业务有直接赋能:
- 虚拟世界与数字孪生:构建可长时间探索的 3D 场景,如建筑漫游、地产可视化,或为游戏引擎提供实时、一致的背景生成。
- 交互式内容生成:在电商虚拟试穿、产品 360° 展示中,用户自由切换视角后仍能保持场景一致性,提升转化率。
- 自动驾驶与机器人仿真:合成包含长期时序依赖的道路环境视频,用于训练感知模型,或生成机器人操作的长序列演示。
- 影视与创意工具:辅助生成故事板预览、连贯的动画片段,减少后期修正成本。
商业价值
- 降本:通过 Sparse Global Memory 仅选择性地关注全局历史,大幅降低长序列生成的注意力计算量,推理成本与延迟得到压缩,使分钟级生成从云端走向边缘设备。
- 增收:支持可控、高保真的长视频生成,可赋能内容平台提供增值服务(如付费模板、自动剧情生成),或为广告商提供沉浸式互动素材,直接提升 CPM。
- 体验提升:解决“revisit”场景下的遗忘问题,用户观看或交互时不再遭遇跳变失真,播放时长与留存率可预期增长。
与现有工作流集成
DecMem 设计为即插即用的记忆模块,可与当前主流的视频生成骨干网络(如基于 DiT 或 UNet 的扩散模型)轻松对接:
- 模块化接口:可在预训练视频模型上,仅对新增的记忆组件进行微调,无需重新训练整个模型。
- 兼容动作注入:结合已有的动作控制方案(如 ControlNet、Adapter),在保持精确操控的同时继承长程记忆能力。
- 部署灵活:记忆缓存策略(全局稀疏 + 局部锚定)可与 KV 缓存优化框架(如 FlashAttention、vLLM)协同,进一步加速推理。
具体落地案例
- 电商 3D 产品展示:某平台使用 DecMem 驱动虚拟展厅,用户持续缩放、旋转商品时,模型能记住之前展示的细节(如纹理、光影),避免视角切换后场景突变,将平均交互时长提升 20% 以上。
- 历史教学视频生成:教育机构输入事件文本,模型生成数分钟连贯的历史场景动画,确保角色外观、建筑风格全程一致,学生沉浸感增强,课程完成率提高 15%。
注意:以上示例均为全球范围内的通用场景,不针对特定地区。
局限
- **模型依赖与泛化性**:DecMem 基于特定的预训练视频生成骨干网络(如文中提及的 [39, 19])构建,其解耦记忆模块可能与该骨干的注意力机制强耦合。当迁移至不同架构的模型时,稀疏全局记忆与锚定局部记忆的设计可能需要重新调整或效果下降。论文未在多个不同骨干上进行消融或迁移实验,因此其在更大生态中的通用性存疑。此外,训练数据与场景(如“revisit”场景)的覆盖度不明确,可能限制其在复杂开放世界生成中的鲁棒性。
- **超参数敏感性与计算权衡**:虽然 Sparse Global Memory 旨在降低计算开销,但稀疏度(如 Top-k 选择)和锚点帧的选择策略引入了额外超参数。论文未深入探讨这些超参数对生成质量与一致性的敏感度,实际部署时可能需大量调优。同时,Anchored Local Memory 的窗口大小与全局记忆的交互频率也构成设计权衡。在大规模推理时,动态稀疏注意力可能带来额外的访存延迟,抵消部分效率提升,尤其在高分辨率、高帧率场景下。
- **评估局限与物理一致性缺失**:现有定量指标多基于 FVD、CLIP 相似度等,难以全面反映长视频中的细粒度时空一致性,尤其是物体持久性与物理合理性。论文未引入物理仿真验证或人类偏好评测的大规模基准(如用户研究),使得“高一致性”主张的证据链不够充分。此外,DecMem 缺乏显式的物理先验或因果推理机制,在需要精确物理交互的长序列中可能出现不符合直观的形变,限制了其作为可靠世界模型的应用上限。