港科大、复旦、CMU 等联合发布首篇自回归视频生成 Memory 综述
长视频越生成越容易忘,这篇综述第一次把五花八门的视频生成 Memory 机制归到统一框架下,便于选型和评测。
港科大、城大、复旦、CMU、NYU、NTU 等机构联合发布 110 页综述,把长视频生成、流式生成和交互式世界模型中的记忆机制放进统一框架。论文把 Memory(跨自回归步持续维护的历史状态,即使原始信息已离开当前上下文仍能影响生成)按载体、功能、操作、学习和评测五个维度重新分类。
正文摘录
.jpg)  过去一年,视频生成正在快速走向 long-horizon generation、streaming generation 和 interactive world model 。但随着生成越来越长,一个基础问题也越来越难绕开:模型到底该如何「记住」过去?角色离开画面后再次出现,还是不是同一个人?镜头绕一圈重新回到原来的场景,空间布局还能否保持?一个物体已经被移动,几十个 generation steps 之后,它会不会又回到原位? 与此同时,视频生成 / 世界模型(world model)中以 记忆(Memory) 为核心的工作也越来越多:历史 frame、VAE latent、KV cache、recurrent state、3D world state,甚至直接将历史信息写入模型参数。这些机制都叫 Memory,但它们究竟应该如何分类?又分别在解决什么问题?