行业新闻

港科大、复旦、CMU 等联合发布首篇自回归视频生成 Memory 综述

长视频越生成越容易忘,这篇综述第一次把五花八门的视频生成 Memory 机制归到统一框架下,便于选型和评测。

港科大、城大、复旦、CMU、NYU、NTU 等机构联合发布 110 页综述,把长视频生成、流式生成和交互式世界模型中的记忆机制放进统一框架。论文把 Memory(跨自回归步持续维护的历史状态,即使原始信息已离开当前上下文仍能影响生成)按载体、功能、操作、学习和评测五个维度重新分类。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/7077c97d-e986-4951-b01e-f4e87deb1744/01(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 过去一年,视频生成正在快速走向 long-horizon generation、streaming generation 和 interactive world model 。但随着生成越来越长,一个基础问题也越来越难绕开:模型到底该如何「记住」过去?角色离开画面后再次出现,还是不是同一个人?镜头绕一圈重新回到原来的场景,空间布局还能否保持?一个物体已经被移动,几十个 generation steps 之后,它会不会又回到原位? 与此同时,视频生成 / 世界模型(world model)中以 记忆(Memory) 为核心的工作也越来越多:历史 frame、VAE latent、KV cache、recurrent state、3D world state,甚至直接将历史信息写入模型参数。这些机制都叫 Memory,但它们究竟应该如何分类?又分别在解决什么问题?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-08原文

相关内容