论文

Echo-Infinity: 学习演化记忆用于实时无限视频生成

Echo-Infinity: 学习演化记忆用于实时无限视频生成

现有自回归视频生成方法受限于固定缓存窗口和启发式压缩,导致历史信息丢失和误差累积。为此,我们提出 Echo-Infinity,一个采用可学习演化记忆的自回归框架,通过Memory Query在局部窗口淘汰时利用注意力和门控机制更新,与视频扩散变换器(DiTs)端到端优化,实现恒定计算量的任意压缩比,从而支持实时无限视频生成。 该方法引入统一相对RoPE配方,将锚定帧固定为 id 0,最新帧 id 在训练和推理中不超过 DiTs 预训练的最大时间 RoPE id,从而摆脱有限 RoPE 约束并消除训练-测试 RoPE 外推差异。在长、短视频生成任务中,Echo-Infinity 达到最先进性能,首次实现超过 130 万帧(24 小时)的实时生成,为无限视频生成提供了可行路径。

论文精读

TL;DR Echo-Infinity 用可学习进化记忆与统一相对 RoPE,在恒定计算量下实现实时无限时长视频生成,首次展示 24 小时、超 130 万帧的实时滚动输出。

问题

问题背景

自回归(AR)视频生成在追求长序列甚至无限长度实时推理时,面临历史信息存储与计算开销随长度线性膨胀的核心矛盾。如何在恒定资源下维持时间连贯性与生成质量,是该领域的迫切需求。

现有方法局限

当前主流方案大多依赖三种人工设计的记忆策略:

  • 预定义 KV-cache 淘汰计划(如按固定步长滑窗),会刚性丢弃早期帧,无法根据内容重要性动态保留关键信息;
  • 固定比率的启发式压缩(如统一降采样或 token 归并),对所有帧平等对待,忽略不同时刻的语义差异,造成重要细节丢失;
  • 推理阶段 RoPE 适配(如插值或截断),仅在推理时调整位置编码,训练-推理之间的 RoPE 外推间隙导致长序列性能骤降。 这些手动方案无法端到端优化,且因忽略自回归生成噪声,复合误差迅速累积,生成质量随视频变长而崩溃。

为什么难/重要

  • 动态记忆与恒定成本:要求模型在推理过程中实时学习“记住什么、压缩什么”,并以恒定计算量支持任意长度历史,这对记忆机制设计提出极高要求。
  • 训练-推理一致性:克服 RoPE 有限长度约束,使模型能在远超训练长度的序列上稳定外推,是工业级无限视频生成的基础。
  • 实时无限生成场景:虚拟主播、流式游戏世界、监控视频理解等应用场景迫切需要“永不停止”的高质量视频流,任何内存膨胀或质量衰退都会阻碍落地。

这就像为大语言模型设计的无限上下文记忆(如 AutoCompressors),但视频生成还需在时间维度保持视觉连贯性,对压缩效率和逐帧生成质量有更苛刻的要求。

核心洞察

  • 可学习的演化记忆(Memory Query)打破了固定 KV-cache 调度或启发式压缩的局限。现有方法依赖人工设计的缓存策略或固定压缩比,无法自适应地过滤、抽象历史信息,导致长视频生成中误差累积逐渐破坏内容一致性。Echo-Infinity 通过端到端训练的注意力与门控机制,将每帧记忆动态压缩为一组可优化查询向量,在固定计算开销下保持任意长度历史的有效表示。这一设计更贴近人类记忆巩固过程,在生成质量与效率之间建立了新的平衡,并为无限长度视频生成提供了可扩展的架构范式。
  • 统一相对 RoPE(Unified Relative RoPE Recipe)弥合了训练与推理中的位置编码外推裂缝。以往方法在生成长于预训练最大长度的视频时,需依赖推理时 RoPE 调整或截断,导致时序建模退化。Echo-Infinity 固定 Sink 帧的 RoPE id=0,并约束最新帧 id 不超过预训练上限,使模型在训练和推理中始终处于已知位置编码区间,无需外推。这一统一方案消除了因位置编码不匹配引起的生成噪声,是实现 24 小时实时视频生成的关键工程突破,也为其他自回归生成任务的长序列扩展提供了通用思路。

方法

整体流程

Echo-Infinity 是一个自回归生成框架,输入为已生成的视频帧序列,输出下一帧,从而实现理论上无限长度的实时视频生成。其核心突破在于用可学习的演化记忆替代传统固定缓存策略,使模型能在恒定计算成本下动态压缩、抽象任意长的历史信息。

关键模块:可学习记忆查询

  • 局部窗口与记忆查询:模型维护一个固定大小的局部帧窗口,旧帧移出窗口时,不直接丢弃,而是通过一组可学习的 Memory Query(记忆查询向量)进行信息抽取。
  • 注意力与门控更新:Memory Query 与当前窗口内的帧通过交叉注意力交互,再经门控机制选择性融合新旧信息,逐步更新记忆状态。这一过程模仿人类记忆巩固,能滤除冗余、保留关键动态。
  • 端到端训练:Memory Query 与视频扩散 Transformer (DiT) 联合优化,使记忆在生成任务中自适应演化。推理时,无论视频多长,计算量只取决于固定的局部窗口与记忆查询的数量,不受历史长度影响。
  • 生成先验:即使仅用优化后的初始记忆状态,也能提升生成质量,表明记忆查询学习到了通用的视频动态先验。

RoPE 位置编码适配

现有 DiT 受预训练时的旋转位置编码 (RoPE) 最大索引限制,生成长视频时会出现位置外推误差。Echo-Infinity 提出统一相对 RoPE 配方

  • 将早期“锚帧”的 RoPE 索引固定从 0 开始;
  • 最新帧的索引最多增长到 DiT 预训练的最大时间 RoPE 索引,不再继续增长。 该方案消除了训练-推理时 RoPE 的外推差异,使模型能处理任意长度序列而不违反位置编码约束。

与同类方法的差异

传统方法采用手工设计的 KV 缓存淘汰规则(如固定压缩比、启发式窗口),信息丢失不可避免且会累积自回归误差。Echo-Infinity 的 learnable evolving memory 以数据驱动方式自适应保留关键信息,同时 Unified Relative RoPE 解决了有限 RoPE 的泛化瓶颈,首次实现了超过 130 万帧的实时连续生成。

实验

实验设计

Echo-Infinity 在视频 Diffusion Transformer (DiT) 架构上进行端到端训练,核心引入可学习记忆查询 (Memory Query)门控机制。训练时,视频帧以自回归方式流入,当历史帧从局部窗口移出时,记忆查询通过注意力动态筛选、抽象并压缩信息,形成进化记忆。同时,采用统一相对 RoPE 配方,将锚定帧 ID 固定为 0,最新帧 ID 增长至 DiT 预训练的最大时间 RoPE ID,从而消除训练-测试的 RoPE 外推差距。基线方法包括固定 KV 缓存调度、固定比例启发式压缩和推理时位置编码调整。

关键发现

  • 首次实现 24 小时实时无限视频生成:模型可连续生成超过 130 万帧的实时视频,计算与存储成本不随视频长度增长。
  • 生成质量达到 SOTA:在长、短视频生成任务上,Echo-Infinity 均优于现有方法,即便仅使用优化后的初始状态也能泛化提升质量,说明记忆查询可作为有效的生成先验。
  • 恒定成本与任意压缩比:与手工设计缓存不同,可学习进化记忆支持任意压缩比,且记忆更新完全通过反向传播优化,无需推理时调整。

对比基线解读

传统自回归视频生成依赖预定义的缓存策略(如固定窗口大小或固定比例丢弃旧帧),这类硬编码方案会系统性丢失关键历史信息,并因忽略扩散模型的生成噪声而加剧误差累积。Echo-Infinity 用可微分的方式替代手工规则:记忆查询在训练中学会保留对长程依赖有用的信息,门控机制进一步过滤噪声。统一相对 RoPE 则解决了因序列长度超出训练范围导致的位置编码外推失败问题,使模型在无限生成时保持时序一致性。整体设计将记忆管理与位置编码完全融入 DiT 训练,实现了从“人工策划”到“端到端学习”的范式转变。

行业影响

落地场景

Echo-Infinity 实现了恒定成本的任意长度视频实时生成,可部署于需要长时间连续视频流的场景:

  • 24/7 虚拟主播与直播带货:实时生成连贯的虚拟人表演,无需预录长视频,降低直播间运营成本。
  • 监控与自动驾驶仿真:生成无限长的多视角场景视频用于感知模型训练,避免物理采集限制。
  • 在线教育与数字人讲师:根据脚本或交互动态生成教学演示,支持课程长度弹性扩展。
  • 长效内容创作:电影视觉特效(VFX)中的背景长镜头自动补全,游戏中的无限地形渲染。

商业价值

  • 降本:通过 learnable evolving memory 将历史帧压缩为固定大小的记忆查询,推理计算量不随长度增长,大幅降低长视频生成的算力成本;手工记忆调度(如 KV-cache 轮换)的人力调参开销也被消除。
  • 增收:支持实时无限时长交互式视频服务,催生新的商业模式(如动态广告、个性化视频订阅),提高用户付费转化与留存。
  • 体验提升:统一相对 RoPE 消除训练-推理外推差距,改善长时间生成中的累积误差,输出质量稳定,减少帧间跳变与伪影,提升终端用户体验。

与现有产品/工作流的接口

  • 可封装为 REST APIgRPC 服务,接收初始帧/文本提示,返回持续视频流,与现有生成式 AI 平台(Runway、Pika、Stable Video Diffusion 管线)无缝集成。
  • 基于扩散变换器(DiT)架构,兼容 HuggingFace Diffusers 等生态,可插拔替换主干网络(如 OpenSora 等),通过加载预训练权重微调记忆模块即可适配不同基模型。
  • 在视频编辑工具中作为“无限延长”插件:输入片段后自动后续帧,用户通过时间轴实时控制,输出到 NLE(如 DaVinci Resolve)或渲染管线。

具体落地 Use Case

  1. 虚拟主播直播带货:平台提供 7×24 小时不间断的虚拟形象直播间,由 Echo-Infinity 动态生成与商品解说同步的画面,无需人工实时操控,节省大量制作班底,同时保证画面流畅不卡顿,提升观众留存与转化。
  2. 自动驾驶感知训练数据引擎:生成高保真、无限长的多视角行车视频,覆盖极端天气与光照,按需插入罕见事件,为检测、跟踪模型提供海量可控训练样本,规避真实路测成本与安全风险。

局限

  • 进化记忆虽然能以恒定计算处理无限长视频,但其压缩本质上是有损的;随着生成帧数超过千万级,门控机制的选择性遗忘可能逐渐偏向短期信息,导致长期一致性衰退。论文未讨论极端长度下的质量稳定性,这类现象在多模态AR模型中已有先例。
  • 统一相对RoPE要求所有序列共享固定的沉没帧索引(id=0),这隐含假设视频开头始终可参考,但在交互式生成或剧情转向时,旧开头可能成为噪声;此外,该方法实时生成24小时视频仍需高显存GPU,推理吞吐成本未充分量化,离边缘端部署尚有距离。
  • 与TECO等流式Transformer相比,Echo-Infinity的记忆压缩全靠端到端学习,缺乏人工可解释性,调试困难;学习到的记忆查询可能对训练域敏感,遇到分布外内容时容易引入不可预期的压缩误差,而手工调整的压缩策略反而有更好的域泛化保证。
论文Yuxuan Bian2026-06-03原文

相关内容