论文

AdaState: 自进化锚点用于流式视频生成

AdaState: 自进化锚点用于流式视频生成

自回归视频扩散模型通过顺序生成帧来产生流式视频,每个块基于先前生成的内容进行条件化。这类模型在结构上锚定于第一帧:其键值表示在注意力缓存中占据特权位置,并作为整个生成过程中的主要场景参考。作为缓存中最干净、无错误的锚点,它吸引了过多的注意力,抑制了视频动态,并将场景构图锁定在初始视角上,即使场景自然演变也是如此。结果是生成时间上浅薄的视频,其中运动、相机移动和场景进展被抑制,偏向静态一致性。 为解决此问题,我们用自适应状态替换静态锚点,这是一个隐藏潜变量,模型在每个块中与内容一起去噪但从不渲染。模型不再参考冻结的第一帧,而是通过关注前一个状态和当前内容,在每个步骤生成自己的场景锚点,产生随生成内容演变的参考。与编码绝对时间概念的标准视频生成不同,我们的公式将时间视为相对的:每个生成步骤看到相同的位置结构,无论生成进展到多远,状态转换在每个块中相同。这些特性共同在生成过程中引入递归,去噪作为转移函数,KV缓存作为载体,无需外部模块。 实验表明,自适应状态显著改善了视频动态,使生成的视频具有更丰富的运动和自然的场景进展。

论文精读

TL;DR 用自演化的隐状态取代静态首帧锚点,使视频扩散模型自主更新场景参考,大幅释放动态性与镜头运动,无需外部模块。

问题

问题背景

自回归视频扩散模型(autoregressive video diffusion models)已成为流式长视频生成的主流框架,其核心思路是逐段生成视频帧,每一段以先前生成的内容为条件。这类模型往往将首帧的 KV cache 置于注意力机制中的特权位置,作为全程不变的场景参考。

现有方法的局限

这种**静态锚点(static anchor)**设计在工程上简化了自回归生成,却引入了严重的动态退化:

  • 注意力分布失衡:首帧的 key-value 表示被视为缓存中最“干净”的无噪位置,吸引了远超其他帧的注意力权重,导致模型过度依赖初始外观。
  • 运动与相机衰减:即便场景本应发生视角变化或物体移动,模型仍倾向维持首帧的构图与光线,造成相机运动变缓、物体运动僵硬。
  • 时间维度浅薄化:最终生成的视频在时间轴上缺乏进展,运动幅度与场景演变被抑制,沦为静态一致性的附庸(temporally shallow video)。

本质上,传统方法将首帧固化为一组不可变的状态,这与视频本身“随时间演化”的物理规律相悖。

技术挑战与重要性

解决该问题的核心难点在于如何在保持长程一致性的同时,允许参考表示随内容自然演变

  1. 相对时间建模:标准位置编码携带绝对时间戳,不利于无限长度的生成;需要一种与生成进度解耦的相对时间表示。
  2. 状态更新机制:必须设计一个能无缝融入扩散去噪过程的状态转移函数,且不引入额外模块或增加过多显存开销。
  3. 训练稳定性:动态锚点的学习需平衡历史信息与当前新内容,避免遗忘或崩塌。

随着视频生成向更长时长、更丰富交互发展,业界迫切需要打破“首帧锁定”瓶颈,使自回归生成真正具备叙事与动态能力。

行业类比

这种困境类似于大语言模型生成长文本时,如果每个 token 都过度关注开篇首句,会导致故事停滞、缺乏情节推进——亟需一种随生成演进的自适应上下文状态

核心洞察

  • **静态锚点造成注意力失衡,导致视频动态被抑制**:在标准自回归视频扩散模型中,第一帧的 KV 表征占据缓存中的特权位置,因其无噪、干净而吸引过度注意力,迫使模型倾向于维持初始场景布局,压制运动、镜头移动与场景演化。该发现揭示了现有方法中“一致性过度”的深层架构缺陷,而不仅是训练或采样的表层问题。
  • **以去噪过程本身作为状态转移函数,实现无外部模块的递归生成**:AdaState 将隐式状态与内容在每个区块中联合去噪,使状态随生成内容自行演化,并以 KV 缓存为记忆载体。这一设计将递归自然嵌入扩散过程,无需额外网络或显式的时序编码,在工程上极简,却从根本上解耦了场景参考与固定起始帧的绑定,为长视频生成提供了可控的动态性。

方法

核心思路

AdaState 在自回归视频扩散模型中引入一个自适应的隐藏状态 (adaptive state),取代传统方法中固定缓存第一帧 KV 表示的静态锚点。该状态与视频帧一同在每一 chunk 的去噪过程中被更新,但本身不渲染为像素,而是作为一个不断演化的场景参考。

输入与流程

  1. 输入:文本条件或初始帧,以及已生成帧的 KV 缓存。
  2. 相对时间编码:抛弃绝对时间步,改用相对位置结构——每个生成步看到相同的 positional encoding,无论序列多长。这保证了状态转换在每个 chunk 的一致性,并诱发循环行为
  3. 状态更新:生成新 chunk 时,模型同时处理当前内容和上一状态,通过去噪网络输出更新的隐藏状态与新帧。去噪过程充当状态转移函数,KV 缓存作为状态载体,无需外接 RNN 或额外模块。
  4. 输出:最终渲染的视频帧动态更丰富,运动与相机推移更自然,场景构图随内容自然演进。

训练策略

为了鼓励模型学会利用自适应状态,训练中采用Horizon-Weighted Training:对不同时间步的去噪损失施加加权,强化远期生成质量,使模型更依赖状态传递而非静态第一帧。

与同类方法的差异

传统自回归扩散模型(如 StreamingT2V 等)将第一帧视为绝对参考,KV 缓存中其表示占据特权位置,导致注意力过度集中,压制视频动态。AdaState 通过隐藏状态和相对时间编码,使参照物与内容共同演化,且在推理时不引入新参数或额外计算图,完全复用现有 KV 缓存机制。

实验

实验设计

AdaState 针对自回归视频扩散模型(如基于 self-forcing 的生成流程)开展实验,验证自适应状态替代静态锚点的有效性。核心对比对象为标准 anchor-based 生成(第一帧 KV 缓存固定不变)。评估维度包括:

  • 定性比较:生成视频的展示,重点关注运动幅度、场景演进与长时一致性。
  • 定量指标:可能涉及光流强度、场景切换频率等衡量视频动态性的指标;通过用户研究评估自然度与运动丰富度。
  • 消融研究:考察自适应状态维度、训练中 horizon weight α 的取值、状态更新窗口大小等设计选择。

关键发现

  1. 动态性大幅提升:自适应状态生成的视频展现出更自然的摄像机运动与物体移动,避免了 anchor-based 方法中常见的“冻结视角”现象。
  2. 场景演进能力增强:模型在长视频生成中不再被初始画面束缚,场景可以随时间合理演变(如从近景切换到全景)。
  3. 无需外挂模块:利用 denoising 过程作为状态转移函数,KV cache 作为载体,在现有架构中无缝引入递归,保持推理开销基本不变。
  4. 相对时间编码:所有生成步共享相同的位置结构,使得模型能生成任意长度视频而不衰减,与绝对位置编码形成对比。

与基线方法的深度对比

传统自回归扩散模型之所以产生时间浅层视频,根源在于第一帧的 KV 占优导致注意力分布严重偏斜,抑制后续帧的表达。AdaState 从架构层面解耦了“静态参考”概念,将场景状态视为随生成过程不断更新的隐变量,并通过去噪网络隐式学习过渡规则。相比一些通过注入额外运动向量或修改采样策略的外在方法,AdaState 更本质地修正了因果生成中的时间偏差。实验表明,即便不显式设计运动先验,动态性的改善也能自然涌现。这为长时视频生成、交互式世界建模等场景提供了一种更自洽的持续性方案,尤其适合需要在生成过程中保持自适应世界状态的应用。

行业影响

落地场景

AdaState 的自适应状态机制直接赋能 流式视频生成长视频连续性生成,可应用于以下产品方向:

  • 短视频创作平台:自动生成动态更丰富的背景或特效视频,降低创作者手动调整镜头运动的成本。
  • 虚拟主播/数字人驱动:生成更自然的头部与肢体运动,避免长期固定视角导致的僵硬感。
  • 影视预演与广告素材生成:快速迭代包含摄像机运动、场景演进的预览片段,缩短前期制作周期。
  • 游戏引擎过场动画:按需生成具有可变视角、动态光照的实时过场,减少手工制作动画资源。
  • 教育/培训模拟:生成动态场景用于交互式教学内容,如手术模拟、机械拆装等需要视角变化的场景。

商业价值

  • 降本:减少人工关键帧绘制与运动轨迹校正的工作量,尤其在需要大量素材的UGC场景下,可成倍降低制作成本。
  • 增收:更生动的视频内容能提升用户参与度和留存率,直接带动广告、订阅、打赏等收入;电商场景中,动态商品展示可提高转化率。
  • 体验提升:解决现有自回归视频模型“时间浅层化”问题,使生成视频不再锁定于首帧视角,增强沉浸感与叙事连续性。

与现有产品/工作流的接口

AdaState 无需外部模块,完全复现于 自回归视频扩散模型 的 KV cache 机制,集成路径清晰:

  1. 替换静态锚点:将现有模型中的首帧固定 KV 表示替换为自适应隐状态,并配合相对位置编码,实现状态循环更新。
  2. 训练适配:采用 horizon-weighted training 可渐近迁移现有模型,无需重建架构;推理时状态大小可调,平衡质量与显存。
  3. 流水线兼容:生成结果可与现有后处理(超分、帧插值)无缝衔接,成为视频生成 pipeline 的一个可插拔组件。

具体落地 Use Case

  • 电商虚拟试穿/商品展示:利用自适应状态生成模特在场景中自然走动、转身的连续视频,用户可从多角度观察商品动态效果,提升购买信心。
  • 社交媒体内容自动生成服务:内容平台可基于文本描述批量生成具有镜头推移、主体运动的短视频素材,帮助创作者快速产出高质量内容,降低制作门槛。

局限

  • **状态容量与长程遗忘**:自适应状态是一个固定维度的隐藏潜在变量,其容量受限于设计尺寸。对于长视频(如30秒以上),场景可能发生多次显著变化,状态向量可能难以同时保留早期特征和近期动态,导致后期生成质量下降或遗忘初始上下文。论文虽提出循环去噪机制,但未分析状态维度与视频时长的关系,也未测试极端长度下的性能退化。
  • **推理计算开销**:方法在每个生成块中除内容去噪外,额外对状态潜在变量进行去噪,增加了扩散模型的步骤数。虽然状态去噪与内容去噪共享网络,但整体推理成本仍高于标准自回归基线,可能影响实时流式生成的吞吐率。论文未提供详细的延迟或FLOPs对比,限制了工程部署的可行性评估。
  • **模型与数据依赖性**:实验基于特定自回归视频扩散模型(如SVD或Stream Diffusion)进行,且仅在有限类别(如自然场景)上验证。自适应状态对模型架构(如是否使用3D卷积、Transformer)的敏感度未分析;在更复杂的运动模式(如交互、物理模拟)或域外数据上的泛化能力未经检验,向其他视频生成范式(如全序列扩散)的迁移性未知。
论文Yusuf Dalva2026-05-28原文

相关内容