论文

Alaya-EVOKE: 从线性扩展监督到无尽世界

Alaya-EVOKE: 从线性扩展监督到无尽世界

交互式世界模型必须支持持久记忆、响应式交互和长时程生成,然而这些需求对模型提出了相互冲突的要求:在去噪器上下文或键值缓存中维护历史会带来持续增长的开销,迫使会话长度与记忆保留之间进行权衡;而低延迟交互依赖少步生成,其能力受限于教师模型。 Evoke 通过外部化持久世界状态并重新设计教师模型来同时解决这两方面局限。场景几何被维护在外部、以相机索引的世界状态库中,仅检索与视图相关的信息,使去噪器上下文随会话增长保持有界。教师模型并非固定生成器,而是为长时程监督设计:其稀疏注意力结合分块分组、选定远帧检索和线性注意力全局状态,使内存和计算线性增长,同时支持长时程监督。这种监督会暴露在短窗口内局部合理的内容漂移,而逐块条件化支持整个序列中的提示变化和事件控制。 进一步地,30 秒分布匹配目标 在自强制 rollout 下应用,将能力迁移到三步学生模型,且无需无分类器引导,在保持响应式条件化的同时提升了对长期漂移的抵抗能力。凭借有界上下文和循环外部记忆,Evoke 支持开放式、持续演化的生成;在单块 H200 上,384×640 分辨率下每个 1.5s 块生成耗时 2.11s。作为三步世界模型,Evoke 在 WBench 上达到最先进性能,同时在 VBench-Long 和 VBench-2.0 上保持竞争力。

论文精读

TL;DR Evoke 通过外部几何世界状态库与长时程教师监督,保持上下文有界、计算线性增长,并蒸馏到三步无分类器引导学生模型,在 H200 上以 2.11 秒生成 1.5 秒视频,实现开放世界持续生成且 WBench SOTA。

问题

问题背景

交互式世界模型(world model)在具身智能、开放世界游戏、长视频生成等场景中热度持续上升,核心诉求是:模型必须同时具备持久记忆、低延迟响应和长时域生成能力。

现有方法局限

主流方案将历史帧直接放入扩散模型上下文或 KV cache,激活内存与计算量随会话时长近似线性增长,导致只能在会话长度和保留记忆之间二选一。截断历史可控制成本,但长期一致性迅速崩塌;保留完整历史则推理开销不可接受。同时,低延迟交互要求 few-step 学生模型,其能力上限由教师模型决定,而传统教师只在短窗口内训练,难以暴露长时域中内容漂移——例如物体身份、视角布局、光照在几十秒内逐渐偏离,局部看似合理,全局已失真。

为什么难/重要

长期一致性与实时交互天然冲突:外部记忆需要高效索引和检索;教师监督需在长时域 self-forced rollouts 中匹配分布,避免漂移累积。业界关注度源于自动驾驶仿真、机器人数据生成、开放世界游戏对“无限时长”世界模型的刚需,现有 benchmark(如 WBench、VBench-Long)开始重点评估长会话稳定性和指令跟随,但多数模型在 30 秒以上就会发生明显退化。

行业类比

类似自动驾驶仿真系统:在有限算力下保持场景几何一致并即时响应控制信号,是量产级世界模型必须跨越的门槛。

核心洞察

  • 外部化世界状态以解耦记忆与计算。Evoke 将场景几何维护在外部相机索引的世界状态银行中,只检索当前视图相关信息,使去噪器上下文保持有界,从而支持无限增长的会话。与现有方法在去噪器上下文或 KV 缓存中保留历史导致成本线性增长不同,Evoke 通过分离存储与计算,实现了持久记忆与恒定上下文的统一,为开放式世界模型提供了可扩展的基础。
  • 重新设计教师模型以实现长时程监督能力。传统蒸馏教师通常作为固定高质量生成器,其全局注意力难以扩展到长时程,导致学生模型无法学习长程一致性。Evoke 的教师采用稀疏注意力(分块分组、选择性远帧检索、线性注意力全局状态),实现内存和计算的线性增长,从而能对 30 秒序列进行监督,暴露局部合理但全局漂移的问题。通过自强制 rollouts 的分布匹配目标,该能力被迁移到三步无 CFG 的学生模型,兼具低延迟与抗长时程漂移。

方法

输入

Evoke 接收连续视频帧与用户交互提示(如视角变化、事件控制),采用循环会话公式,逐个生成 1.5 秒的视频块。

关键模块

  1. 外部几何世界状态:维护一个相机索引的世界状态银行,仅检索与当前视图相关的信息,使去噪器上下文保持有界,避免随会话增长而膨胀。
  2. 长时程交互教师:设计稀疏注意力,结合 chunk-wise 分组、选定远帧检索与线性注意力全局状态,实现激活内存和计算的线性增长。教师为每块生成条件,支持提示变更和事件控制。
  3. 分布匹配蒸馏:应用 30 秒长时程分布匹配目标,在自强制 rollouts 下训练三步学生模型,学生不使用 classifier-free guidance (CFG)。
  4. 三步推理:学生以三步生成每个块,依靠外部记忆保持时序一致性。

输出

Evoke 输出开放性持续演化的视频序列,在单个 H200 上以 2.11 秒生成 1.5 秒视频块,实现有界上下文和低延迟交互。

差异点:与传统“固定教师蒸馏”方法不同,Evoke 重新设计教师强制执行长时程一致性,并用无 CFG 的学生配合外部记忆,解决了上下文增长与交互响应之间的根本矛盾。

实验

实验设计与评估基准

  • 在 WBench、VBench-Long、VBench-2.0 三个基准上评测交互式世界模型能力。
  • 训练采用 30 秒长时域分布匹配目标,结合 self-forced rollouts,将教师知识蒸馏到 三步去噪学生(无 CFG)。
  • 除基准外,还进行了长会话稳定性、有界运行时、几何记忆与定时交互以及教师消融实验。

关键发现

  • Evoke 在 WBench 达到 SOTA,作为三步世界模型在 VBench-Long 与 VBench-2.0 保持竞争力。
  • 外部 相机索引世界状态银行 使去噪上下文有界;单张 H200 上,384×640 分辨率下每 1.5 秒视频块生成耗时 2.11 秒,支持低延迟持续演化。
  • 长时域教师监督暴露短期局部合理但长期漂移的内容,学生通过分布匹配获得对长期漂移的鲁棒性,同时保留 prompt 变化与事件控制。

与基线方法的对比解读

传统交互世界模型在 denoiser context 或 KV cache 中维护完整历史,内存与计算随会话增长,被迫在会话长度与记忆保留之间取舍。Evoke 通过 稀疏注意力(chunk 分组、远帧检索、线性注意力全局状态)实现教师内存与计算的 线性增长,打破该权衡。教师不再仅是固定高质量生成器,而是面向长时域监督设计,使长程缺陷可被训练信号捕获。三步学生 无 CFG,减少推理开销,但仍能传递教师的响应式条件控制。相比同类工作,Evoke 的贡献在于将存储外部化与教师重设计结合,而非仅优化单一方面。

行业影响

落地场景

Evoke 的外部世界状态库和长时程稀疏注意力使其适合需要持续演进的交互式虚拟环境。

  • 游戏与互动叙事:开放世界游戏可实时生成可探索场景,支持无限会话长度与玩家分支选择。
  • 电商沉浸式体验:虚拟展厅或试穿间中,用户可自由漫游并与商品交互,场景随用户操作动态演变。
  • 模拟训练:医学、工业、应急演练等培训系统可提供低延迟、长时间的教学场景。

商业价值

  • 降本:三步学生模型无需 CFG,有界上下文与线性复杂度显著降低推理算力,使长时程生成在单张 H200 上可行。
  • 增收:交互式体验提升用户粘性与转化率,可支撑订阅制内容或增值服务。
  • 体验提升:每个 1.5s chunk 生成仅 2.11s,接近实时;30 秒分布匹配目标抑制长时内容漂移,提高生成质量稳定性。

与现有工作流的接口

Evoke 可作为独立推理服务,通过 API 集成到游戏引擎(如 Unity、Unreal)或内容平台。

  • 其外部世界状态库与向量数据库(如 FAISS、Milvus)天然兼容,可扩展为多用户共享的记忆系统。
  • 三步学生模型可替换现有扩散模型中的多步采样器,直接接入 ComfyUI 或自建推理流水线。
  • 自然语言指令接口使 LLM 智能体能实时控制场景事件,与现有 RAG 或 Agent 框架结合。

具体落地 use case:

  1. 电商虚拟展厅:用户进入一个持续运行的 3D 展厅,可自由移动视角、更换家具材质、询问虚拟导购。Evoke 保证长时间浏览不掉线,实时响应操作,提升沉浸感与下单率。
  2. 自动驾驶仿真:构建可交互的交通场景,测试车辆行为时动态改变天气、突发障碍物,Evoke 的持久记忆支持多轮连续测试,降低实车路测成本。

局限

  • **外部世界状态库**的构建依赖可靠的几何重建或深度估计,论文未充分讨论在动态物体、非刚性形变或复杂光照条件下如何维持一致性;其存储开销随会话长度线性增长,虽将 transformer 上下文限制在局部窗口,但长期运行仍面临存储容量和检索质量的约束。
  • **三步学生模型**通过分布匹配蒸馏教师能力,但实验显示在 **VBench-Long** 和 **VBench-2.0** 上仅达到 competitive 而非全面 SOTA,暗示部分生成维度(如文本对齐或长期一致性)可能未能完全继承教师模型;移除 CFG 虽降低计算延迟,也可能削弱对用户提示的精确控制。
  • 生成速度上,每个 **1.5 秒 chunk** 需 **2.11 秒** 推理时间,尚未达到实时交互所要求的 < 1.0 倍速,在真实交互场景中可能引入可感知的等待;评估主要基于离线 benchmark,对真实用户交互中的事件响应及时性和长会话主观体验的验证不足。
论文Yuanyang Yin2026-08-13原文

相关内容