用于持久故事与交互世界的长时程音视频生成
视频生成正从孤立片段迈向长叙事与交互世界,要求模型在长程推演中保持身份、遵从用户控制并保持稳定。我们提出 JoyAI-Echo-1.5,一个统一的音视频生成系统,包含两个专设变体: 1. 长视频变体 引入可组合的跨镜头记忆,聚合多个先前镜头的视觉证据与语音过滤获取的说话人线索,在文本、图像和记忆条件的灵活组合下保持角色外观与声音身份。 2. 世界模型变体 将异构导航输入转换为校准的度量 6-DoF 相机轨迹,经几何感知条件路径注入,支持跨灵活视角的控制器无关交互。 为支持高效长程生成,我们将双向音视频骨干改造为因果少步生成器,采用渐进式教师强制与短程、长程自梯度强制。实验表明,该模型在两个场景均表现优异:JoyAI-Echo-1.5 在跨镜头一致性、视觉质量、文本对齐和语音保真度上超越现有长视频基线;其世界模型变体在 WBench 排名第一(平均分 81.7),并在 SANA-WM-Bench 上取得领先视觉质量与长程持久性。这些结果验证了记忆、几何控制与 rollout 感知训练为生成连贯故事和持续演化交互世界提供了实用基础。
论文精读
TL;DR JoyAI-Echo-1.5 通过跨镜头记忆、几何相机控制与 rollout 感知训练,统一长视频与交互世界生成,实现跨镜头角色、声音一致性与任意视角世界持续演进。
问题
视频生成领域正从单镜头短片向长时程叙事与交互式世界建模演进,要求模型在数十秒到分钟级 rollouts 中保持角色、场景与音频的连贯性。
现有方法局限
- 跨镜头一致性不足:多数方法逐镜头独立生成,仅依赖文本或单张参考图,导致角色外观、服装、声线在多镜头间漂移。
- 缺乏音频记忆:现有工作很少将语音身份与视觉身份绑定,无法在长故事中维持同一说话人的音色和口型同步。
- 世界模型控制精度低:交互式世界模型常使用离散动作或俯视轨迹,难以将异构导航输入(键盘、游戏手柄、自由视角)转换为精确的 6-DoF 相机位姿,导致视角漂移或不符合物理尺度。
- 训练与推理分布不匹配:传统 teacher forcing 训练在推理时自回归 rollout,误差累积导致长期稳定性差;而且扩散模型多步采样速度慢,难以支撑实时交互。
为什么这个问题难/重要
长时程生成需要同时解决身份持久性、跨模态对齐(视觉+语音)、几何可控性和推理效率四个耦合挑战。特别是自回归生成中的误差累积和记忆泄漏问题,要求设计新的训练目标(如 Self-Gradient Forcing)和记忆写入机制。业界高度关注视频生成到世界模型的转变,因为它是构建持续演进的虚拟环境、数字人和具身智能模拟的基础。
行业类比
类似自动驾驶仿真需要一致的道路场景和可控相机轨迹来测试规划算法,长时程音视频生成则为虚拟制片、游戏世界自动生成和交互式叙事提供统一底座。
核心洞察
- JoyAI-Echo-1.5 通过可组合的跨镜头记忆与语音过滤的说话人线索,在长视频生成中同时绑定视觉身份和声音身份。与仅使用单张参考图或单镜头音频的先前工作不同,它聚合多个已生成镜头的视觉证据,并从全镜头音频中提取说话人 cues,使模型能根据文本、图像和记忆条件的任意组合生成一致的多个角色,跨镜头维持外观和声线,且支持灵活的条件配置。
- 世界模型变体将异构导航输入统一校准为 metric 6-DoF 相机轨迹,并通过几何感知条件路径注入模型。不同于直接将控制器信号作为条件或依赖相对位姿的工作,这种校准使模型与具体交互设备解耦,实现控制器无关的操控,在灵活视点下保持几何一致性,从而在 WBench 和 SANA-WM-Bench 上取得领先,表明几何先验对世界模型长时持续性至关重要。
方法
JoyAI-Echo-1.5 将长视频生成与世界建模统一在同一个音频-视频生成框架下。系统接收异构条件输入:长视频模式接受 文本描述、参考图像 和 跨镜头记忆(cross-shot memory),世界模型模式接受 导航输入(如键盘/手柄命令)。
关键模块
- 统一音视频记忆条件:构建 composable cross-shot memory,聚合前序镜头的视觉证据,并从 speech-filtered full-shot audio 提取 speaker cues,通过 RoPE 注入 memory conditioning,使角色外观和声音身份在多个 shot 间保持一致。
- 几何感知相机控制:将异构导航输入校准为 metric 6-DoF camera trajectories,经过 geometry-aware conditioning pathway 注入模型,实现与控制器无关的视角交互。
- 因果少步生成器:将双向音频-视频 backbone 改造为 causal few-step generator。训练采用 progressive teacher forcing 先行初始化,随后在自生成 rollout 上应用 short-horizon 与 long-horizon Self-Gradient Forcing,结合 distribution matching distillation (DMD) 进行加速,音频部分额外引入对抗与能量约束。
输出为长时连贯视频或可交互的持续演化世界。
与同类方法相比,JoyAI-Echo-1.5 首次在统一框架内同时显式建模跨镜头记忆、几何 6-DoF 控制以及 rollout-aware 训练,使身份持久性和长时稳定性不再依赖外部模块或固定镜头模板。
实验
实验设计
JoyAI-Echo-1.5 包含两个变体:长视频变体 与 世界模型变体。长视频变体引入可组合的跨镜头记忆(composable cross-shot memory),聚合多镜头视觉证据及基于语音过滤的说话人线索,保持角色外观与语音身份;世界模型变体将异构导航输入转换为校准的度量 6-DoF 相机轨迹,通过几何感知条件注入,实现控制器无关视角交互。训练上将双向音频视觉骨干转为因果少步生成器,采用渐进 teacher forcing 及短/长时域 Self-Gradient Forcing 于自生成 rollout 上优化。评估覆盖跨镜头一致性、视觉质量、文本对齐、语音保真度(长视频),以及 WBench、SANA-WM-Bench(世界模型)。
关键发现
长视频任务中,JoyAI-Echo-1.5 在跨镜头一致性、视觉质量、文本对齐与语音保真度上均优于现有长视频基线。世界模型变体在 WBench 上平均分 81.7,排名第一;在 SANA-WM-Bench 上取得领先的视觉质量与长期持久性。这些结果表明,结合记忆、几何控制与 rollout 感知训练,可为生成连贯故事与持续演进的交互世界提供实用基础。
基线对比解读
相比独立生成各镜头的传统方法,跨镜头记忆 是核心差异点,显著抑制了长序列中的身份漂移。世界模型方面,统一相机意图接口与尺度校准解决了异源导航输入的兼容问题,控制器无关交互优于固定轨迹或特定控制器方案。采用 DMD 加速 与 Self-Gradient Forcing 处理自生成 rollout,有效降低曝光偏差,增强长期稳定性,这是较仅用教师强制或短时训练方案的改进。
行业影响
落地场景
长视频叙事生成 与 交互式世界建模 是 JoyAI-Echo-1.5 的直接应用领域。在内容平台,可自动生成多镜头连续短剧或虚拟主播节目,角色外观与声音保持一致;在游戏与虚拟世界,world-model 变体支持控制器无关的 6-DoF 相机轨迹生成,用于生成可探索的 3D 环境或过场动画;在电商展示,可生成产品多角度、多场景的故事化演示视频,替代部分实拍成本。
商业价值
该模型通过 rollout-aware 训练 和 少步生成 显著降低长视频生成的计算成本与延迟,支持准实时交互。跨镜头记忆与语音保真提升用户沉浸感和内容一致性,减少人工后期修整。在 WBench 上平均分 81.7 的领先性能可直接作为高质量生成服务变现,帮助平台降低 UGC/PGC 制作门槛,增加内容供给和用户时长。
与现有产品/工作流的接口
模型可封装为 API 或本地推理服务,接入现有视频编辑管线(AE、Premiere 插件)、游戏引擎(Unity/Unreal 生成式资产工具)或 AIGC 平台。其条件组合支持 text/image/memory 多种输入,兼容现有 prompt 工作流。world-model 变体输出校准的度量 6-DoF 轨迹,能直接对接 SLAM 或导航系统,用于机器人仿真或数字孪生。GitHub 仓库提供开源权重与推理代码,便于二次开发与微调。
具体落地 use case:
- 电商产品视频自动生成:输入产品图片和文案,模型生成多镜头故事化广告,保持产品外观一致并添加语音解说,节省拍摄成本。
- 在线教育互动课程:利用长视频生成制作系列教学短片,教师形象和声音跨镜头保持,支持根据学生进度生成不同分支的互动内容。
局限
- **训练与推理成本**:方法包含 **多阶段数据构建**、**渐进教师强制**、**短/长程 Self-Gradient Forcing** 与 **DMD 蒸馏** 等复杂流程,且长程 rollout 需自生成轨迹,整体计算开销高;论文未提供与单阶段或轻量方法的成本对比,实际部署门槛较高。
- **泛化边界**:世界模型依赖 **校准后的 6-DoF 相机轨迹** 与 **几何感知条件**,评测集中在 **WBench** 与 **SANA-WM-Bench** 等基准;对真实世界无标定导航、非欧几里得交互或极端视角变化,位姿估计误差可能导致场景漂移或几何失真,泛化性尚未充分验证。
- **长期一致性风险**:尽管提出 **"Towards Causal Memory Leak-free prefix"** 与 **块递归写入**,跨镜头聚合视觉与说话人证据仍可能累积误差;数分钟以上故事中人物外观/声音漂移缺乏系统消融,自动指标难以完全反映人类对故事连贯性的感知。