EchoWM: 开放可进入的全模态世界模型
EchoWM 是一个面向可进入生成媒体的全模态世界模型,能够在连续导航的同时联合生成 720p 视频、环境声音、音乐和语音。交互围绕相机意图组织:在第一人称场景中,它指定观察者运动;在第三人称场景中,相机–角色动态从数据中学习,无需视图专用控制器。离散指令与连续姿态被映射到共享的度量尺度相对 6-DoF 轨迹,并通过数据集级校准在异质数据间保持运动幅度一致。 为了联合学习视听生成与轨迹控制,我们构建了互补的数据引擎,并采用渐进式训练和自回归后训练以支持长时程生成。实验表明,该模型在公开世界模型基准上实现了强轨迹跟随与高视觉质量,支持第一/第三人称多对象交互,并在长时程生成中保持同步的环境声音与语音。
论文精读
TL;DR EchoWM 是可进入的全模态世界模型,能按 6-DoF 相机轨迹同步生成 720p 视频、环境声、音乐与语音,支持第一/第三人称,轨迹跟随与长时一致性突出。
问题
问题背景
生成式世界模型正从一次性视频生成转向可进入的生成媒体(enterable generative media),期望支持用户以第一或第三人称视角连续导航,同时生成与视觉同步的高分辨率视频、环境声、音乐和语音。当前领域关注如何将控制信号(如相机轨迹)与多模态生成统一起来。
现有方法局限
已有的交互式生成模型存在几个具体技术缺口:
- 模态覆盖不全:多数工作仅生成视频,忽略音频或只在后处理阶段拼接声轨,导致音画同步弱。
- 控制接口粗糙:通常只接受离散动作(如键盘命令或预设视角),无法处理连续 6-DoF 位姿轨迹;第一人称和第三人称场景还需要不同的控制器设计。
- 尺度不一致:训练数据来自异构来源,相机运动的度量尺度差异大,导致相同控制信号在不同数据上产生不同的运动幅度,影响模型泛化。
- 长时一致性差:长序列生成中,轨迹跟随误差累积,音频与视觉逐渐失步,且缺乏有效的联合训练和后训练策略来缓解。
为什么这个问题难且重要
跨模态时空对齐、度量级运动控制和长时一致性三者相互制约:音频生成必须与视频的物理事件对齐,轨迹控制要求输出与输入位姿精确匹配,而长序列推断又需要保持自回归稳定性。构建大规模配对数据需同时标注视频、音频和轨迹,数据引擎设计复杂。业界对可进入的生成媒体需求上升,尤其在游戏、仿真和虚拟制作中,需要世界模型支持实时交互和智能体评测。
行业类比
类似于自动驾驶仿真需要生成带传感器数据的驾驶场景,世界模型需要成为可编程的生成环境,让智能体在其中学习和评估。
核心洞察
- EchoWM 用 camera intent 统一第一人称与第三人称交互,将观察者运动与相机-角色动力学都映射到共享的相对 6-DoF 轨迹,使同一模型支持两类场景。这不同于现有工作常为不同视角设计独立控制器或动作空间,导致结构割裂且难以迁移。统一接口既简化了推理流程,也提升了离散指令与连续位姿的兼容性,为 enterable generative media 提供一致的操控范式。
- EchoWM 提出数据集级 metric-scale 校准,将 heterogeneous 数据源中的相机运动幅度对齐到物理尺度,保证相对 6-DoF 轨迹在不同数据集间运动幅度一致。许多 world model 直接使用原始标注学习动作,但不同数据源位姿尺度、频率差异大,难以学到可泛化的运动控制。通过 metric pose recovery、densification 与 quality filtering,EchoWM 在 WBench Navigation 和 SANA-WM-Bench 上实现强轨迹跟随表现。
- EchoWM 采用 progressive training 加 autoregressive post-training,先分别掌握视觉与轨迹控制,再联合学习音频/语音同步,最后进行长时程自回归后训练。多数 audio-visual 模型只关注短视频片段且声画简单拼接,或 world model 只训练视觉忽略音频。该策略解决了长时程生成中声画同步与轨迹跟随的冲突,支持 environmental sound 和 speech 在多个时间步内保持同步,显著提升交互生成的真实感与一致性。
方法
EchoWM 的输入为 camera intent:第一人称场景下由离散移动命令或连续 6-DoF 位姿指定观察者运动;第三人称场景则从数据学习 camera–character 动态,无需视角专用控制器。
关键模块:
- Metric Camera-Intent Conditioning:把离散命令和连续位姿统一映射到 metric-scale 相对 6-DoF 轨迹。通过 global translation scale calibration 与 dataset-level calibration 对齐不同数据源的运动幅度,避免训练时轨迹尺度漂移;再以 relative trajectory conditioning 作为控制条件注入生成模型。
- Progressive Audio-Visual Control Training:先分阶段训练视觉生成与轨迹跟随,再逐步引入环境声、音乐和语音等音频模态,降低联合优化难度。
- Streaming Audio-Visual Post-Training:在预训练基础上进行自回归后训练,包含 audio-visual teacher forcing、short-horizon self-gradient forcing 和 long-horizon self-gradient forcing,增强长时域音画同步与闭环轨迹控制能力。
- Interactive Inference:以流式方式接收连续轨迹输入,生成 720p 视频与对应音频。
输出为长时域 720p 视频、环境声、音乐和语音的同步序列。
与同类可交互世界模型相比,EchoWM 的关键差异是用统一的 metric-scale 相对 6-DoF 轨迹替代视角专用控制器,并在数据层面做全局尺度校准,从而兼容第一/第三人称的异质数据。
实验
实验设计
EchoWM 在 WBench Navigation 与 SANA-WM-Bench 两个公开世界模型基准上评测轨迹跟随与视觉质量,同时通过用户研究、定性分析和消融实验补充验证。消融覆盖轨迹表示、全局尺度校准、跨视角 camera-intent 建模等关键设计。
关键发现
- 在基准上实现强轨迹跟随与高视觉质量,支持第一/三人称交互。
- 长时域生成中环境声、音乐、语音保持同步。
- 消融显示数据集级尺度校准对运动幅度一致性至关重要;相对 6-DoF 轨迹优于逐视角控制器。
与基线对比
相较于现有交互式世界模型,EchoWM 将离散命令与连续位姿统一到 metric-scale 相对 6-DoF,避免 view-specific 控制器,提升跨异构数据的泛化。摘要未给出具体数值,但定性与基准结果一致表明其可进入式生成媒体能力优于同类方案。精确指标需参考论文全文。
行业影响
落地场景
EchoWM 的核心能力是生成可进入的 720p 音视频世界,并支持连续 6-DoF 导航。这直接适用于以下产品形态:
- 游戏与虚拟制作:用世界模型实时生成可探索场景,替代传统 3D 建模与烘焙流程,玩家可自由移动并听到同步的环境声、音乐与人声。
- 电商沉浸式展示:用户可自由旋转、走位查看商品(如家具、汽车),模型根据相机意图生成对应视角的视频与音频,无需预渲染多角度素材。
- 自动驾驶仿真:生成逼真的第一人称驾驶场景,支持轨迹控制,可用于感知模型训练、闭环测试与极端场景扩充。
- 教育与培训模拟:生成可交互的医疗、工业操作场景,带同步语音讲解与环境音,提升训练沉浸感。
商业价值
- 降本:传统 3D 场景建模与多机位拍摄成本高、周期长;EchoWM 通过单模型生成动态音视频世界,大幅降低资产制作成本。
- 增收:可交互媒体广告点击率与转化率显著高于静态内容;电商场景中“自由查看”体验可直接提升客单价与购买意愿。
- 体验提升:长时域音视频同步生成解决了现有视频生成模型缺乏连续性、控制性弱的问题,支持用户主动探索,增强产品粘性。
与现有产品/工作流的接口
EchoWM 可作为 生成式世界模型 API 集成到现有技术栈:
- 输入:相机轨迹(6-DoF 相对位姿)+ 可选文本/音频提示;
- 输出:流式视频帧 + 同步音频流;
- 集成方式:通过 REST/gRPC 接口嵌入游戏引擎(如 Unity/Unreal)、自研仿真平台或电商前端;
- 兼容性:模型输出的 metric-scale 轨迹可直接对接现有 3D 坐标系,便于与 NeRF、3D Gaussian Splatting 等表示结合,实现混合渲染。
具体落地 use case
- 电商家具展示:用户进入虚拟房间,自由移动视角观察沙发细节,模型实时生成对应视频与脚步、环境声,无需预渲染上百个角度,显著降低制作成本并提升购买转化。
- 自动驾驶仿真数据工厂:输入特定驾驶轨迹(如变道、过路口),EchoWM 生成高保真第一人称视频与交通环境音,用于感知模型训练与回归测试,减少实车路采依赖。
局限
- - **长时序音频-视频同步** 仍是潜在瓶颈:尽管论文展示了长视角生成中的同步效果,但自回归生成过程中的误差累积可能导致音频与视频逐渐失配,特别是在复杂场景切换或多人对话时。环境声与语音的混合生成缺乏显式解耦,可能产生语义不连贯的音频流。现有评估指标未充分量化长时序下的同步漂移,这一局限需要后续工作引入更严格的时序一致性度量与针对性训练策略。
- - **数据集级校准与第三人称动态的泛化性**:方法依赖互补数据源并通过数据集级校准统一度量尺度,但不同来源的位姿恢复精度存在差异,可能导致轨迹控制在不同域间表现不一致。第三人称场景中相机-角色动态从数据学习,缺乏显式角色控制器,在罕见视角或复杂交互下可能出现相机轨迹与角色行为脱节。论文尚未系统测试跨数据分布的域外泛化能力,实际部署时需谨慎验证。
- - **计算资源与实时交互约束**:联合生成 720p 视频和多模态音频(环境声、音乐、语音)对算力要求高,模型推理延迟可能难以满足实时可进入媒体的交互需求。连续导航需要流式生成,现有框架的自回归后训练虽支持长视角,但未明确讨论流式推理优化。此外,公共基准主要关注导航精度,对音频质量、同步性和沉浸感的评估有限,用户研究的主观性也可能引入偏差,全模态体验的客观评价体系尚待完善。