DreamX-Creator: 在 2K 分辨率下普及原生音频-视频生成
近年来的视频生成模型常常忽略音频,或在独立阶段合成音频,限制了视觉动态与声学事件的联合建模。我们提出 DreamX-Creator 1.0,一个以 7B 生成器为核心的紧凑型原生联合音频-视频生成系统。在给定首帧和文本提示的条件下,生成器联合去噪模态特化的音频流与视频流。这两路流在网络前半部分独立处理,在后半部分通过 门控跨模态注意力(Gated Cross-Modal Attention)耦合,其中 token 级与 head 级的输出门控调节每个活跃跨模态注意力头的输出。 我们构建了统一的 音频-视频数据系统(Audio-Video Data System),用于筛选时序连贯片段、生成结构化多模态标注,并按能力导向组织数据池。渐进式联合训练(Progressive Joint Training)包含两个音频-视频预训练阶段,随后进行高质量微调。音频-视频强化学习(Audio-Video Reinforcement Learning)进一步利用模态感知多模态反馈对生成器进行后训练,将视频、音频与跨模态反馈路由到相应流。 为生成高分辨率输出,我们设计了自回归 1 步 2K 精炼流程:将双向多步教师模型改写为自回归多步精炼器,并蒸馏为每时间块仅需一次去噪评估的学生模型。总体而言,DreamX-Creator 1.0 实现了原生且同步的音频-视频生成,性能可与最先进的开源系统媲美。通过发布紧凑型 7B 生成器与 2K 精炼器,我们旨在普及原生音频-视频生成,并为未来统一音视频生成建模研究提供可访问的基础。
论文精读
TL;DR DreamX-Creator 1.0 是一个 7B 原生联合音视频生成系统,通过 Gated Cross-Modal Attention 耦合视听流,结合渐进训练与 RL,直接生成 2K 分辨率同步音视频,性能对标开源 SOTA。
问题
问题背景
当前视频生成模型在视觉质量、时长、分辨率上快速进步,但多数只输出无声画面。音频要么缺失,要么由独立 TTS/音效模型后合成,缺乏与画面事件的同步。
现有方法局限
- 级联式方案:先视频后音频,或分别生成后对齐,不能利用视觉动态反向约束声学事件,导致口型不同步、物体碰撞声错位。
- 跨模态融合粗糙:简单拼接或单尺度交叉注意力难以处理音频与视频的时序粒度差异(视频 25fps vs 音频 16kHz)。
- 训练数据缺乏:大规模音视频对数据较少,且需要时间对齐、语义匹配的清洗与标注。
- 高分辨率输出依赖额外超分模型,引入伪影与延迟。
为什么这个问题难/重要
原生联合生成要求网络同时建模两种模态的时序结构,且需共享语义上下文。音频流的高采样率与视频流的空间复杂度在计算上不平衡,7B 参数内既要保持单模态质量又要学习跨模态门控,需要精心设计训练课程与 RL 反馈。业界关注度高:从 AI 短片、虚拟主播到游戏过场,都要求“听得到、对得上”的原生音视频内容,而当前开源方案多为两阶段,体验割裂。
行业类比
类似自动驾驶中的多传感器融合:激光雷达与摄像头数据必须联合标定与推理,单独处理再拼接会产生空间错位与决策延迟;音视频生成也需要原生融合避免“后期配音感”。
核心洞察
- Gated Cross-Modal Attention 通过 token- and head-wise output gates 精确控制跨模态注意力头输出,使音频与视频流在前半网络独立处理、后半网络选择性耦合,避免模态间过度干扰。这不同于以往简单拼接或全连接跨模态交互,门控机制让模型自主决定何时、何地激活跨模态依赖,更利于同步生成中的时序对齐,且计算开销可控。
- Audio-Video Reinforcement Learning 引入 Modality-Aware Multimodal Feedback,将视频、音频及跨模态反馈分别路由到对应流,解决多模态奖励信号冲突问题。传统 RL 常将所有模态反馈合并为单一标量,导致梯度方向混淆;该方法使各模态流能针对自身质量优化,同时保留全局一致性,从而提升生成样本的感知质量与同步精度。
方法
输入与架构
系统以 首帧图像 和 文本提示 为条件,驱动 7B 参数的原生联合音视频生成器。生成器采用双流设计:音频流与视频流在前半网络独立处理,后半通过 Gated Cross-Modal Attention 耦合。该注意力机制引入 token 级与 head 级输出门控,可选择性调节每个跨模态注意力头的贡献。
数据与训练
Audio-Video Data System 统一构建时间对齐的剪辑,过滤低质与不对齐样本,生成结构化多模态标注,并按能力维度组织数据池。Progressive Joint Training 分三阶段:两轮 AV 预训练(先 LoRA 后全参数)加 High-Quality Finetuning。随后 Audio-Video Reinforcement Learning 使用 Modality-Aware Multimodal Feedback,将视频、音频及跨模态奖励分别路由至对应流,实现偏好对齐。
高分辨率输出
Autoregressive 1-Step 2K Refinement 将双向多步教师转化为自回归多步细化器,再通过 DMD Distillation 蒸馏为每时间块仅需一次去噪评估的学生模型,从而实现 2K 分辨率的高效细化。
差异点
与常见“先视频后音频”分离式生成不同,该方法从训练初期即联合建模视听关联,并通过门控注意力和多模态反馈强化同步性。
实验
实验设计
论文通过 6 Evaluation 章节进行系统评估,包括 定量评估、Refiner 对比 和 用户研究。数据来自统一的 Audio-Video Data System,通过多维质量评估和音视频对齐过滤构建训练池;训练流程分为两阶段预训练 + 高质量微调,再经 音频-视频强化学习 后训练,最后用 Autoregressive 1-Step 2K Refinement 提升分辨率。
关键发现
- 原生联合生成:7B 生成器同时去噪视频流和音频流,通过 Gated Cross-Modal Attention 在后期耦合跨模态信息,实现同步且一致的音视频输出,避免分离式音频生成导致的模态割裂。
- 数据与训练策略:能力导向数据池 和 渐进联合训练 有效降低多模态学习难度;Modality-Aware Multimodal Feedback 将视频、音频及跨模态反馈路由至对应流,提升偏好对齐效率。
- 高效高分辨率:Autoregressive 1-Step 2K Refinement 将多步双向教师蒸馏为每时间块仅需一次去噪评估的学生,大幅降低 2K 推理成本。
与基线对比解读
与主流开源音视频生成系统相比,DreamX-Creator 1.0 以紧凑 7B 参数实现原生联合生成,而非级联音频合成;在同步性、跨模态一致性和高分辨率输出上表现 竞争力。但摘要未给出具体指标数值,需参阅论文 6.2 定量评估和 6.4 用户研究获取精确对比。工程上,门控注意力中的 token/head-wise gates 为跨模态建模提供了可解释的稀疏控制,对后续多模态生成器设计有参考价值。
行业影响
落地场景
- 短视频与广告素材:输入首帧与文本提示,直接生成带同步音频的高分辨率视频,适用于电商商品展示(如咖啡机蒸汽声与倾倒镜头同步)及社交媒体内容。
- 虚拟主播与数字人:联合建模视觉口型与语音,降低音画不同步问题,可生成带环境声的虚拟场景,用于虚拟客服或品牌代言。
- 在线教育与培训:生成带旁白与动画的教学片段,减少后期配音与剪辑成本,适配 MOOCs 与企业内训。
商业价值
- 降本:7B 单模型替代“视频生成 + 单独音频合成/配音”多流水线,减少算力与人力投入;2K 精炼器仅需一步去噪评估,推理成本显著下降。
- 提效与体验:原生同步音视频缩短素材生产周期;逼真音效提升广告点击率与用户停留时长,适合 A/B 测试快速迭代。
与现有工作流集成
- 开源 GitHub 便于企业私有化部署;以
first_frame与text_prompt为输入,可封装为 ComfyUI 自定义节点或 Diffusers pipeline,接入现有内容生产工具链。 - 训练侧支持 LoRA 预训练与 RLHF 后训练,企业可在自有数据上做品牌风格与音效偏好微调;2K Refiner 作为后处理模块,可插入现有视频生成链路,无需替换原模型。
局限
- - **模型规模与生成质量**:DreamX-Creator 1.0 的生成器仅 7B 参数,虽然通过联合建模实现原生音频视频生成,但与更大规模的视频生成模型(数十 B 到百 B 级)相比,在复杂场景细节、运动连贯性、纹理保真度上可能存在上限。同时,音频流与视频流共享同一骨干,可能压缩了音频表示容量,导致生成音频的丰富度与专用音频生成模型(如 AudioLDM 系列)相比仍有差距。论文未提供与闭源大模型的对比,其“competitive with state-of-the-art open-source systems”的表述仅限开源范围。 - **训练与推理成本**:完整 pipeline 包含两阶段 AV 预训练、高质量微调、AV-RL 后训练以及 2K 精炼器蒸馏,训练环节多、数据要求高。论文未详细披露训练数据规模、计算资源消耗和训练时长,影响可复现性与成本评估。推理时需同时处理音频和视频两条流,内存与算力开销高于分离式生成方案,可能限制在低资源环境的部署。此外,2K 精炼器基于自回归 1-step 蒸馏,长视频推理时仍需逐块进行,时序一致性可能随长度下降。 - **条件控制与多样性**:系统仅以第一帧和文本提示作为输入条件,缺乏对音频事件时间戳、局部编辑、多模态参考等细粒度控制能力。联合训练会耦合音频与视频的分布,可能降低单一模态的多样性与可控性。AV-RL 阶段使用的 Modality-Aware Multimodal Feedback 依赖内部反馈模型,其架构、训练数据和奖励设计细节在论文中公开有限,外部研究者难以准确评估该环节的有效性与潜在偏差,进而影响整体方法的可扩展性与泛化性。