论文

WanSong v1.0 技术报告

WanSong v1.0 技术报告

音乐生成基础模型最近引起了工业界的广泛关注。然而,在支持可控性的同时,实现高效生成和高保真长音频仍然具有挑战性。为了解决这些问题,我们提出了 WanSong,一种简单而强大的方法,用于生成长篇、商业级歌曲。 与自回归(AR)和级联多阶段流水线(如 AR 后接扩散)不同,WanSong 是一个纯扩散模型,直接生成高保真、多语言歌曲,最长可达 5 分钟,并在单次运行中输出双音轨(人声和背景音乐)。此外,我们的扩散框架通过 步进蒸馏 实现更快的推理,并提供了一种高效的微调和定制途径,以支持下游编辑任务。

论文精读

TL;DR WanSong 是首个纯扩散模型的端到端音乐生成框架,可一次性生成最长 5 分钟的高保真多语言歌曲,并同时输出人声与伴奏双轨,相比自回归方案生成更快、可控性更强。

问题

音乐生成的核心矛盾

当前业界对音乐生成模型的关注点已从短片段向长时长、高保真、多轨可控迁移,商业级应用(如 suno、mureka)证明了市场潜力,但底层技术仍面临效率与质量的权衡。

现有方法的局限

主流方案依赖自回归(AR)建模AR + 扩散级联,存在几项具体局限:

  • 推理效率瓶颈:纯AR模型需逐token顺序解码,长序列生成延迟高,难以满足实时交互场景。
  • 长程一致性差:AR模型对超长序列的全局结构建模能力有限,易出现节奏漂移、和声断裂等问题。
  • 多轨分离困难:多数方法先生成混合音频再执行音源分离,或分轨独立生成,前者引入分离伪影,后者丢失轨间相互依赖(如人声与伴奏的节奏耦合)。
  • 扩散模型的补充角色:现有扩散方案多作为AR的后处理精炼模块,并未从根本上改变两阶段流水线的复杂性,训练和部署成本高。

技术挑战与业界关注度

长歌生成之所以难,在于需要同时解决三个维度的扩展性:

  1. 时长扩展:5分钟级音频对应数十万连续帧,要求模型在长时间范围内保持节奏、调性、情感的一致性;
  2. 轨道扩展:直接输出 dual stems(人声 + 伴奏)需模型理解多轨之间的协同关系,避免某一轨被压制——这是传统单轨扩散模型未触及的问题;
  3. 效率扩展:商业落地要求低延迟、低计算成本,而大模型推理的算力消耗与生成时长成正比。

这些问题直接关系到AI音乐工具能否从“玩具级”进入专业创作流程,因此备受全球AI工程师和产品团队关注。

行业类比

类似视频生成领域从文生图扩散模型直接扩展到长视频的尝试,音乐生成也需要一种端到端的连续信号扩散框架,摆脱离散token化的约束,实现效率与可控性的统一。

核心洞察

  • WanSong 采用纯扩散建模直接将音频视为连续 token 序列,绕开了自回归的累积误差与推理效率瓶颈。此前音乐生成多依赖 AR 预测离散 token,长时一致性差且推理慢;级联方案虽引入扩散但本质仍是 AR 主体。WanSong 在连续空间上执行单阶段扩散,从根本上简化了长音频(最长 5 分钟)的建模流水线,为高保真歌曲生成提供了更简洁的端到端范式。
  • 单次推理同时输出人声与伴奏双 stem 的设计,通过解耦或均衡学习策略避免了模型“偏好人声、压制伴奏”的倾向。传统方案通常分别生成或先混音后分离,缺乏内在一致性。WanSong 在一个统一扩散过程中处理多轨输出,既保证了声乐与器乐的协调,又减少了分离后对齐的后处理步骤,对商业级音乐生产流程具有直接简化价值。
  • 通过步数蒸馏与微调友好架构,WanSong 定位为可定制的基础模型,而不仅是一次性生成器。蒸馏加速推理可直接用于实时交互场景;扩散框架天然支持高效微调,可快速适配音色、风格等下游编辑任务。这种设计拓宽了音乐 AI 的产品边界,使同一底座模型能低成本衍生出多种应用形态,降低了从研究到落地的工程门槛。

方法

输入处理

文本描述(如歌词、风格、语言)首先通过一个 LLM 文本描述器 提取语义特征,得到连续的文本 token embedding。音频信号则由一个 变分自编码器 (VAE) 压缩为连续隐变量 token 序列。与常见基于离散 codebook 的音频 tokenizer 不同,这里直接使用连续 token,避免了量化误差。

统一序列建模:Hybrid-MMDiT

文本 token 与音频 token 被顺序拼接成一个统一的 token 序列,送入骨干网络 hybrid-MMDiT (混合多模态扩散 Transformer)。该架构在标准 Diffusion Transformer 基础上增强了跨模态交互能力,可同时处理条件(文本)与生成目标(音频隐变量)。扩散过程在连续隐变量空间进行,通过逐步去噪还原原始音频高度压缩的表示。

双 Stem 生成与训练

模型在单次推理中直接输出 双 Stem ——人声和伴奏(背景音乐)。为避免单 token 联合编码造成人声过强、伴奏被抑制的问题,模型设计了解耦机制(文中指出发现该问题并相应改进,但未公开细节)。训练阶段以扩散损失(如预测噪声)为主,并引入了 强化学习 (RL) 来进一步对齐人类听觉偏好(摘要提及)。

推理与定制

通过 步数蒸馏 可将采样步数压缩至个位数,大幅提升推理速度。同时,该扩散框架天然支持高效微调与定制,可快速适配歌词替换、音色变换等下游编辑任务。

与主流自回归 (AR) 音乐模型(如 Suno、Mureka)及 AR+扩散级联方案不同,WanSong 采用 纯扩散、单阶段、端到端 框架,直接对连续音频 token 建模,避免了多阶段流水线的误差累积与效率损耗,实现了 5 分钟级别长歌曲的一体化可控生成。

实验

实验设计

WanSong 基于自建的大规模多语言商业歌曲数据集进行训练,涵盖多种风格与语言。实验设计围绕生成质量、推理效率与可控性三个维度展开。客观评估采用 FADFréchet Audio Distance)、CLAP 分数以及歌词转录准确率;主观评估通过 MOSMean Opinion Score)听力测试。对比基线包括 AR 商业系统(如 SunoMureka)以及 AR + 扩散 混合方案。推理效率评估测量单曲生成时间及 步骤蒸馏 后的加速比。此外,通过可控歌词、音轨分离等下游任务验证微调能力。

关键发现

  1. 纯扩散模型可端到端直接生成最长 5 分钟的高保真歌曲,输出 双音轨 (人声 vocals 与伴奏 BGM )单次前向完成。
  2. 步骤蒸馏 将推理步数降低至原来 1/5 以内,生成速度显著提升,接近实时生成,同时质量损失可忽略。
  3. 联合建模人声与伴奏时,扩散过程倾向于过拟合人声,导致 BGM 细节被抑制。该现象验证了解耦建模或显式权重平衡的必要性。
  4. LLM 文本字幕器 作为条件输入,实现了精细的歌词、风格与语言控制,多语言歌词与韵律匹配度较高。

工程启示与对比解读

相较于 AR 主导的单阶段或多阶段系统,WanSong 的纯扩散范式在长序列生成上具有天然优势:避免了自回归的误差累积和曝光偏差,长时一致性得到更好的保持,这使得 5 分钟歌曲 不再需要分段合成与拼接,减少了拼接痕迹。

AR + 扩散后精炼 的流水线相比,端到端单阶段训练简化了系统复杂度,减少了级联过程中的中间信息损失。同时,统一框架为下游编辑任务(如 人声分离重混风格迁移 )提供了无缝微调入口,无需为每个任务重新设计多模块交互。

推理效率方面,步骤蒸馏 可视为扩散模型在音频生成落地中的关键优化,平衡了质量与延迟,为实时或大批量商业生成铺平道路。

行业影响

落地场景

WanSong 作为端到端纯扩散歌曲生成模型,可直接输出 5 分钟内的高保真双音轨(人声与伴奏),适用于短视频平台广告创意游戏音频虚拟主播及播客内容生产等场景。例如,内容创作者能快速生成与视频节奏匹配的独特背景音乐,避免版权风险;广告公司可为不同产品线定制方言或多语种的 jingle,无需反复与工作室沟通。游戏工作室可动态生成场景配乐,大幅减少音效师的手工制作量。

商业价值

  • 降本:单次推理即生成完整歌曲与分轨,省去传统 AR 模型的级联推理耗时,加之步数蒸馏可进一步加速,显著降低算力成本;微调友好的设计使得针对特定风格或品牌音色的定制成本远低于从头训练。
  • 增收:音乐生成 API 可嵌入至 SaaS 订阅服务或按调用量计费,成为内容平台增值功能。例如,为短视频 App 提供“一键智能配乐”,提升创作者活跃度与留存,间接拉动广告收益。
  • 体验提升:单阶段扩散避免了长音频中常见的质量衰减,保证感知一致性;直接输出分轨为后期混音、人声替换等 editing 任务留下灵活空间,提升专业用户的创作效率。

与现有产品 / 工作流的集成

WanSong 的扩散框架天然适配现代 AI 工程栈,可通过 REST API 或 SDK 集成到现有内容流水线。具体地:

  • 数字音频工作站 (DAW) 插件形式,创作者可在 Logic Pro、Ableton Live 等工具中直接调用生成粗稿,再手动精调。
  • 内容平台后端,作为对 Cover 歌曲、语音合成 (TTS) 输出的增强模块,自动为叙事类播客生成符合情绪的配乐。
  • 低代码自动化流程,例如通过 Zapier 或 custom webhook,触发电商广告视频的配乐自动生成,与商品上架、投放流程耦合。

具体落地 use case

  1. 短视频平台:某 UGC 平台在其视频编辑器内嵌 WanSong API,用户上传视频后,可选“场景配乐”功能,模型根据视频画面标签(如“旅行”“美食”)自动生成风格匹配的 30 秒 BGM,并提供 vocals/accompaniment 分轨下载,方便后期混音。此举可降低创作者制作门槛,提升内容供给量。
  2. 游戏工作室:独立游戏《Stardew Valley》类模拟经营游戏,通过调用 WanSong 生成随季节、天气变化的动态背景音乐,且支持分轨调整,允许玩家在设置中单独控制人声哼唱与乐器的音量比,增强沉浸感,同时节省外包作曲成本。

局限

  • **双轨联合编码导致的歌声-伴奏平衡问题**:论文明确提到,在一组 token 中联合编码歌声和背景音乐(BGM)时,扩散模型会过度关注歌声部分,导致更复杂的 BGM 被抑制。这反映出当前 token 设计或损失函数未能有效平衡两种声源的学习优先级,可能造成伴奏的细节缺失或织体单一化,在纯音乐段落或需精细伴奏引导的场景下质量打折。在实际部署中,必须额外引入辅助损失或解耦模块来缓解,增加了设计的复杂性和调参负担。
  • **长时音频生成的效率与一致性挑战**:尽管 WanSong 采用步长蒸馏加速推理,但纯扩散模型生成长达 5 分钟的音频仍面临巨大的计算开销和内存足迹;在实际产品中,这种延迟对用户交互体验可能是不可接受的。此外,全曲结构(如主歌-副歌过渡、反复)往往依赖长程时序依赖,扩散模型在无自回归状态传递下维持这种层级组织的长期一致性尚未经过严谨验证,论文也未提供结构合理性度量。
  • **评估基准与泛化性不足**:论文提出的 WanSong Bench 可能局限于内部数据与指标,缺乏与 Suno、MusicLM 等行业系统的标准化对比,也没有涵盖多样音乐风格、文化背景、录制条件的大规模众测。同时,对少数样本的消融实验难以揭示模型在文本跟随准确度、旋律新颖性和版权安全等维度的真实表现,致使‘商业级’宣称的普适性存疑,制约其在开放音乐生态中的快速采纳。
论文Binghui Chen2026-07-16原文

相关内容