论文

Qwen-Music 技术报告

Qwen-Music 技术报告

本报告介绍了 Qwen-Music,一个强大的音乐生成模型,能够生成高音乐性和高保真的完整歌曲,包括人声演唱。它支持两个核心任务:文本到音乐生成,从文本描述、歌词和音乐属性创建全新歌曲;以及翻唱歌曲生成,以不同风格和声乐特征重新诠释现有歌曲。 在架构上,Qwen-Music 集成了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。Tokenizer 将音频压缩为 25 Hz 的单码本音乐语义标记,保留语义和旋律信息供 LLM 预测。LLM 基于这些标记进行自回归音乐语义建模,关键创新是旋律标记链式思维(Melody-CoT) 机制,在全曲生成前规划旋律,提升创造力、音乐性、结构连贯性和基于参考音频的旋律克隆。Render 执行生成式立体声渲染,丰富声学细节,产生高保真立体声波形。 训练方面,在超过 500 万小时的多语言音乐数据(涵盖数百种语言)上训练。首先应用质量感知预训练课程,然后进行渐进式后训练,包括监督初始化、离线 DPO 和在线 GSPO,以进一步提升音乐性和指令跟随能力。 在 600 个中文和英文提示下,Qwen-Music 在 16 项客观音乐性和音频质量指标中的 13 项 达到最优。专业评估者也更偏好 Qwen-Music。在翻唱生成中,Qwen-Music 比领先专有系统更准确地保留参考旋律。

论文精读

TL;DR Qwen-Music 是一个大规模音乐生成模型,通过 Melody-CoT 旋律链式思考机制提升乐曲结构与创造性,并在 5 百万小时多语言音频上训练,在 16 项客观指标中取得 13 项 SOTA。

问题

问题背景

音乐生成领域的核心关注点已从简单的短片段生成转向完整歌曲创作,包括人声、歌词、旋律与伴奏的协同生成,同时要求高音乐性、高保真度和结构连贯性。

现有方法局限

当前主流方案多采用离散语义 token 压缩音频并由语言模型自回归预测,但存在以下具体局限:

  • 保真度瓶颈:离散 token 丢弃了丰富的声学细节,导致合成音频存在量化噪声、音色苍白,尤以立体声乐器分离和空间感损失严重。
  • 旋律控制不足:大多模型直接端到端生成,缺乏显式旋律规划,使生成的曲目结构松散、旋律记忆性弱,难以实现参考旋律的精准克隆。
  • 人声自然度:歌唱人声的呼吸、颤音、咬字等细节在离散 token 化过程中易模糊,导致“电音感”或机械感。
  • 长时域一致性问题:全曲生成需要处理数分钟跨度的音乐结构(前奏-主歌-副歌-尾奏),现有方法常出现段落间断裂、调性漂移。

为什么这个问题难/重要

  • 技术复杂度高:音乐是多种信息维度(旋律、和声、节奏、歌词、音色)在时间轴上的同步艺术,模型需同时学到声学、语言、旋律三重表示,且三者高度耦合。
  • 评估主观性强:音乐质量无单一全标准,音乐性、情感表达等依赖专业评审,自动指标难以全面衡量。
  • 工业需求迫切:内容创作、游戏音效、虚拟歌手等行业对高质量可控音乐生成需求强烈,但现有系统在可定制性专业品质间仍未平衡。

行业类比

类似文本生成中的 chain-of-thought 显著提升逻辑性,Qwen-Music 提出的 Melody-CoT 在音乐生成中先规划旋律骨架再填充细节,可类比为“先作曲后编曲”,极大增强了输出的结构合理性与创意可控性。

核心洞察

  • Melody-CoT 机制通过显式的旋律规划提升音乐生成的结构连贯性与创意。与多数音乐生成模型直接从句描述或歌词一次性预测完整音频不同,Qwen-Music 在生成前先用旋律标记(melody tokens)进行“思维链”式的规划,使 LLM 能分两步先构思旋律再填充细节。这种方法有效改善了长音乐片段的全局一致性,且支持参考音频的旋律克隆,相比以往仅依赖文本条件或隐式建模的模型,可控性明显增强。
  • 三阶段解耦架构(Tokenizer-LLM-Render)平衡了语义建模效率与音频保真度。许多工作要么使用连续潜表示但建模成本高,要么用离散标记但损失细节;Qwen-Music 则用单码本 25 Hz 的音乐语义标记抽象语义信息,降低 LLM 序列长度,再通过生成式立体声渲染器恢复高频声学特征。这种分而治之的设计让语言模型专注于音乐结构,而让扩散或 GAN 类渲染器处理波形细节,是工业级部署时可复用的解耦思路。
  • 基于质量分级的课程学习与渐进式偏好对齐是训练高音乐性生成模型的关键工程实践。Qwen-Music 在超过 500 万小时多语言数据上,先按质量分级进行预训练 curricula,再经过监督冷启动、离线 DPO 和在线 GSPO 三步后训练对齐,大幅提升了指令遵循能力和主观听感。这套训练流程将数据质量筛选、迭代的人类反馈优化系统化,为大规模音频生成模型的训练提供了可复现、可扩展的管线,而非仅依赖放量数据。

方法

Qwen-Music 的整体流程遵循 音频压缩 → 语义自回归建模 → 高保真渲染 三阶段设计。

输入与预处理

模型支持两种任务输入:

  • 文本到音乐生成:接收文本描述、歌词、音乐属性(如调式、速度)。
  • 翻唱生成:额外引入参考音频,用于旋律克隆与风格迁移。

关键模块

  1. Qwen-Music-Tokenizer

    • 将音频压缩为 25 Hz 单码本 Music Semantic Token 序列,在保留语义与旋律信息的同时大幅降低序列长度,减轻后续 LLM 的自回归压力。
    • 训练采用四阶段策略:双向 BestRQ 预训练 → 因果适配 → 多任务监督微调 → 矢量量化 tokenizer,逐步提升语义保真与重建质量。
  2. Qwen-Music-LLM

    • 基于 Music Semantic Token 进行自回归建模,核心创新为 Melody-CoT (Melody Chain-of-Thought):在生成完整歌曲前,先让模型规划出旋律 token 作为“思维链”,从而增强结构连贯性、音乐性与旋律克隆能力。
    • Melody Tokenizer 将旋律音高、时长等离散化,与语义 token 联合训练,使模型学会“先想旋律再写歌”。
    • 训练采用超过 500 万小时 多语言音乐数据,按质量分级课程:先通用预训练,再退火与高质量精炼;后训练阶段分为监督冷启动、离线 DPO(Direct Preference Optimization)与在线 GSPO(Grouped Selectively Preference Optimization),进一步提升指令遵循与音乐性。
  3. Qwen-Music-Render

    • 为解决离散语义 token 的保真度瓶颈,采用 Diffusion Transformer (DiT) 进行生成式立体声渲染,补充声学细节。
    • 内部包含 Spec-VAE 与 Band-Mode Refiner,先在频谱域重建再细化,最终输出高保真立体声波形。

输出

最终生成具有完整人声演唱的音乐作品,在 16 项客观指标中 13 项达到 SOTA,专业评估也优于主流水准。

与同类工作的差异点:区别于多数仅依赖 token 离散化的方法,Qwen-Music 引入 Melody-CoT 显式分离旋律规划与音频生成,并配合两阶段渲染实现语义可控与高保真输出的平衡。

实验

实验设计

模型在 Text-to-MusicCover Song Generation 两大核心任务上进行评估。评估集包含 600 个中英文提示,涵盖歌词、风格描述及音乐属性。设置了 16 项客观指标以衡量音乐性和音频保真度,同时邀请专业评审进行主观偏好测试。基线系统为当前领先的商业闭源音乐生成方案。

关键发现

  • Qwen-Music 在 16 项客观指标中的 13 项取得最优(SOTA),覆盖旋律创造性、结构连贯性与音质保真度。
  • 得益于 Melody-CoT 机制,模型在生成前显式规划旋律,显著提升了音乐悦耳度和长时结构连贯性。
  • 在翻唱任务上,对参考旋律的保持精准度优于所有基线系统。
  • 专业评审在主观对比中更偏好 Qwen-Music 的生成结果。

基线对比解读

与纯自回归或纯扩散的生成范式不同,Qwen-Music 采用三阶段流水线(Tokenizer-LLM-Render),将高层语义建模与声学细节渲染解耦。这种分离让 LLM 专注音乐语义规划,而后端渲染弥补离散 token 的保真度损失,在音乐性与音质之间取得更优平衡。Melody-CoT 类似思维链推理,为长序列生成提供了可解释的规划步骤,这与直接预测音频 token 的方法形成关键差异。翻唱任务的结果进一步验证,离散语义 token 配合条件扩散渲染,在保持内容一致性与实现风格迁移方面具有显著优势。

行业影响

落地场景

  • 音乐创作辅助:音乐人可快速生成歌曲 Demo 或伴奏,加速创意探索。
  • 内容平台配乐:短视频、直播、播客自动生成多语言背景音乐,规避版权。
  • 翻唱与个性化体验:流媒体或社交应用提供 AI 翻唱,用户重混经典歌曲为不同风格。
  • 广告与影视配乐:按需求生成定制音乐,缩短制作周期。

商业价值

  • 降本:替代人工作曲与版权采购,降低长尾内容创作开支。
  • 增收:通过 API 订阅或按量收费,推出“专属 BGM”等增值服务。
  • 体验提升:实时匹配音乐增强沉浸感,个性化翻唱提高用户粘性。

与现有工作流的接口

  • API 集成:提供 RESTful API/SDK,嵌入视频编辑软件、游戏引擎、DAW。
  • 插件生态:以 VST/AU 插件接入音乐制作软件,用户无缝生成。
  • 组件复用:Tokenizer 与 Render 可单独为音乐 AI 系统提供语义编码与高保真渲染。

具体落地案例

  1. 全球短视频平台:创作者输入主题与歌词,自动生成多语言 BGM,“AI 配乐”成为增值功能。
  2. 跨境电商直播:根据商品和氛围实时生成促销背景音乐,无需版权,提升转化。
  3. 音乐流媒体平台:推出“翻唱工坊”,用户上传歌曲选择风格生成版本并分享,拉动活跃与会员订阅。

局限

  • 报告未详细说明 500 万小时训练数据的版权、清洗和去重流程,这对可重现性及商业合规性构成挑战;在实践中,大规模音乐数据通常涉及复杂的授权问题,缺失这些信息会降低工作的工程参考价值。
  • Qwen-Music 采用级联架构(Tokenizer → LLM → Render),离散语义令牌在压缩过程中可能丢失关键的声学细节,虽然 Render 尝试恢复,但级联误差难以完全消除,在复杂混音或高保真要求场景下可能出现伪影,且三个组件的联合调优空间受限,无法完全端到端优化。
论文Jin Xu2026-07-13原文

相关内容