开源项目

YuE

YuE

开源音乐生成基础模型:输入歌词和风格 prompt 后先产出一份可编辑的旋律与和弦谱,再渲染成 48kHz 立体声完整歌曲,并支持零样本翻唱与 agent 改谱。亮点是白盒式符号规划,作曲意图以 ABC 谱形式可读可改,官方 benchmark 显示 SongBench 均值超过 Suno v5/v6,同批还放出 MERT2 音乐理解与 SheetSage2 转谱模型。注意模型权重为 CC BY-NC 4.0,仅限非商用。

README

想找原始的 YuE?其代码、文档和许可证都保留在 YuE-v1 分支。

YuE

HKUST, M·A·P, Tokenwave.AI, NYU, Stanford, MBZUAI, NOIZ, and ACE Studio

YuE2:以前沿品质统一符号音乐与音频音乐生成

用符号作曲,以声音创作。

🎧 演示 · 🤗 YuE2 · 🚀 快速开始 · 🤖 Agent skill · 📊 基准测试 · 🤗 MERT2 · 🤗 SheetSage2 · 🤗 WSB · 📦 发布版本 · Join us on Discord

YuE2 以前沿的歌曲品质带来可编辑的作曲音乐生成。 只需提供歌词和风格提示,它便会编写旋律与和弦规划,再将这一规划实现为包含人声与伴奏的完整歌曲。

  • 前沿品质。 YuE2 在 WildSongBench 上与 Suno v5/v6 具有竞争力。YuE2(best-of-8)取得 6.9632 SongBench Avg,是所有评估设置中观测到的最高均值。
  • 基于符号化规划的白盒音乐生成。 在渲染之前即可读取、播放并修改作曲。旋律与和弦成为显式控制项,可由人或 agent 检查并编辑。
  • 零样本翻唱与 agent 化编辑。 可以将转录的歌曲重新构想让其呈现全新风格,或通过与歌曲的乐谱、编曲和歌词对话来精修一首歌——全部使用同一个生成 checkpoint。

YuE2 在 WildSongBench 上的歌曲品质与文本对齐

192 条 WildSongBench 提示词。两种 YuE2 设置都使用符号化规划。Bo8 = best-of-8。坐标轴为归一化对比指数;气泡面积代表 AudioBox 制作品质。得分与评估协议。矢量 PDF · SVG。

听听你能创作什么

创作 翻唱 使用 agent 编辑
歌词 + 风格 → 乐谱 → 完整歌曲 源录音 → 旋律乐谱 → 全新演绎 音乐反馈 → 乐谱、风格或歌词修订 → 新录音
试听并查看乐谱 聆听零样本翻唱 跟随一段编辑对话

该 agent 化演示跟随 The Last Train 历经 9 个步骤和 14 个版本,从国语流行到英文爵士,配有全新的和声以及一段萨克斯独奏。试听每个版本,并查看其对话、乐谱、提示和歌词。

工作原理

YuE2 架构:风格与歌词变为可编辑乐谱、语义音乐 token、声学 latent 和音频

一个 AR–NAR Mixture-of-Transformers(自回归–非自回归 Transformer 混合) 主干网络自回归地预测乐谱和语义 token,然后通过 flow matching 生成声学 latent。一个 VAE 将这些 latent 解码为立体声音频。创作、翻唱和编辑的区别在于乐谱的来源:来自 YuE2、来自转录的录音,或来自编辑后的作曲。

分阶段的 Python API 依次暴露 plan() → generate_semantic() → synthesize() → decode()。关于精确规划复用与解码器选择,请参见生成指南。

快速开始

Linux · Python 3.12 · 支持 BF16 且显存 24 GB 的 NVIDIA GPU。 YuE2 输出 48 kHz 立体声音频,无需量化。模型文件在首次使用时从 Hugging Face 下载。

git clone https://github.com/multimodal-art-projection/YuE.git
cd YuE
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install .
python examples/generate.py --output outputs/first-song

打开 outputs/first-song/audio.flac。输出目录还会保留乐谱、语义 token、声学 latent、生成设置和模型标识信息。

Python 接口同样简洁:

import json
from pathlib import Path
from yue2 import YuE2Pipeline

request = json.loads(Path("examples/song.json").read_text(encoding="utf-8"))
with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:
    song = pipe(**request)
    song.save_artifacts("outputs/my-song")
    print(song.truncated)
设置 行为
cot="full" 生成可编辑的旋律与和弦规划;新歌的默认设置
cot="melody" 使用旋律规划并自由配伴奏;推荐用于翻唱
cot="off" 直接从歌词和风格生成
abc=... 以 full 或 melody 模式提供你自己的乐谱

生成指南 · 原始示例输入 · v0.1.6 wheel 归档

翻唱一首歌

使用 🤗 SheetSage2 转录源录音,检查其旋律 ABC,并提供新歌词或目标风格。对于翻唱,请使用 cot="melody" 以及不带和弦符号的乐谱,这样伴奏能够适应新风格。

from pathlib import Path
from yue2 import YuE2Pipeline

with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:
    cover = pipe(
        style="English, jazz-funk, warm lead vocal, Rhodes, bass and drums",
        lyrics=Path("cover-lyrics.txt").read_text(encoding="utf-8"),
        abc=Path("cover-score/score.abc").read_text(encoding="utf-8"),
        cot="melody",
        seed=42,
    )
    cover.save_artifacts("outputs/cover")

SheetSage2 在独立环境中运行,并自动加载其 MERT2 encoder。翻唱指南给出了完整的转录与生成命令。随附的原始旋律示例还能让你立即尝试乐谱条件生成。

编辑一段作曲

导出一个规划,修改音乐细节,然后渲染编辑后的乐谱:

import json
from pathlib import Path
from yue2 import YuE2Pipeline

request = json.loads(Path("examples/song.json").read_text(encoding="utf-8"))
with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:
    plan = pipe.plan(**request)
    plan.save("outputs/plan")

将 outputs/plan/score.abc 复制为 edited.abc,然后让 agent 修改其和声、旋律、速度或曲式。将编辑后的文件作为新的乐谱提供:

python examples/generate.py --request examples/song.json \
  --abc-file edited.abc --cot full --output outputs/edited

可编辑乐谱就是白盒接口:你可以检查预期的作曲并对其进行干预。编辑会生成一段全新的完整录音;除编辑本身外,它不会保留原始波形。编辑指南与一个可复现的和声示例。

Agent skill

yue2-music skill 教会 agent 如何生成歌曲、转录并翻唱录音、编辑 ABC 乐谱、检查音乐不变量,以及组织听感对比。它包含可移植的辅助工具和对已发布模型接口的引用。

请在支持 SKILL.md 包的 agent 中使用本仓库的 skills/yue2-music/。使用你的 agent 的 skill 目录或导入机制进行安装;Python 运行时通过 pip install . 单独安装。此前的 v0.1.6 skill ZIP 仍以其捆绑许可证提供。

试试一个具体请求:

使用 yue2-music skill 创作一首英文钢琴流行歌曲。保留原始音频和乐谱。制作第二个版本,采用爵士和声,保留人声旋律和歌词顺序,并将两个版本都给我进行对比。

基准测试

WildSongBench:192 条提示词,自动评估,2026 年 9 月 12 日。

系统 / 设置 SongBench Avg ↑ AudioBox PQ ↑ MuLan ↑ PER ↓
YuE2 (best-of-8) † 6.9632 8.2714 0.5051 9.79%
Mureka 9 6.9377 8.0226 0.4394 11.69%
Suno v5 6.8721 8.1698 0.5428 8.10%
YuE2 † 6.7316 8.2598 0.5068 8.44%
Suno v5.5 6.7150 8.1955 0.5089 5.96%
Suno v4.5 6.6995 8.2541 0.5022 5.80%
Suno v6 6.5562 8.1296 0.4916 7.58%
Suno v6 Wild 6.4195 8.1785 0.4999 7.45%
LeVo 2 † 6.3247 8.3966 0.3542 26.12%
MiniMax Music 2.6 6.3222 8.1711 0.4251 24.55%
MiniMax Music 3 † 6.2830 8.2825 0.3928 6.27%
HeartMuLa † 6.2483 8.2933 0.3823 10.71%
Muse † 6.0349 8.0517 0.3937 33.42%
ACE-Step 1.5 † 6.0118 8.0518 0.4372 7.46%
DiffRhythm 2 † 5.2428 7.9782 0.3782 18.41%
YuE 1 † 4.9165 7.8683 0.2623 36.38%
SongBloom † 4.2350 8.1539 0.2697 19.19%

† 公开可用的模型权重。全部 17 个评估设置均已展示,按 SongBench Avg 排序;粗体值标记每一列中的最佳结果。

两种 YuE2 设置都使用符号化规划和基准解码器 YuE2-Vae-legacy。标准 YuE2 从两个候选中挑选;best-of-8 从八个候选中挑选。排名因指标而异;最高均值之间的微小差距不足以确立统计显著性。完整结果与选择协议。

零样本翻唱。 在 948 首作品上,使用完整乐谱的 YuE2 达到 0.647 CLEWS mAP,而不使用乐谱时为 0.006,同时使用的是通用生成器而非针对翻唱微调的模型。源身份保留与目标风格质量分别衡量;仅旋律翻唱在改变编曲方面拥有更大自由度。翻唱评估。

复现基准测试

要复现报告中给出的基准测试得分,请按照 🤗 WildSongBench (WSB) 上的说明进行操作。

MERT2

最先进的音乐理解: 在 15 项 MARBLE 指标中的 14 项上取得 SOTA,在 GTZAN 上取得 91.72% 的流派准确率。

演示与结果 · 🤗 MERT2-30s · 🤗 MERT2-FS

SheetSage2

最先进的音频转乐谱: 在 13 项基准指标中的 10 项上取得 SOTA,在 RWC-Pop 上取得 82.51% 的人声旋律音级 F1。

演示与结果 · 🤗 模型与推理

模型与资源

资源 用途
🤗 YuE2-3B 歌曲生成、符号化规划、翻唱与编辑
🤗 YuE2-Vae 默认生成与试听解码器
🤗 YuE2-Vae-legacy 用于报告基准协议的解码器
🤗 SheetSage2 用于翻唱和编辑的音频转乐谱
🤗 MERT-v2-FullSong 整曲音乐表征;SheetSage2 的 encoder
🤗 MERT-v2-30s 用于短录音的音乐表征
🤗 WildSongBench 评估提示词与基准资源

MERT2 特征提取对生成而言是可选的。YuE2 的 pipeline 不需要单独下载 MERT2 模型。演示与交互式结果 · 发布版本下载。

许可证

YuE2 的第一方代码、agent skill 和文档采用 Apache 2.0 许可。Copyright (c) 2026 the YuE2 authors。

模型权重另行采用 CC BY-NC 4.0 许可。第三方组件保留其原始许可证。归档的 YuE-v1 分支保留其原始许可证。

Apache 2.0 适用于当前仓库源码;此前的 yue2-v0.1.6 下载归档保留其捆绑许可证。

引用

YuE2 技术报告即将发布。在此之前,请引用 MERT 和 YuE:

@article{li2023mert,
  title = {{MERT}: Acoustic Music Understanding Model with Large-Scale Self-supervised Training},
  author = {Li, Yizhi and Yuan, Ruibin and Zhang, Ge and Ma, Yinghao and Chen, Xingran and Yin, Hanzhi and Xiao, Chenghao and Lin, Chenghua and Ragni, Anton and Benetos, Emmanouil and Gyenge, Norbert and Dannenberg, Roger and Liu, Ruibo and Chen, Wenhu and Xia, Gus and Shi, Yemin and Huang, Wenhao and Wang, Zili and Guo, Yike and Fu, Jie},
  journal = {arXiv preprint arXiv:2306.00107},
  year = {2023},
  eprint = {2306.00107},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2306.00107}
}

@article{yuan2025yue,
  title = {{YuE}: Scaling Open Foundation Models for Long-Form Music Generation},
  author = {Yuan, Ruibin and Lin, Hanfeng and Guo, Shuyue and Zhang, Ge and Pan, Jiahao and Zang, Yongyi and Liu, Haohe and Liang, Yiming and Ma, Wenye and Du, Xingjian and Du, Xinrun and Ye, Zhen and Zheng, Tianyu and Jiang, Zhengxuan and Ma, Yinghao and Liu, Minghao and Tian, Zeyue and Zhou, Ziya and Xue, Liumeng and Qu, Xingwei and Li, Yizhi and Wu, Shangda and Shen, Tianhao and Ma, Ziyang and Zhan, Jun and Wang, Chunhui and Wang, Yatian and Chi, Xiaowei and Zhang, Xinyue and Yang, Zhenzhu and Wang, Xiangzhou and Liu, Shansong and Mei, Lingrui and Li, Peng and Wang, Junjie and Yu, Jianwei and Pang, Guojian and Li, Xu and Wang, Zihao and Zhou, Xiaohuan and Yu, Lijun and Benetos, Emmanouil and Chen, Yong and Lin, Chenghua and Chen, Xie and Xia, Gus and Zhang, Zhaoxiang and Zhang, Chao and Chen, Wenhu and Zhou, Xinyu and Qiu, Xipeng and Dannenberg, Roger and Liu, Jiaheng and Yang, Jian and Huang, Wenhao and Xue, Wei and Tan, Xu and Guo, Yike},
  journal = {arXiv preprint arXiv:2503.08638},
  year = {2025},
  eprint = {2503.08638},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2503.08638}
}

联系方式

有关合作、许可和数据合作事宜,请联系 gezhang@umich.edu。

开源项目multimodal-art-projection2026-09-12原文

相关内容