论文

利用人类偏好奖励改进文本到音乐生成

利用人类偏好奖励改进文本到音乐生成

本文描述了我们在ICME 2026学术文本到音乐(ATTM)Grand Challenge效率赛道中的方案。在挑战协议要求的FAD-CLAP和CLAP score之外,我们引入了一个基于人类偏好学习的奖励模型TuneJury(一种双成对排序器,在公开音乐偏好数据集上训练)。该奖励在训练时作为条件信号,在推理时作为样本选择标准。 整个流程基于120M参数的FluxAudio-S骨干网络,结合了5项工程决策:4项在训练阶段,1项在推理阶段: 1. 训练时奖励条件(同时作为推理时的CFG轴) 2. 对5种分数条件架构进行扫描(训练与推理使用不同变体) 3. 对前10%样本进行专家迭代 4. 短期偏好调优(CRPO)以对齐音频-文本 5. 推理后处理:联合CFG、源分离和响度归一化 在100条Song Describer提示上的逐阶段消融实验表明:训练时奖励条件作为一个有效的条件轴;专家迭代是主要贡献者;偏好调优阶段仅带来噪声级增益;推理时的分数标量在链末端已饱和。

论文精读

TL;DR 在 120M 参数文本到音乐模型中,用人类偏好奖励作训练条件与筛选信号,通过专家迭代获得主要增益,实现效率约束下生成质量的实质提升。

问题

问题背景

文本到音乐生成(Text-to-Music)正从“能否生成”转向“生成质量是否满足人类听觉偏好”。以FADCLAP score为代表的客观指标虽能衡量声学距离与文本-音频对齐,但常与人类评价存在偏离,导致高分音频未必“好听”。

现有方法局限

主流方案依赖自动指标进行模型选择或采样,但这些指标训练信号单一:

  • FAD只关心分布相似性,忽略语义匹配与审美细节;
  • CLAP score仅在对比学习空间中衡量对齐,对节奏、和声等音乐结构不敏感;
  • 直接使用人类反馈成本极高,而现有偏好数据集(ChatMusician、MusicRL等)规模小、标注稀疏,难以直接作为训练信号。 此外,高效生成模型(<500M参数)在有限容量下,如何注入人类偏好而不牺牲推理效率,仍是工程空白。

为什么这个问题难/重要

人类音乐偏好具有高维主观性时序依赖性,难以被单一评分函数捕捉。技术上需同时解决:

  1. 偏好信号如何无损编码为模型可接收的条件(如标量分值嵌入);
  2. 如何在训练、迭代筛选、偏好微调等多阶段联合利用同一奖励模型,避免奖励过优化;
  3. 如何保证推理时通过联合CFG等方式灵活控制偏好尺度,不引入额外延迟。 业界关注该方向,因音乐生成落地场景(如内容创作、个性化音轨)对“符合人类期望”要求极高,而现有自动指标无法替代主观评价,亟需可工程化的偏好对齐路径。

行业类比

该工作可类比基于RLHF的对话系统微调,但音乐领域缺少大规模成对比较数据,且偏好模型需与生成模型深度耦合,相当于在扩散生成范式中构建一个“轻量级奖励条件轴”,兼顾信号强度与推理可控性。

核心洞察

  • 将人类偏好奖励同时嵌入训练条件信号和推理引导轴,为小模型提供了与大模型可比的偏好对齐能力: 传统文本到音乐生成多依赖FAD、CLAP等客观指标,但难以捕捉主观听感。本文用TuneJury将成对偏好数据蒸馏为可条件化的连续奖赏,训练时作为额外输入,推理时通过联合CFG沿着“奖赏轴”引导生成,从而实现不扩大模型参数下的质量-多样性可控调节,与单纯使用偏好数据微调相比,避免了灾难遗忘和模式坍塌风险。
  • 专家迭代(expert iteration)在音乐生成中比直接偏好微调贡献更大,揭示出数据筛选比损失函数设计更关键: 尽管CRPO是一个直接的偏好对齐方法,但在120M参数规模下仅带来噪声级增益。相反,通过重复从当前模型采样、用奖励模型筛选top decile样本再微调,实际上构建了一个隐式的自训练回路,提升了样本整体质量分布而非仅优化文本-音频对齐。这暗示在生成任务中,高质量伪标签的迭代利用可能比复杂的RLHF变体更有效。
  • 训练-推理解耦的Score条件架构搜索: 不同Score条件注入方式在训练和推理阶段存在不对称迁移性: 本文在5种架构变体中,训练时采用v1而推理时切换至v2,证实了v1→v2方向可平稳过渡,反之则崩溃。这种分阶段使用不同条件架构的做法为轻量级生成模型提供了一个新思路,即训练阶段可使用对优化更友好的结构,推理时再切换至更适合CFG引导的前馈形式,避免在模型压缩时引入架构瓶颈。

方法

整体管线:从文本到偏好对齐的高效音乐生成

本方法以 120M 参数FluxAudio-S 作为骨干模型,接收文本提示(如来自 Song Describer 数据集),最终输出经过响度归一化的立体声音频。核心思路是引入一个可学习的人类偏好奖励模型 TuneJury(基于开放音乐偏好数据训练的双路成对排序器),将该奖励分数同时用作训练时的条件信号和推理时的采样准则,形成闭环的自我改进。

训练阶段三步骤

  1. 分数条件 SFT(Score-Conditioned SFT)
    在五种候选架构中(如 FiLM、交叉注意力等)搜索最优分数条件头,将 TuneJury 奖励分数作为附加条件注入生成模型。训练时使用标准的扩散/流匹配损失,让模型学会“高奖励分数对应符合人类偏好的音频”这一映射。该条件信号在推理时通过 联合分类器自由引导(Joint CFG) 变成一个独立控制轴,可调节生成样本对偏好分数的响应强度。

  2. 专家迭代(Expert Iteration)
    从上一阶段模型采样的批量音频中,保留 TuneJury 评分前 10% 的“精英”样本,并用这些样本对模型进行一步微调。循环多次后,模型分布逐步向高奖励区域收缩,显著提升生成质量。实验表明,该步骤是整体收益的最大来源。

  3. CRPO 偏好微调(Preference-Tuning)
    在专家迭代后接入一个短时的偏好优化阶段,采用 CRPO(Contrastive Reward Preference Optimization)直接对齐音频–文本一致性。CRPO 利用成对比较数据训练模型,无需额外奖励模型,仅通过对比损失强化更符合文本描述的音频。但在此规模的实验中,该阶段仅带来噪声级增益,显示奖励条件与专家迭代已基本饱和。

推理时后处理

推理时执行 联合 CFG:同时以文本和奖励分数为条件,通过引导强度权重调节生成结果在语义准确性与偏好得分之间的平衡。之后使用开源音源分离模型提取人声/乐器声部,移除可能残留的噪声成分,最后进行 响度归一化(LUFS 标准化)以保证输出响度一致。

与同类工作的差异:不同于仅依赖客观指标(如 FAD-CLAP)或单次偏好优化的方案,本方法将奖励信号贯穿训练、采样、微调全流程,并验证了在小型模型(120M)下,训练时的奖励条件已足够有效,推理时的分数标量无需额外干预即可保持饱和。这种多阶段工程组合为高效文本到音乐生成提供了低成本、可复现的偏好对齐范式。

实验

实验在 Song Describer 数据集上通过逐步消融评估各模块贡献。设计分阶段消融:依次加入训练时奖励条件化、专家迭代(选取 top 10% 样本)、CRPO 偏好调优、推理时联合 CFG 等,定量分析 FAD-CLAP 与 CLAP 分数变化。

关键发现:专家迭代 是性能提升的主导因素,大幅降低 FAD 并提升 CLAP 对齐;训练时奖励条件化构成有效的可控轴,但在推理时得分标量已饱和;CRPO 偏好调优仅带来噪声级别的增益,表明在该规模下偏好微调作用有限。推理后处理(声源分离、响度归一化)进一步提升感知质量。

与基线相比,整个优化链条显著优于原始 FluxAudio-S,但主要源于专家迭代的数据筛选与再训练,而非对齐调优。这暗示在低参数预算下,高质量数据筛选比直接对齐人类偏好更高效。

行业影响

基于人类偏好奖励的文本生成音乐系统,通过训练时奖励调节和专家迭代,在轻量模型上实现高效高质量音乐合成,为工业界提供了低成本、可落地的音乐生成方案。

落地场景

  • 短视频与内容平台:为 UGC 创作者提供文本驱动的背景音乐生成,无需音乐创作经验,降低音乐使用门槛。
  • 广告与营销:快速生成品牌配乐,缩短从创意到素材的周期,支持 A/B 测试不同音乐风格。
  • 游戏与交互媒体:动态生成环境音效或角色主题音乐,增强沉浸感,减少音频资源包体积。

商业价值

  • 降本:替代版权音乐采购或定制作曲,将单条音乐成本降至几乎为零,尤其适合中小内容商。
  • 增收:通过音乐生成 API 或订阅制服务变现,例如提供免版税音乐库的 SaaS 平台。
  • 体验提升:实时个性化音乐增强用户参与度,如健身 App 根据心率生成节拍,提升留存率。

与现有产品/工作流的接口

  • 模型可导出为 ONNXTorchScript,提供 RESTful 或 gRPC API,支持文本输入与可选偏好分数。
  • 后处理管道集成 源分离响度归一化,可直接输出广播级音频,兼容 FFmpeg 等工具链。
  • 可嵌入 AudioCraftMuzic 等音乐生成框架,作为质量增强模块,替换原有扩散模型。

具体落地用例

  1. 电商广告配乐:商家在素材编辑器中输入 "快节奏、活泼的电子乐",系统即时生成免版税音乐,直接用于视频广告,无需搜索音乐库。
  2. 语言学习 App:根据学习内容情绪和难度生成背景旋律,以节奏辅助记忆,同时提供可选的偏好调节滑块,让用户微调音乐风格。

局限

  • **实验评估范围受限**:消融实验仅基于 Song Describer 数据集的 100 条提示,样本量较小,难以充分反映不同音乐风格与复杂文本条件下的泛化能力。同时,奖励模型 **TuneJury** 在开放的偏好数据集上训练,其偏好排序可能与真实人类听众存在系统性偏差,尤其在音乐审美高度主观的领域,这一偏差会通过专家迭代引入模型,导致生成结果过度贴合训练集的偏好分布。
  • **方法内在局限**:**专家迭代** 依赖从当前模型采样并保留奖励分数前 10% 的样本进行监督微调,容易造成生成多样性的丧失,并可能使模型加速过拟合到奖励模型的偏好函数。后续的 **CRPO** 偏好优化阶段仅带来“噪声级别”的增益,说明在 120M 参数规模下,直接通过偏好损失调整音频 - 文本对齐的效果有限,未能显著提升主观听感。整个训练流水线涉及多次采样与排序,计算开销较大,但在论文中未被量化分析。
  • **与主流文本 - 音乐生成系统的对比不足**:该系统完全在 **ATTM 挑战赛的效率赛道** 框架下设计,约束参数 ≤500M,生成的音频质量与可控性可能远不如更大规模的无约束模型(如 MusicLM 等)。评估仅依赖 **FAD-CLAP** 与 **CLAP score** 等自动化指标,缺少人力主观听力测试,因此很难判断实际场景的用户满意度,限制了该方案的部署参考价值。
论文Yonghyun Kim2026-06-19原文

相关内容