使用LLMs的多模态音乐推荐系统
音乐推荐系统通常将歌曲视为不透明令牌,依赖协同交互历史,而忽略了语义或声学内容。先前工作探索了LLM增强、多模态和文本增强的序列推荐方法,但部分方法仅部分结合语义、声学或参与信号,未能在统一的基于LLM的序列推理框架中联合建模三者,将推荐建立在实际歌曲内容上。本文提出一个基于会话的多模态音乐推荐框架,为LastFM-1K数据集补充三种互补信号:(1) 使用预训练音乐和文本表示模型提取的音频和歌词嵌入;(2) 使用MGPHot注释模式生成的LLM语义元数据;(3) 收听完成率。我们采用E4SRec框架,通过扩展多模态特征和不同的项目ID编码器骨干(包括SASRec、BERT4Rec、GRU4Rec)进行实验。进一步,我们在零样本和微调设置中扩展了LLM骨干选项,使用LLaMa-2-13B、Qwen2.5-7B-Instruct和LLaMa-3-70B。实验表明,整合基于内容的特征相比仅ID基线在Recall上提升高达95%,在NDCG上提升79%。此外,实验显示简单的多模态融合并不总能带来叠加改进,突显了跨模态整合的挑战。我们发布了一个大规模多模态音乐推荐基准。
论文精读
TL;DR 将音频、歌词嵌入与 LLM 生成的语义元数据注入 E4SRec 序列推荐框架,在 LastFM-1K 上 Recall 提升达 95%,揭示了多模态融合并非简单叠加的挑战。
问题
问题背景
音乐推荐系统长期依赖协同过滤与用户交互日志,将歌曲视为不可解释的 token,忽略了音乐本身的声学特征、歌词语义等高维内容信号。随着流媒体普及与个性化发现需求增强,单纯的行为序列预测已难以满足对音乐理解与冷启动覆盖的要求。
现有方法的局限
- 传统序列推荐(如 SASRec、GRU4Rec)仅基于 item ID 建模,无法捕捉歌曲内在属性的相似性与互补性,导致不能有效处理新歌、冷门曲目。
- 虽然已有工作尝试引入音频嵌入或歌词文本,但多为各自独立使用,未在统一框架内联合建模 声学、语义和用户参与行为。
- 类似 E4SRec 的 LLM 增强推荐框架虽能进行顺序推理,但尚未将 多模态内容特征 与其文本提示及序列编码器深度整合,从而限制了推荐结果的可解释性与准确性。
- 简单拼接或浅层融合多模态向量往往不能带来增益,跨模态对齐的缺失反而可能引入噪声,降低模型性能。
问题的重要性与技术挑战
多模态音乐推荐面临 异构信号对齐 难题:音频嵌入(声学模式)、歌词嵌入(语言模式)及元数据(结构化知识)分属不同分布,如何将其有效注入 LLM 的顺序推理流是关键挑战。此外,音乐推荐的“会话”特性要求模型不仅理解歌曲内容,还要捕捉用户随时间变化的意图,这进一步加剧了融合难度。
业界对此高度关注,因为内容感知推荐直接关系到流媒体平台的用户留存与音乐发现效率。解决这一问题能大幅提升 长尾内容分发 和 冷启动推荐 效果,也为多模态大模型在垂直领域的落地提供了可复用的范式。
行业类比
这一挑战与短视频推荐中将视觉、文本、用户行为进行统一表征类似:正如视频平台通过多模态特征提升内容理解,音乐推荐也需要将 音频、歌词、行为 等信息对齐,才能在理解“这首歌听起来像什么”的基础上,推荐“你接下来想听什么”。
核心洞察
- 本研究首次将音频、歌词预训练嵌入、LLM生成的音乐学元数据(MGPHot 模式)和收听完成率四种互补信号统一注入 LLM 驱动的序列推荐框架 E4SRec,弥补了过往音乐推荐仅依赖协同过滤或单独使用某一种内容信号、忽略歌曲实际声学与语义内涵的缺陷。该框架同时替换多种项目 ID 编码器(SASRec, BERT4Rec, GRU4Rec)和大模型骨干(LLaMa-2, Qwen2.5, LLaMa-3),验证了多模态融合在零样本与微调场景下均能带来最高 95% Recall 和 79% NDCG 的提升,为构建内容感知的音乐推荐设立了一个完整的基准。
- 实验明确揭示朴素的多模态融合(如直接拼接特征)并不总是带来线性增益,某些组合甚至导致性能下降,这打破了“更多模态即更好”的惯性认知。该发现对实际工程部署有强烈警示:跨模态信号可能存在冗余或语义冲突,必须设计针对性的融合策略(如门控机制或注意力加权),而非简单堆叠特征。同时,作者开源了大规模多模态基准数据集,为后续探索鲁棒且高效的融合方法提供了公平的测试平台与参考基线。
方法
输入与多模态信号提取
会话中的歌曲序列作为输入,每首歌覆盖四个信号维度:
- 音频嵌入:使用预训练音乐表征模型 (如 LaMUC 或 MERT) 从原始音频提取固定维度向量。
- 歌词嵌入:通过文本模型 (如 Sentence-BERT) 将歌曲歌词转化为嵌入。
- 语义元数据:利用 LLM 依据 MGPHot 标注模式自动生成结构化的音乐学特征 (流派、乐器、情绪等),并转化为可学习的 token 或嵌入。
- 听歌完成比例 (Completion Ratio):用户实际收听时长与歌曲总时长之比,作为轻量级参与度信号。
多模态项表示与融合
各模态特征首先与歌曲 ID 的嵌入对齐:
- ID 编码器:可选择 SASRec、BERT4Rec 或 GRU4Rec 作为骨干,将历史序列中的 ID 映射为上下文感知的隐藏状态。
- 多模态融合:在 E4SRec 框架内,将音频、歌词、语义嵌入与 ID 隐藏态通过三种策略集成:
- 早期融合:直接拼接所有特征后送入 LLM。
- 注意力融合:使用跨模态注意力加权组合不同信号。
- 门控融合:引入可学习门控机制动态控制各模态贡献。
LLM 顺序推理核心
扩展后的 E4SRec 采用 LLM (如 LLaMa-2-13B, Qwen2.5-7B-Instruct, LLaMa-3-70B) 作为顺序推荐的大脑:
- 输入构造:将融合后的多模态项表示与用户历史序列拼接,转化为 LLM 可理解的提示模板 (prompt),同时注入完成比例作为额外 token 表示聆听倾向。
- 训练/推理:在零样本场景直接利用 LLM 的通用知识进行 next-item 预测;微调时,在推荐日志上使用 next-token 预测目标更新 LLM 参数,或仅训练轻量适配器 (如 LoRA),使模型学会从多模态内容中捕捉用户偏好演变。
输出与推荐生成
LLM 输出下一个可能项目的概率分布,通过 Recall@K 和 NDCG@K 评估排序质量。
与同类方法的差异:本工作首次在统一 LLM 推理框架内 联合 建模音频、歌词、语义元数据与参与度信号,而非像以往方法那样孤立使用其中一两类信号或在后处理阶段硬整合,从而让推荐真正扎根于歌曲内容。
实验
实验设计
- 数据集: LastFM-1K,增强为多模态版本,包含:
- 音频嵌入 (预训练音乐模型提取)
- 歌词嵌入 (文本表示模型提取)
- LLM 生成的语义元数据 (遵循 MGPHot 标注体系)
- 歌曲完成收听比率
- 框架: 基于 E4SRec 扩展,支持多模态特征与多种物品 ID 编码器 (SASRec, BERT4Rec, GRU4Rec)。
- LLM 骨干: LLaMa-2-13B, Qwen2.5-7B-Instruct, LLaMa-3-70B,分别在 zero-shot 和 fine-tuned 设置下评估。
- 评估任务: 会话级音乐推荐,重点考察内容特征对序列预测的增益。
关键发现
- 融入内容特征 (音频、歌词、语义) 相比纯 ID 基线大幅提升:
- Recall 提升高达 95%
- NDCG 提升高达 79%
- 简单多模态融合 (如直接拼接) 并不总是带来叠加收益,甚至可能降低性能,说明跨模态信号存在冗余或冲突,需更精细的融合策略。
- 不同 ID 编码器与 LLM 规模对结果有显著影响;更大的 LLM 在 zero-shot 下具备一定优势,但微调仍是最佳选择。
基线对比深度解读
以往工作要么仅用协同过滤,要么只考虑单一内容模态 (如音频或文本),而本文首次在统一 LLM 序列推理框架内联合建模声学、语义和交互信号。与仅依赖 ID 的基线相比,+95% Recall 说明内容特征有效缓解了物品冷启动与稀疏性问题。然而,简单融合的边际效用下降暗示多模态信息并非越多越好——模型可能被噪声淹没或无法对齐异构表示。后续工作应关注自适应融合或模态门控,以及如何在推荐精度与 LLM 推理成本间取得平衡。该基准为音乐推荐的多模态学习提供了可靠测试平台。
行业影响
落地场景
该框架可赋能音乐流媒体(如 Spotify、Apple Music、YouTube Music)的会话内推荐与冷启动场景,同时适用于短视频配乐推荐(TikTok、Instagram Reels)、播客平台背景音乐选择,以及有声内容制作的 BGM 匹配服务。以 session-based 序列推理为核心,特别适合实时交互流(用户近期行为驱动)和长尾内容发现。
商业价值
- 降本:减少对大规模协同交互的依赖,降低冷启动成本;利用预训练音频/文本模型和 LLM 自动标注语义元数据(MGPHot schema),替代昂贵的人工打标。
- 增收:提升 **Recall@k(最高+95%)**和 NDCG(+79%),直接转化为更高的播放完成率、用户留存与订阅转化;多模态理解能精准捕捉用户情绪/场景需求,增加广告点击和会员时长。
- 体验升级:从“听歌历史相似”升级为“歌曲内容与意图匹配”,解决“音色相似但风格迥异”的混推问题,增强探索感。
集成接口
可作为特征增强模块插入现有推荐 stack:
- 离线特征工程:用预训练音乐模型(如 JukeBox、CLAP)抽取音频/歌词嵌入,LLM 生成结构化 musicological 特征,存入特征仓库。
- 排序层融合:将多模态 embedding 与 ID embedding 通过 cross-attention fusion 或 adapter 注入 E4SRec 式 LLM recomender,作为召回后的精排环节;或直接做端到端 reranker。
- 在线推理:将听歌完成比作为engagement-aware 信号加权历史 item,实时调用轻量 LLM(如 Qwen2.5-7B-Instruct)生成推荐理由与结果,无需全量换栈。
具体 Use Case
- 音乐流媒体 Discover Weekly:原有协同过滤对新用户或小众歌曲乏力,利用音频嵌入 + LLM 语义描述(如 genre, mood, instrumentation)直接匹配内容,显著改善首周留存。
- 短视频配乐推荐:创作者上传片段后,模型根据片段语义(动作、场景)结合歌曲音频/歌词向量,推荐贴合氛围的版权音乐,提升完播率与模板复用,降低内容制作门槛。
局限
- **数据集规模与泛化性受限**:实验仅基于 **LastFM-1K** 数据集(约 1000 用户),虽然经过多模态扩充,但用户和交互量远小于工业级场景。模型在长尾物品、冷启动用户上的表现尚未验证,其结论可能无法直接迁移到百万级曲库与亿级交互的真实推荐系统,且该数据集存在固有选择偏差。
- **多模态融合仍存瓶颈**:作者明确指出“简单多模态融合不总是带来加法提升”,说明 **音频、歌词与语义三种模态** 之间尚未实现高效对齐与互补。当前融合策略(可能为拼接或浅层注意力)可能引入噪声或冗余,缺乏更深入的跨模态交互机制,这在实际工程中会抵消内容信号带来的收益,并增加调参难度。
- **LLM 推理效率与成本极高**:所采用的 **LLaMa-2-13B、Qwen2.5-7B-Instruct 与 LLaMa-3-70B** 在微调后虽可提升推荐精度,但巨量参数导致推理延迟远高于传统轻量级序列模型(如 SASRec)。对于需要毫秒级响应的流式音乐推荐,该方案的实际部署可行性存疑,且未提供与轻量模型的效率对比分析。