Light-MER:不足1B参数的多模态情感模型超越8B教师模型
这篇论文展示了一种模型压缩方法,让小于10亿参数的情感模型在性能上超过80亿教师模型,同时更高效、更易部署。
多模态情感识别通常依赖7B以上大模型,难以部署在机器人等边缘设备。格拉斯哥大学等机构提出Light-MER,用知识蒸馏(让小模型模仿大模型内部表示)和强化学习,将8B模型压缩至854M参数,在九个数据集上平均得分74.61,反超教师的73.93,同时推理成本降低约11倍。
正文摘录
 新智元报道  多模态大语言模型正在改变情感识别的研究范式。 与传统方法只输出「高兴」「悲伤」或「愤怒」等预定义标签不同,新一代生成式多模态情感识别模型能够联合理解视频、音频和文本,并用自然语言解释人物的情感状态及其判断依据。 但这种能力通常建立在更大的模型规模之上。现有代表性方法大多依赖至少 7B 参数的语言模型,不仅需要较高的显存和计算资源,也带来了更长的推理延迟,难以部署到机器人、移动设备和其他边缘平台。 这引出了一个根本问题: 为了实现高质量的多模态情感理解与识别,我们真的需要参数规模超过 1B 的模型吗? 来自格拉斯哥大学、山东大学和中国科学院计算技术研究所的研究者在论文 Light-MER 中对这一假设提出了挑战,他们将 8B 教师模型的多模态情感理解能力迁移至参数规模低于 1B 的学生模型,并通过隐藏状态蒸馏与多奖励强化学习,在显著降低计算开销的同时,实现了超过教师模型的平均性能。 论文已被 ACM Multimedia 2026(ACM MM 2026)主会接收 。  论文链接:https://arxiv.org/pdf/2607.12787 代码链接:https://github.com/GAIR-Lab/Light-MER 该论文主要包含以下三个亮点: - 构建参数规模低于 1B 的生成式多模态情感模型。