论文

UniMoMo: 基于专家合并的MoE加速用于大型推荐模型

UniMoMo: 基于专家合并的MoE加速用于大型推荐模型

稀疏混合专家 (MoE) 层通过条件计算扩展了推荐模型容量,但训练后的检查点仍存储并路由整个专家库。我们研究一个部署问题:在给定专家预算下,将该检查点转换为较小的标准 MoE,且不增加额外的在线压缩模块。 为此,我们提出 UniMoMo,一种基于约束图粗化的训练后压缩框架。UniMoMo 根据功能相似性对专家分组,使用无标签校准集衡量专家对共享推荐状态的响应相似度。为防性能下降,引入层自适应保护机制,根据路由暴露度限制高流量专家的合并。 在 Amazon Beauty、KuaiRec 和 TenRec 上(含 2、4、6 个 MoE 块),最终四专家检查点在五次运行中相对原始模型的 NDCG@10 平均比率为 99.92%–102.30%,实测 A100 加速 1.28–1.63 倍。更激进的二专家 top-1 运行点取得 98.36%–104.24% 比率和 1.47–2.21 倍加速。这些结果验证了完整的转换-适应流程,表明训练好的推荐 MoE 可在多种服务预算下导出。

论文精读

TL;DR UniMoMo 将推荐 MoE 按功能相似性合并专家,压缩为标准 MoE,几乎不损 NDCG@10 下实现 1.28–2.21 倍 A100 加速。

问题

背景

大规模推荐系统普遍采用 稀疏混合专家(MoE) 提升模型容量,但训练后的 checkpoint 依然保留完整专家集合,在推理时需对所有专家执行路由与计算,导致显存占用和延迟较高。业界关注将训练好的推荐 MoE 转换为更小的标准 MoE 部署形态,同时不牺牲推荐质量。

现有方法局限

常规 MoE 压缩依赖参数距离度量(如权重 L2 距离或激活相似度)进行专家合并,但推荐场景中专家功能高度异质,参数相近未必行为相近;而基于微调或蒸馏的方法需要额外训练数据与在线蒸馏模块,破坏标准推理拓扑,影响线上服务部署。此外,简单合并高流量专家容易破坏路由分布,导致热门用户/物品的表示质量下降。

为什么这个问题难/重要

难点在于:需在不引入额外在线模块的前提下,仅凭少量未标注校准数据完成压缩;同时要兼顾专家功能相似性、路由曝光频率和不同 MoE 层的敏感度差异,否则压缩后的性能损失会直接反映在 NDCG@10 等业务指标上。推荐模型通常包含多个 MoE 块,每层对压缩的容忍度不同,需要层自适应策略。该问题在推荐系统线上服务中普遍存在,直接影响 GPU 利用率和 TCO。

行业类比

类似 LLM 推理中的专家剪枝/合并,例如将 Mixtral 的 8 个专家合并为 4 个以加速推理,但推荐 MoE 的输入状态是用户-物品交互,功能相似性更难定义,且路由曝光不均更严重。

核心洞察

  • 该工作将专家压缩定义为基于功能相似性的约束图粗化问题,而非传统的参数距离聚类。用未标注校准集测量专家对相同推荐状态的响应相似度,从而捕获专家在条件计算下的实际行为冗余,避免合并参数接近但功能迥异的专家。这个角度独特在于:它把压缩目标从“权重空间接近”转向“行为空间接近”,更符合 MoE 稀疏激活的本质,为后续 MoE 压缩提供了新的评估维度。工程启示是:在部署前,应通过少量校准数据对专家做功能画像,而非仅依赖权重范数或余弦距离判断冗余。
  • 层自适应保护机制根据路由暴露度限制高流量专家参与合并,将热门专家的容量保留下来,而不是对所有专家一视同仁地压缩。与先前工作通常采用统一压缩率或仅基于参数重要性的做法不同,该机制显式引入路由统计作为约束,优先合并低暴露专家,从而在减小模型规模的同时维持对高频请求的响应精度。这为 MoE 推理加速提供了可操作的原则:压缩决策需要与在线路由分布绑定,否则容易在热门路径上造成性能塌陷。实测中该机制帮助四专家压缩模型在 NDCG@10 上保持 99.92% 以上的源模型性能。

方法

输入

  • 已训练的稀疏 MoE 推荐模型 checkpoint,包含多层 MoE 块,每层有多个专家(expert),以及一个无标签校准集。
  • 目标专家预算(如 4 个或 2 个专家)。

关键模块

  1. 功能相似度建模:对每个专家在共享推荐状态上的响应进行功能画像,不依赖参数距离,而是通过校准集前向传播,获取各专家对相同输入的输出表示,据此度量专家间的功能相似性。
  2. 约束图粗化:将专家压缩问题形式化为图粗化问题,节点为专家,边权为功能相似度,在专家预算约束下进行分组合并。同时引入 路由暴露(routing exposure)约束,限制高流量专家的合并,防止性能衰减。
  3. 层自适应保护机制:根据每层路由分布自适应地保护高流量专家,不同层的保护力度不同,保留对最终预测贡献大的专家。
  4. 使用加权重构:合并后对新专家参数进行重构,以原始专家的路由频率/使用权重作为加权因子,最小化对常用专家输出的扰动。

输出

  • 一个更小的标准 MoE checkpoint,无压缩专用在线模块,可直接部署,并可在多个服务预算(如 4 专家、2 专家)下导出,实现推理加速。

与同类专家压缩方法不同:UniMoMo 不依赖参数距离或离线聚类,而是通过功能相似度 + 路由暴露保护,在不引入额外在线模块的前提下,产出可部署的标准 MoE 模型。

实验

实验设计

在 Amazon Beauty、KuaiRec、TenRec 三个真实推荐数据集上,对包含 2/4/6 个 MoE 块 的模型应用 UniMoMo。设置两个目标专家预算:4 专家 与 2 专家,使用未标注校准集构建功能相似度图,通过层自适应路由暴露保护约束图粗化过程。评估指标为源模型相对 NDCG@10 比例与 A100 推理加速比。

关键发现

四专家配置在所有数据集上保持 99.92%–102.30% 的源模型 NDCG@10 比例,同时获得 1.28x–1.63x 的 A100 加速;两专家激进配置比例 98.36%–104.24%,加速 1.47x–2.21x。结果表明基于功能相似度的专家合并有效保留了推荐性能,高流量专家的保护机制避免了路由失真。

对比解读

相较于仅依赖参数距离的合并方法,UniMoMo 利用专家对共享推荐状态的响应相似度,更贴合条件计算语义,因此在低预算下仍能维持排序质量。与需要额外在线压缩模块的方案不同,UniMoMo 导出标准 MoE checkpoint,无需定制推理内核,部署成本更低。工程上,多个预算点可灵活对应不同延迟服务级别,且压缩为一次性离线成本。

行业影响

落地场景

推荐系统是电商、内容平台、广告等核心业务中算力开销最大的模块之一,大规模稀疏 MoE 常被用于提升模型容量。UniMoMo 可应用于模型训练完成后的部署阶段,无需引入额外在线压缩模块,直接将训练好的大 MoE checkpoint 转换为小专家数量的标准 MoE。适合对推理延迟、吞吐和成本敏感的场景,如实时个性化推荐、端侧推理、多预算服务分级部署。

商业价值

UniMoMo 在 Amazon Beauty、KuaiRec、TenRec 三个数据集上,4 专家配置下保持 99.92%–102.30% 的源模型 NDCG@10,同时获得 A100 上 1.28x–1.63x 加速;2 专家配置下加速可达 1.47x–2.21x,指标仍为 98.36%–104.24%。按推理成本计算,可直接降低 GPU 资源消耗,提升单卡服务请求量。与常见基于参数距离或额外蒸馏模块的 MoE 压缩方法不同,UniMoMo 利用功能相似性分组和路由曝光保护,只需无标签校准集,更适合在线业务快速迭代,同时支持从同一 checkpoint 导出多个不同专家预算的模型,灵活匹配不同服务等级协议(SLA)。

与现有产品/工作流的接口

UniMoMo 可作为 MLOps 流水线中的后处理步骤,在模型训练完成后、正式上线前执行一次。输入为训练好的 MoE checkpoint 和一个无标签校准集,输出为指定专家数量的压缩 checkpoint。由于压缩后的模型仍是标准 MoE 结构,无需任何自定义算子或额外在线模块,可直接替换原模型在现有推理引擎(如 TensorRT、ONNX Runtime 或自研 serving 框架)中部署,服务端代码无需改动。

具体落地 use case

  • 电商平台商品推荐:某大型电商的点击率/转化率模型采用 8 专家 MoE,高峰流量时推理延迟成为瓶颈。用 UniMoMo 将其压缩为 4 专家版本,保持推荐质量的同时,单卡吞吐提升约 1.5 倍,直接降低集群规模需求。
  • 短视频内容排序:内容平台使用 MoE 模型进行实时 feed 排序,通过 UniMoMo 导出 2 专家版本部署到边缘节点,实现就近低延迟推理,减少中心机房负载和网络延迟。

局限

  • **校准集依赖**:UniMoMo 使用未标注校准集测量专家功能相似性,但论文未充分讨论校准集规模、领域分布对压缩结果的影响。若校准数据与线上分布存在偏移,功能相似性判定可能失真,导致不合适的专家合并,损害线上推荐质量。此外,实际部署中校准集的获取成本与时效性未被量化,可能限制方法在快速变化推荐场景中的实用性。
  • **保护机制的阈值敏感性与覆盖局限**:层自适应保护通过路由曝光限制高流量专家合并,但高流量阈值需人工设定,论文未给出自动化选择策略,不同层、不同数据集的最优阈值差异可能较大。同时,该机制仅关注高流量专家,可能忽略低流量但功能独特的专家,压缩后长尾用户或冷门物品的表示能力可能下降,影响推荐公平性与覆盖度。
  • **实验规模与评估维度有限**:实验仅在 Amazon Beauty、KuaiRec、TenRec 三个中小规模数据集上验证,最大 MoE 块数为 6,缺乏大规模工业级推荐模型(如十亿参数级)的评测。评估指标仅 NDCG@10 和推理加速比,未报告内存占用、能耗、在线延迟分位数等部署关键指标,也未与在线蒸馏、动态剪枝等压缩方法进行系统对比,结果的普适性和综合优势尚待进一步验证。
论文Lei Xin2026-08-09原文

相关内容