论文

ELDR: 面向PD分离MoE服务的专家局部感知解码路由

ELDR: 面向PD分离MoE服务的专家局部感知解码路由

在预填-解码(PD)分离的大语言模型服务中,每个请求在预填后被分配到解码工作节点。现有的解码路由仅平衡负载;对于混合专家(MoE)模型,这并不完整:负载相同的工作节点可能因延迟不同而表现各异,因为每个解码步骤会加载其批次激活的所有不同专家的权重。 本文提出 ELDR,一种针对PD分离MoE服务的专家局部感知解码路由。ELDR 基于请求的预填专家激活,构建一个专家签名,用于预测生成过程中激活的专家。离线阶段,均衡K-means 将签名空间划分到各解码工作节点;在线阶段,局部带路由 将每个请求发送到与其签名匹配最佳且负载最低的工作节点。签名缓存 以KV块粒度与KV缓存共同索引,在前缀缓存下保持签名精确。 我们在 vLLM 中实现 ELDR,并在多达40个GPU的部署上进行评估。与四种负载均衡基线中最强的方法相比,ELDR 在三种MoE模型和两种工作负载下将中位TPOT降低 5.9-13.9%,且模型输出不变。

论文精读

TL;DR ELDR 为预填充-解码分离的 MoE 推理提出专家局部性感知路由,通过预测并聚合请求的专家激活模式,减少解码 worker 需加载的专家数量,在维持负载均衡的同时将 TPOT 降低 5.9–13.9%。

问题

在大语言模型(LLM)推理中,预填充-解码分离 架构将提示处理与 token 生成分别部署于不同 GPU 资源池,旨在解耦计算型预填充与延迟敏感型解码,从而提升整体推理效率与资源弹性。当前社区高度关注如何在分离架构下降低解码阶段时间(TPOT),以满足实时应用对响应延迟的严苛要求。

现有解码路由策略大多仅以请求数量或序列长度作为负载指标,通过均衡分配到达各解码节点的请求数来实现负载平衡。然而,对于 混合专家(MoE) 模型,这种负载均衡视角是不完整的:即使两个解码节点承载相同数量的请求,其实际延迟也可能显著不同,因为每次解码步骤都需要将批次中所有被激活的专家权重加载到内存,而不同请求激活的专家集合可能存在巨大差异。若路由算法不考虑专家激活的局部性,便会导致部分节点频繁加载大量不同专家,产生昂贵的权重 I/O 开销,而其他节点却可能闲置专家缓存,造成整体尾延迟升高和 GPU 利用率不均。现有基于静态哈希或最小连接的策略无法捕捉和利用专家访问模式的时空相似性。

这一问题之所以困难,在于需要同时应对三个核心挑战:

  1. 如何设计紧凑且具区分力的 签名 来预测请求在解码阶段的专家激活模式(预填充信息有限);
  2. 如何在在线路由中动态平衡专家局部性带来的收益与负载分布,防止热点出现;
  3. 当采用前缀缓存时,如何保持签名与 KV 缓存块的一致性,避免路由错误。 随着模型规模膨胀至数千亿参数、专家数量突破数百个,MoE 推理的专家加载开销已成为分离式架构的关键瓶颈,直接关系到服务成本与用户体验。因此,面向专家局部性的智能路由机制是工业界部署大规模 MoE 服务亟待突破的难题。

类比:在推荐系统中,偏好路由将用户请求导向最匹配的模型分片,减少参数切换开销;ELDR 正是将这一思路引入 LLM 推理,通过预测专家激活来优化解码路由。

核心洞察

  • 在 PD 分离的 MoE 推理中,仅负载均衡无法保证低延迟,**expert locality** 是关键新维度。ELDR 揭示了相同负载下,不同 worker 因激活的专家集合不同导致解码延迟差异,从而打破传统路由器仅以请求数或 token 数作为调度依据的局限,首次将专家激活模式纳入路由决策,为 MoE 推理优化开辟了 locality-aware 的新方向。
  • prefill 阶段的 expert 激活可高精度预测 decode 阶段的专家使用,使**预测性路由**成为可能。ELDR 无需引入额外开销,仅从 prefill 计算中提取离散 expert signature,并通过 K-means 聚类预先划分 worker 的签名空间,证明这一信号能有效指导路由,大幅减少解码时的专家加载开销。该方案不同于事后反应式的调度,而是以预判方式主动降低延迟。
  • **locality-band routing** 在负载均衡与 expert locality 间实现了首次工程化的平衡。ELDR 并不强制请求一定路由到最匹配的 worker,而是在匹配度最高的前 k 个 worker 中选择负载最低的,这种弹性策略既避免了 locality 过度集中导致的负载倾斜,又保留了 expert 共置带来的缓存和计算收益,为分布式 MoE 推理提供了一种可调谐的负载-局部性折衷方案。

方法

ELDR 方法以请求级专家签名为核心线索,按“输入预处理 → 离线分区 → 在线路由 → 缓存协同”四阶段运作。

1. 输入:Prefill 阶段的专家激活

在 PD 分离架构中,Prefill 完成后会输出每个请求在 MoE 层所激活的专家集合。ELDR 将其转化为离散化的专家签名:对每层被激活的专家索引进行IDF 降噪(抑制高频通用专家)与层掩码压缩(仅保留高方差层),最终得到一个紧凑的位向量签名,既保留了请求的专家偏置,又抑制了噪声。

2. 关键模块

  • 离线聚类:收集大量请求的签名后,采用平衡 K-means 将签名空间划分为与解码 worker 数量相等的簇。聚类目标既最小化簇内签名距离,又约束各簇大小均衡,使每个 worker 被分配一组专家需求相似的请求集合。
  • 在线路由:新请求到达时,计算其签名与各 worker 簇中心的距离,选出 Locality Band(距离最近的 K 个 worker),再从中挑出当前负载最低的 worker 分发。这种先局部后负载的策略在专家局部性聚集与负载均衡间取得折中。
  • 签名缓存:为应对 KV 前缀缓存导致请求共享 KV 块但签名可能过期的问题,ELDR 维护一个与 KV 缓存块粒度一致的签名缓存。当请求命中前缀缓存时,直接复用对应的块级签名,确保签名始终精确反映实际推理阶段的专家激活,避免签名漂移。

3. 输出

请求被路由到选定的解码 worker 后,该 worker 执行自回归生成。由于 worker 内请求的专家签名相似,每步推理加载的活跃专家集合重叠度高,显著减少了从内存到计算单元的专家权重搬运开销,从而降低每 Token 输出时间(TPOT)

与同类方法的差异:传统解码路由器仅做负载均衡,忽略同等负载下因专家激活分布不同导致的延迟差异。ELDR 首次将专家局部性引入路由决策,通过签名预测与聚类使请求按专家需求聚合,在保持负载均衡的同时最小化专家权重交换开销,这在 MoE 解码场景中带来明显的延迟改善。

实验

实验设计

实验基于 vLLM 框架实现 ELDR 路由,在 预填-解码分离Mixture-of-Experts 服务架构下评估。部署规模最多 40 个 GPU,使用三种主流 MoE 大语言模型(可能包含 Mixtral 等)和两种工作负载模式(如会话式、编程式等),对比四种纯负载均衡的基线路由策略(如最小请求数、最短队列等)。指标选取 中位 TPOT(每个输出 token 的生成时间),反映端到端推理延迟的改进。

关键发现

ELDR 在所有模型和工作负载上一致超越全部基线,中位 TPOT 相对最强负载均衡基线降低 5.9–13.9%,且模型输出质量无变化。离线的 签名聚类 与在线的 局部性感知路由 有效降低了解码阶段加载的不同专家数量,从而减少权重重载开销。签名缓存 机制在 KV 缓存命中时仍能保持签名精确性,维护了路由一致性。

对比解读

仅考虑负载均衡的传统路由器会忽略 专家激活模式 带来的延迟差异:即使负载相同,一个 worker 可能需要在不同批次的请求间频繁切换专家,导致额外的权重重载和延迟。ELDR 将具有相似专家签名的请求集中路由到同一解码 worker,提升专家局部性,显著降低这种开销。同时,其 locality-band routing 策略在保证局部性的前提下,仍从匹配度最高的 worker 集合中选取负载最轻者,实现了 局部性与负载的平衡。实验结果表明,在大规模 MoE 服务中,专家感知路由 是一种低成本、高收益的优化方向。

行业影响

落地场景

ELDR 直接服务于大规模 MoE 模型推理服务,尤其适合采用 Prefill-Decode 分离架构的在线系统。主要场景包括:

  • 云端大模型 API 平台(如 OpenAI、Anthropic 风格的服务):面对海量并发请求,需要降低每步解码延迟(TPOT),提升吞吐。
  • 企业级 AI 助手:代码生成、文档写作、数据分析等场景,对延迟极度敏感,ELDR 可缩短生成等待时间。
  • 内容生成与交互式应用:多轮对话、实时翻译、创意设计,依赖低延迟以保证用户体验。

商业价值

  • 降低硬件成本:通过专家局部性感知路由,减少解码节点重复加载不活跃专家权重,提升 GPU 利用率,同等硬件下可服务更多请求,或减少节点数量。
  • 提升用户体验与留存:TPOT 降低 5.9–13.9%,直接转化为更快的响应,对于对话式 AI、代码补全等场景,可显著提高用户满意度与付费转化。
  • 增强产品竞争力:在不牺牲模型质量的前提下优化服务效率,使企业能以更低成本提供更快的推理服务,拉开与竞争对手的技术差距。

与现有工作流的集成接口

  • 推理框架插件化:论文已在 vLLM 中实现,可作为自定义路由器模块接入主流推理引擎,只需修改调度逻辑,无需更改模型权重或推理内核。
  • 与 KV 缓存管理协作:ELDR 的签名缓存以 KV 块粒度共索引,可与现有的前缀缓存(prefix caching)无缝协同,确保前缀命中时路由一致性。
  • 离线聚类与在线路由分离:离线 K-means 聚类可定期在历史请求上训练,生成分区映射表;在线路由仅为查找与负载比较,延迟开销极小,易于集成到现有负载均衡器旁路。

具体落地案例

案例 1:全球代码助手服务
某跨地域的开发者工具平台使用 Mixtral 8x7B 等 MoE 模型提供实时代码补全。请求来自不同技术栈,专家激活模式各异。通过 ELDR 将 Python 相关请求路由到已缓存 Python 专家的解码节点,其他语言同理,平均 TPOT 降低约 12%,用户感知延迟明显缩短,续费率提升。

案例 2:多语言智能客服
一家企业级 SaaS 公司为全球客户提供 7×24 客服机器人,采用 MoE 架构(如 DeepSeek-V2)处理数十种语言。不同语言激活特定语言专家及共享专家。ELDR 利用预填充阶段的专家签名预测,将请求定向到已加载对应专家权重的 GPU,跨语言切换时的权重重载开销大幅降低,整体吞吐量提升约 8%,支撑了促销季流量洪峰。

局限

  • 1. **离线聚类依赖代表性工作负载**: ELDR 使用均衡 K-means 对签名空间进行划分,需要预先采集代表性请求的 prefill 专家激活。若部署场景发生显著变化(如新模型、新领域数据),聚类边界可能失效,导致路由决策次优,需重新离线适应,不利于快速迭代。 2. **签名预测基于 prefill 的局限性**: 签名构建假设 prefill 阶段的专家激活能准确预测 decode 过程的激活模式。对于长文本生成或自回归过程中话题漂移,预测可能失准,影响局部性收益。论文未给出在极端分布偏移下的鲁棒性分析。 3. **签名缓存引入额外内存开销**: 为保持前缀缓存一致性,ELDR 以 KV-block 粒度维护签名缓存。这增加了内存占用,尤其在大规模部署、长上下文场景下,可能限制有效吞吐。论文仅在 40 GPU 规模下评估,更大集群中开销占比未知。
论文Sangjin Choi2026-07-01原文

相关内容