小红书 UltraEP 300 微秒动态调平 MoE 专家负载,吞吐达理想 94.3%
小红书 UltraEP 通过实时专家复制,消除 MoE 训推中的负载热点,300 微秒内逼近理想吞吐。
MoE(混合专家模型)中,token 路由导致某些 GPU 过载,拖慢整体吞吐。小红书 UltraEP 在每次计算前根据当前真实负载,实时复制热点专家并分流 token,300 微秒内完成均衡,使吞吐达到理想值的 94.3%。相比现有框架平均提升 1.49 倍。
正文摘录
300 微秒调平 MoE 专家负载!小红书 UltraEP 逼近 94.3% 理想训推吞吐 编辑|杜伟 AI 算力的下一个浪费重灾区,可能就在价值数百万美元的整柜系统内部。 过去,GPU 集群让人担心的是带宽不足、通信太慢。现如今,华为 Atlas 900 A3 SuperPoD、NVIDIA NVL72 等机柜级(rack-scale)系统把数十颗 GPU 放进同一个高速互连域,芯片、互连、交换网络和整柜系统被共同设计成了一个更大的计算单元。 把 GPU 高速连接起来解决了数据快速移动的问题,但算力是不是真的能跑满,还要看运行时来不来得及处理不断变化的负载。 这一问题在大规模 MoE(混合专家模型)训推中尤为突出。 MoE 模型大量专家分散到不同 GPU 上,每个 token 经过 Gate 路由到少数几个专家。这种稀疏激活机制导致每张 GPU 的实际负载依赖 token 的路由结果。一旦少数专家成为热点,大量 token 集中涌向承载它们的 rank。其他 rank 即使提前完成计算,也要等待最慢的一方。 热点造成的负载倾斜同时拖慢专家计算和 token all-to-all 通信,还可能抬高过载 rank 的激活显存峰值。在真实训推中, 这种不均衡可能让实际吞吐与理想状态拉开多达 2 倍的差距。 更棘手的是,热点很难提前猜准。专家负载会随输入、网络层和路由 bias 更新快速变化,当前热门的专家在下一批数据中可能迅速降温。 上个月, 小红书 dots infra 团队联合北京大学等提出 UltraEP ,首次将 MoE 专家负载均衡变成了一项逐 microbatch、逐层实时执行的系统能力,并且在 MoE 训练的实际生产中落地。 此前 EPLB 等代表性系统方案通常根据历史路由数据估计专家负载,再周期性调整专家副本与放置。