行业新闻

港科大发现MoE模型路由脆弱性:重复输入可阻塞负载均衡

港科大发现MoE模型路由脆弱性:重复输入可阻塞负载均衡

重复输入模式能诱导MoE模型的路由器负载失衡,拖慢推理服务,暴露了系统层面的安全漏洞。

MoE(混合专家)模型将大模型拆成多个专家,每个token只激活少数专家。港科大团队发现,高度重复的token输入会让路由器把所有token分给同一批专家,导致部分GPU过载而其他闲置,造成同步等待。实验显示,该攻击可使TTFT(首token延迟)增加20%至148%。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg5410729750.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-156.png) MoE 大模型正在成为高效推理的主流路线。 它把一个大模型拆成很多「专家」,每个 token 只激活其中一小部分。这样一来,模型总参数可以很大,但每次推理的实际计算量不会爆炸。对服务商来说,这几乎是一个甜蜜的工程答案:更大模型,更低成本,更高吞吐。 但这篇来自 ICML 2026 的工作发现,MoE 模型最重要的组件之一——专家路由(router)里,藏着一个新的系统级风险。 来自港科大的研究团队提出了 RepetitionCurse,这是一种针对 MoE 大模型服务的黑盒压力测试方法。 它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量 token 路由到同一小批专家上。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg6da77c2118.png) 论文链接:https://arxiv.org/abs/2512.23995 结果某些 GPU 被打成 straggler(掉队者),其他 GPU 空等同步,最终拖慢 time-to-first-token(TTFT,即用户看到第一个 token 的时间)。 实验显示,在常见 8-GPU EP(Expert Parallelism,专家并行)部署上,RepetitionCurse 可让 MoE 模型的 TTFT 增加 20% 到 148%。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-19原文

相关内容