行业新闻

Cohere 探讨大模型服务公平性调度

Cohere 探讨大模型服务公平性调度

Cohere 指出大模型服务需要类似操作系统的公平调度机制,避免高并发下部分请求被无限期延迟。

Cohere 在一篇技术博客中讨论了大语言模型服务(即部署和运行 LLM 的推理系统)中的公平性问题——当多个请求同时到达时,如何分配计算资源以避免某些用户或任务被“饿死”。文章分析了现有调度策略的不足,并提出了兼顾效率与公平的新思路。

正文摘录

LLM 服务公平性 如果你把大语言模型作为多租户 SaaS 平台来运营,就会遇到一个看似简单实则棘手的难题:很多组织共享同一批 GPU,它们的流量是突发且不均匀的。不加管控的话,一个客户的流量峰值就会变成其他所有客户的延迟问题。 这篇博客中,我们将带你了解 Cohere 新推出的跨租户推理请求调度方案,它结合了架构模式和经典调度算法,目标是实现公平调度。 问题:吵闹的邻居 推理服务在批量处理请求时效率最高。喂满一个批次的 GPU 运行得又热又经济,而一次只处理一个请求的 GPU 大部分时间都闲置着。因此,请求会短暂排队,在进入硬件之前被打包成批次。 关键在于顺序。想象一个朴素的队列:一个共享的单行队列,只按优先级和截止时间排序。现在,假设一个组织突发发送了 10,000 个请求,而另一个组织只发送了 5 个。在单一全局队列中,10,000 个请求堆在前面,那 5 个行为良好的请求只能排在队尾。 这就是经典的“吵闹的邻居”问题,而多租户 LLM 平台与面临同类流量模式的其他共享系统并无不同。 服务公平性的目标是让租户之间相互隔离,这样每个租户获得的推理容量份额就取决于公平调度——而不是取决于它往队列里塞请求的激进程度。同时,它还保留每个租户内部的优先级和截止时间顺序,并维持批处理效率。 解决方案:分层容量管理方法 Cohere 通过组合四种不同的机制,在租户之间公平管理工作负载,每种机制解决不同层面的问题。它们按固定顺序执行:一个 Rate Limiter 控制入站时的准入,然后三个选择器——Performance Tier、Deficit Round Robin 和 Priority——在出站时选择下一个请求。 下面是架构和逐步流程: 1. Rate Limiter 在请求进入调度队列之前,它会先通过准入控制(admission control)。

阅读原文(cohere.com)→

行业新闻2026-06-18原文

相关内容