GORGO: 跨区域网络感知的 LLM 服务在线调优
大型语言模型推理服务通常将客户端请求代理到全球分布的引擎副本上,负载均衡策略需要联合考虑 KV-cache 局部性、副本负载 和 网络延迟变化 等因素,以优化延迟和 TTFT 等指标。然而,现有系统的成本模型仅评估其中部分因素,导致副本间负载和 KV-cache 分布不均。 本文提出 GORGO,一种代理架构,通过可调参数整体考虑网络延迟、预填充成本和排队延迟。由于开源聊天数据集如 LMSYS-Chat1M 和 WildChat-4.8M 缺乏长上下文和高前缀复用数据,我们发布了一个基于长上下文生产元数据的合成数据集 ART-Chat-2.5M。在 ART-Chat-2.5M 的调优窗口上,进化策略引导 GORGO 策略参数直接优化 p95 TTFT。在保留的评估窗口上,使用调优后的参数值,与简单会话亲和性和前缀缓存等基线负载均衡策略相比,p95 TTFT 改善 6.9-15.5%,p95 端到端延迟 改善 14.3-30.9%。代码和数据集见 https://github.com/Arcadia-Research-Team/GORGO。
论文精读
TL;DR GORGO 是跨区域 LLM 推理代理,通过演化策略在线联合调优网络延迟、预填充与排队成本,直接优化 p95 TTFT,在真实评估中大幅领先现有缓存亲和策略。
问题
问题背景
随着大语言模型(LLM)推理服务走向全球分布式部署,客户端请求通过代理被路由到不同区域的推理引擎副本。用户感知的延迟主要由首 token 时间(TTFT)决定,而 TTFT 又由预填充时间、网络往返延迟(RTT)和排队延迟共同构成。如何在多区域环境中平衡负载、利用 KV-cache 局部性以减少重复计算,成为优化延迟的关键。
现有方法局限
当前负载均衡策略通常只考虑上述因素中的一个子集:
- 简单会话亲和性(session affinity)将同一会话请求固定到同一副本,虽可最大化 KV-cache 重用,但忽略副本负载差异,易导致过载。
- 基于前缀缓存的策略(prefix-cache)仅根据缓存命中率路由,未显式建模网络延迟和排队时间,在全球部署中可能因远程副本的高 RTT 而抵消缓存收益。
- 成本模型缺乏对动态因素的实时适应,无法直接针对 P95 TTFT 等尾部延迟指标进行调优。
为什么这个问题难/重要
- 多维耦合:网络延迟因区域和带宽波动而变化,预填充成本受上下文长度和 KV-cache 命中率影响,排队延迟则随负载动态变化,三者相互制衡。
- 尾部优化敏感:在 LLM 服务中,TTFT 的尾延迟直接影响用户体验,但非凸搜索空间大,且需在不中断在线服务的前提下动态调整策略参数。
- 数据缺失:开源聊天数据集缺少长上下文、高前缀重用的真实分布,使得离线策略训练与在线环境存在分布差异。
- 业界对全球分布式 LLM 推理的低延迟、高利用率需求迫切,而缺乏一体化、自适应调优的框架。
行业类比
就像全球 CDN 选择边缘节点时需同时考虑内容缓存命中率和网络延迟,GORGO 在 LLM 推理路由中联合优化了 KV-cache 局部性与动态网络-计算成本,体现了分布式系统中“就近缓存+负载感知”的设计哲学。
核心洞察
- GORGO 将跨区域 LLM 推理负载均衡建模为一个包含网络延迟、预填充成本和排队延迟的联合成本函数,并用进化策略在线调优权重,直接优化 p95 TTFT。与仅考虑 KV-cache 命中或副本负载的现有方法不同,它显式地在路由决策中纳入可变网络条件,从而避免了因单一优化目标导致的 KV-cache 与负载分布不均,在真实跨区域场景下显著降低了尾延迟。
- 论文指出开源聊天数据集缺乏长上下文和高前缀重用数据,因此发布了合成数据集 ART-Chat-2.5M,从生产元数据生成,以支持跨区域服务下的负载均衡策略调优。这一贡献不仅弥补了评估基准的缺失,也使在线调优能够在代表性负载上收敛,揭示了真实负载特征对跨区域调度器设计的关键影响。
方法
GORGO 负载均衡方法
GORGO 采用 进化策略驱动的在线调优 架构,针对跨区域 LLM 推理服务,动态优化请求路由策略。
输入:客户端发起的多轮对话请求,以及分布在不同地理区域的推理引擎副本。每个副本实时上报自身状态(KV-cache 命中情况、预填充队列长度、当前负载),同时代理测量自身到各副本的 RTT。
核心模块:
- 成本模型: GORGO 为每个候选副本计算一个综合成本得分,该得分是三个独立延迟成分的加权和:
- 网络延迟(从代理到副本的 RTT)
- 预填充代价(根据剩余未命中 KV-cache 的 token 数估算)
- 排队延迟(副本上正在执行的请求数和预期耗时) 各成分的权重为可调参数,初始由系统设定,随后通过进化策略自动优化。
- 进化策略调优器: 在专用的调优窗口内,GORGO 将不同权重组合视为个体,采用进化策略(如 CMA-ES)进行搜索。每一代生成一组候选权重,在实时流量上执行选择——以 p95 TTFT 为最小化目标,淘汰高延迟个体,保留并变异表现更优的权重。该过程完全在线,无需离线仿真。
- 专用数据集 ART-Chat-2.5M: 针对开源聊天数据集缺乏长上下文、高前缀复用的问题,GORGO 从生产元数据中合成了包含 250 万条多轮对话的 ART-Chat-2.5M,提供了充足的长序列和前缀重复模式,用于训练和评估策略的泛化能力。
输出:调优完成后,固定最优权重参数,代理在后续评估窗口中使用该固定策略进行实时路由,而无需持续调参。最终,该策略在保持 KV-cache 局部性 和避免副本过载的同时,显著降低尾延迟。
与同类方法的差异点: 现有前缀缓存或会话亲和策略仅优化单一因素(如最大化缓存命中率),而 GORGO 通过进化策略自动平衡网络、计算和排队三者关系,无需人工设计启发式权重,并且能直接针对目标的 p95 延迟指标进行端到端优化。
实验
实验设计
- 数据集:使用自建的 ART-Chat-2.5M 长上下文、高前缀重用合成数据集,并划分调优窗口与 held-out 评估窗口。同时,以 WildChat 进行重放评估,验证泛化能力。
- 系统配置:部署多个 SGLang 推理引擎副本,模拟跨区域 LLM 服务。代理节点根据 GORGO 策略将请求路由至不同区域的 replica,所有副本均启用 prefix-caching 与 continuous batching。
- 调优方法:在调优窗口内,进化策略 (Evolutionary Strategies) 在线调整策略的线性代价模型中各因子(网络 RTT、prefill 成本、排队延迟)的权重,直接以 p95 TTFT 为目标进行最小化。评估期间固定权重,对比多种基线。
- 基线策略:1) session affinity:持续将同一会话请求发往同一副本;2) prefix-cache:优先路由到缓存命中率最高的副本;3) 其他简单轮询 / 最少连接等变体。
关键发现
- GORGO 在所有评估窗口上一致优于基线:p95 TTFT 相对降低 6.9%–15.5%,p95 E2E 延迟 降低 14.3%–30.9%。
- 学习到的权重能动态适应网络延迟波动与负载变化,自动在 KV-cache 亲和性 与 队列延迟 之间取得平衡,避免传统策略导致的缓存过热或某副本过载。
- 在负载扫描实验中,随着请求率上升,GORGO 的尾延迟优势更加明显,表明其拥塞感知能力优于静态启发式。
深度对比解读
相比 session affinity 和 prefix-cache 等单一目标策略,GORGO 的核心提升来自多因素联合建模与自适应调参。单纯依赖缓存亲和的策略在低负载时有效,但在高负载下会因忽视队列深度而导致 p95 恶化;会话亲和则无法利用跨副本缓存机会。GORGO 的 cost model 显式加权网络、prefill 和队列延迟,进化策略的在线优化使其能根据实时流量模式调整权重,而无需人工设计规则。这种方法在工程上提供了免手动调参、可直接落地的跨区域负载均衡方案,尤其适合路由逻辑无法被简单规则覆盖的复杂生产环境。
行业影响
落地场景
GORGO 面向全球化 LLM 推理服务,适用于需要在多个地理区域部署推理引擎副本、并对延迟敏感的应用场景,例如:
- 实时对话系统:客服机器人与语音助手,需要在毫秒级 TTFT 内响应用户,且多轮对话中前缀缓存命中率直接影响体验。
- 代码补全与编程助手:如 Copilot 类工具,用户期望即时的行内建议,跨区域路由需权衡缓存亲和性与网络延迟。
- 内容审核与生成平台:处理全球 UGC 内容时,推理负载动态变化,GORGO 可根据副本负载和前缀复用情况智能分配请求。
商业价值
GORGO 直接优化 p95 TTFT 和 E2E 延迟,带来三重价值:
- 体验提升:降低尾部延迟可减少用户等待焦虑,尤其在对话和实时生成场景下,延迟下降 6.9–15.5%(TTFT)与 14.3–30.9%(E2E)能显著提高用户留存。
- 降本增效:通过进化策略在线调优,无需手动设定权重,策略自适应网络波动和负载变化,避免过度配置副本,减少 GPU 租用成本。
- 差异化竞争力:在同类 LLM API 服务中,稳定低延迟可成为核心技术指标,吸引对实时性要求高的企业客户。
与现有产品/工作流的接口
GORGO 作为轻量代理层,可无缝集成进现有 LLM 服务栈:
- 对接推理引擎:直接与 SGLang、vLLM 等支持前缀缓存的引擎配合,通过修改路由表即可启用,无需改动引擎内部逻辑。
- 与负载均衡器协同:可作为 Envoy 或 Nginx 上游,或替换现有会话亲和性策略,利用其
cost model计算出最优副本。 - 监控与调优闭环:通过在线收集指标(RTT、队列长度、前缀命中率),进化策略定期更新参数,可与 Prometheus + 自研 controller 集成,实现持续调优。
具体落地用例
- 全球化电商客服:某电商平台在全球 3 个区域部署 LLM 副本用于智能客服。GORGO 根据用户实时 RTT 和副本 KV 缓存状态路由对话,使得重复问询(如“订单状态”)的前缀缓存命中率提升,p95 TTFT 降低 12%,客服对话中断率下降。
- 媒体平台内容摘要:一家短视频平台使用 LLM 为创作者生成视频描述。请求高峰期间,GORGO 动态调整
prefill_cost_weight和queue_delay_weight,将队列积压高的区域流量导至缓存更暖的区域,整体 p95 生成延迟降低 20%,同时节省了 15% 的预填充计算量。
局限
- **合成数据集的代表性有限**:论文使用的 **ART-Chat-2.5M** 数据集虽基于长上下文生产元数据生成,但可能无法完全复现真实多轮对话的前缀重用分布、请求到达模式及跨区域网络延迟的动态波动。在线调优时,进化策略学习到的参数可能过度拟合该合成工作负载,在真实流量特征变化时性能可能退化,论文未提供在野生数据集(如 LMSYS-Chat-1M 重放)上的调优评估。
- **调优策略的静态假设**:GORGO 在固定调优窗口内通过进化策略搜索最优参数,并在后续评估窗口保持参数不变。然而,实际 LLM 服务的工作负载与网络条件常随时间非平稳变化,静态参数难以持续最优,论文未讨论如何实现**持续在线自适应**,也未给出参数敏感度分析或在线更新机制的成本评估。
- **对比实验与引擎兼容性的局限**:仅与 **会话亲和性** 和 **前缀缓存优先** 两种简单基线对比,缺少与更精细的路由算法(如考虑负载感知的 LOR 或基于强化学习的实时调度)的对比,且仅验证了 SGLang 与 vLLM 引擎,未测试不同模型架构或批处理策略下的通用性。此外,未分析在大规模集群或更复杂拓扑下的可扩展性。