行业新闻

推理服务的99.9%可用性意味着什么:Together AI详解故障域与架构要求

Together AI指出,99.9%可用性意味着架构能扛一个数据中心整体故障,需要跨设施部署和实时流量分配,而非冷备。

推理服务的可用性数字容易发布,但难解释。Together AI分析了不同可靠性层级对应的故障域:99%(扛节点故障,如GPU硬件错误、驱动崩溃),99.9%(扛整个数据中心故障,需跨设施部署和实时流量分发),99.99%(扛区域故障,需多区域与冗余)。每个层级都需要不同的架构,且添加可靠性会让以性能为目标的系统指数级变难。

正文摘录

TL;DR - 简而言之:每个可靠性等级对应一个特定的故障域,每个域都需要各自的架构来应对。大致来说: - 99% 意味着你的架构能应对节点级故障:GPU 硬件故障、驱动程序崩溃、热事件。这通常需要自动健康检查、节点排空以及在单个数据中心内快速替换副本。 - 99.9% 意味着你的架构能应对整个数据中心故障。这通常需要模型权重部署在两个设施中,每一侧都有足够的容量来吸收全部负载,并且流量路由是实时的,而非冷备。 - 99.99% 意味着你的架构能应对区域性中断。这通常需要跨区域部署,具备可用区冗余和预留的故障切换容量。 可靠性数字很容易发布。困难的是解释它们的含义:架构实际覆盖了哪些故障域,提供商是否控制了这些层面的基础设施,以及凌晨3点出问题时会发生什么。 Together 为 Cursor、Decagon、Cartesia 和 Yutori 等团队运行推理。以下大部分情况我们都曾收到告警;这是我们学到的经验。 可靠性数字的问题 当推理服务宕机时,某人的产品也会随之宕机。GPU 推理的故障方式与常规服务不同。硬件存在故障模式,而 CPU 基础设施没有,并且系统为性能做了极致调优。要达到每个 GPU 每分钟 100 万 tokens、200 TPS,或在使用自定义内核的语音模型上实现低于 50ms 的 TTFT(首次令牌生成时间),几乎没有冗余空间。在这样的系统中增加可靠性,每增加一个9难度都会呈指数级上升。 有用的思维模型是分层,每一层的故障模式都截然不同: - 计算:VRAM 中的 ECC 错误(我们最常见的情况;它们会静默地破坏权重,因此请求有返回但输出不可信)、热节流、驱动程序崩溃、NVLink 故障、NIC 或 CPU 故障(无论 GPU 状态如何都会导致机器宕机)。

阅读原文(together.ai)→

行业新闻2026-07-16原文

相关内容