Together AI 推出 Provisioned Throughput 预留推理容量
Together AI 推出 Provisioned Throughput,以 token 计费和 SLA 保证的预留容量,解决开源模型在生产中的不可预测性问题,成本显著降低。
Together AI 发布 Provisioned Throughput,一种面向开源前沿模型的预留推理容量服务,采用 token 计费,提供 99% 可用性 SLA。与 serverless 按需模式不同,用户购买固定的每分钟 token 速率,无需管理 GPU 资源,成本比 Claude Opus 4.8 低 90%,旨在让生产环境使用开源模型像闭源 API 一样简单可靠。
正文摘录
摘要 我们很高兴推出 Provisioned Throughput(预置吞吐量)——面向前沿开放模型的保留推理容量,按 Token 计费,并提供 99% 正常运行时间的 SLA。 开源权重模型已成为任何追求丰裕 AI 未来的公司的核心要素。但过去使用开源权重模型时,企业不得不在便捷但尽力而为的无服务器模式与强大但可调优的专用推理模式之间二选一。Provisioned Throughput 是一种全新的推理形态,它提供另一种选择:既拥有预优化模型按 Token 计费的简洁性,又具备有可用性 SLA 保障的确定性容量。其成本比列表价下的 Claude Opus 4.8 低至多 90%。 该服务即日起支持 MiniMax M3 和 GLM-5.2,覆盖北美、EMEA 及其他地区,最低使用期限为一个月。 推理开支已成为董事会关注的一项费用 在不远的将来,每位知识工作者都将拥有多个智能体为其工作。但企业正因天文数字般的推理预算而难以实现这一愿景。要成功,企业需要消费一系列覆盖帕累托前沿的模型,将任务难度与模型质量(和成本)相匹配。开源权重模型正占据该前沿的越来越大的份额。 随着企业转向多模型、多框架的架构,开源模型正在支撑他们越来越多的日常智能体:编程、金融、营销和工作流自动化。 已做出切换的企业报告称,使用开源模型的推理成本比专有替代方案低 6 到 20 倍。我们从自身数据中也能看到这一转变:九个月内,通过 Together AI API 的 Token 量从每月 300 亿增长到超过 400 万亿。其中相当一部分流量过去是在封闭 API 上运行的。 缺失了什么:值得信赖的 Token 容量 丰裕的 AI 不仅需要帕累托前沿上的开源模型。丰裕的 AI 还需要安心:承诺的容量、可预测(且可影响)的定价,以及客户能依赖的 SLA。