大规模推理基准测试:编码智能体
这篇博客公布了 Together AI 针对编码智能体的推理性能基准,证明其系统在吞吐量、延迟和成本上优于主流方案。
Together AI 发布的真实世界推理基准显示:相比 TensorRT-LLM,其系统吞吐量(TPS)提升 31%,饱和状态下首 token 延迟(TTFT)提升 2 倍,且成本比 Claude Opus 4.6 低 76%。
正文摘录
 摘要 在生产级编码 Agent 工作负载上,Together Inference Engine 在相同硬件上 比第二快的开源推理引擎多提供 31% 的 TPS,并在饱和状态下保持 2 倍的 TTFT 优势。这些收益来自全栈优化:ThunderMLA、自定义内核重写以及在真实流量上的端到端性能分析。 --- 大多数推理基准测试只衡量单个用户命中专用端点的场景。数字看起来很棒。但对于生产环境的推理来说,它们毫无用处。 在生产环境中,你运行的是几十甚至几百个并发请求。它们竞争相同的 KV 缓存、相同的内存带宽、相同的 GPU 周期。关键问题是:当系统负载时,每个用户的体验如何。 我们构建这个基准测试就是为了回答编码 Agent 的这个问题。这是一种对推理要求很高的工作负载:长输入、高并发,并且在负载下不能容忍延迟退化。 这是第一个版本。我们会随着开发不断更新。 编码 Agent 工作负载是什么样的 编码 Agent 请求携带大量上下文。正在编辑的文件、周围的代码、对话历史、检索到的片段。输入很长。输出有意义但边界明确;你生成的是一个函数,而不是一篇文章。 更大的挑战是并发性。许多用户同时命中端点,这些请求之间的交互方式是单用户基准测试永远无法捕捉的。随着流量增加,KV 缓存被填满。调度压力增加。每个用户的吞吐量下降。首 token 时间(TTFT)上升。在某个点,系统会变得毫无用处。不同的引擎在非常不同的流量水平达到这个点。