动态

vllm在H100上实现高吞吐,成本比API低5倍

vllm在H100上实现高吞吐,成本比API低5倍
Charles Frye
我们还展示了如何在 @vllm_project 中,针对延迟不敏感的“批量”工作负载(总结内幕交易的SEC文件),使用相同模型在每块H100上达到约30k输入tok/s和约2k输出tok/s。按当前费率,这比API便宜5倍。

https://modal.com/docs/examples/vllm_throughput
动态Charles Frye2026-01-14原文

相关内容