vllm在H100上实现高吞吐,成本比API低5倍 Charles Frye我们还展示了如何在 @vllm_project 中,针对延迟不敏感的“批量”工作负载(总结内幕交易的SEC文件),使用相同模型在每块H100上达到约30k输入tok/s和约2k输出tok/s。按当前费率,这比API便宜5倍。https://modal.com/docs/examples/vllm_throughput 动态Charles Frye2026-01-14原文 打开互动版