动态

SGLang v0.4.4发布,优化DeepSeek模型速度

SGLang v0.4.4发布,优化DeepSeek模型速度
Junyang Lin
这些家伙致力于让MoE模型运行得越来越快!祝贺发布!
LMSYS Org
SGLang团队激动地宣布发布v0.4.4。我们将持续改进DeepSeek V3/R1性能。结合FlashInfer、MTP、DeepGEMM和Torch Compile在H200上的优化,可实现接近100 tokens/s,是目前最快的。https://t.co/zMCvaTw6X4
动态Junyang Lin2025-03-15原文

相关内容