动态

RedHat与Andrew Ng合作推出高效部署LLM课程

RedHat与Andrew Ng合作推出高效部署LLM课程
Andrew Ng
关于高效部署LLM的新课程——如何以低延迟和合理成本为多个并发用户提供服务?本短课程由@RedHat构建,@cedricclyburn授课。

高效部署LLM需要高效的内存管理。一个70B参数的模型仅加载权重就需要约140GB。除此之外,每个活跃请求还需要自己的GPU内存块,即KV缓存,用于存储到目前为止已构建的令牌上下文。在本课程中,你将学习通过量化减少模型的内存占用,并使用vLLM进行服务,vLLM通过智能内存管理高效处理多个并发请求。

你将获得的技能:
- 量化模型并衡量精度权衡
- 使用vLLM服务模型并观察其高效处理并发请求
- 基准测试你的部署,并在速度、成本和精度之间做出明智的权衡

加入并学习高效部署LLM:
https://t.co/x04xMbFlkO
动态Andrew Ng2026-06-04原文

相关内容