动态

吴恩达推出SGLang高效推理新课程

吴恩达推出SGLang高效推理新课程
Andrew Ng
新课程:使用SGLang进行高效推理:文本和图像生成,与LMSys和RadixArk合作构建,由RadixArk的技术成员Richard Chen授课。

在生产环境中运行LLM成本高昂,其中大部分成本来自冗余计算。本短期课程教您使用SGLang消除这种浪费,SGLang是一个开源推理框架,可缓存已完成的计算并在未来的请求中重复使用。

当十个用户共享相同的系统提示时,SGLang只处理一次,而不是十次。加速效果会迅速累积,特别是当请求之间有很多共享上下文时。

您将获得的技能:
- 从头实现KV缓存,消除单个请求内的冗余计算
- 使用RadixAttention跨用户和请求扩展缓存,使共享上下文只处理一次
- 使用SGLang的缓存和多GPU并行加速扩散模型的图像生成

加入并学习如何使LLM推理在大规模下更快、更具成本效益!

https://deeplearning.ai/short-courses/efficient-inference-with-sglang-text-and-image-generation
动态Andrew Ng2026-04-09原文

相关内容