动态

DeepSeek涨价,推荐本地部署方案AirLLM,利用分层推理降低显存需求。

Vincent
DeepSeek API一涨价,高频大用量党的成本确实被拉高不少。

如果想转本地部署,但手头显存又不够的兄弟,可以去试试这个开源项目:AirLLM。

它核心的黑科技在于分层推理(Layer-wise Inference),把显存占用压缩到了极致。像70B甚至更大参数的大模型,在消费级单显卡(比如单张4090,甚至是16G显存的显卡)上也能强行跑起来。

虽然推理速度比不上全量加载到显存,但拿来跑非实时任务、后台异步批处理,或者单纯为了省API钱,算是一个非常实用的本地平替方案。

https://t.co/23zAEf6QHw
动态Vincent2026-08-17原文

相关内容