行业新闻

纯 C 推理框架 Colibrì 用 SSD 分层跑 744B GLM,GitHub 获 32k Star

一个把 SSD 当显存用的推理框架:靠 MoE 专家按需加载,让笔记本也能跑 744B 大模型,代价是速度。

开源项目 Colibrì 用纯 C 实现分层推理:把模型暂时用不到的专家权重放在 SSD 上,需要时再读进内存。GLM-5.2 经 int4 量化后约 372GB,可在 16GB 内存起的机器上运行,不强制要求 GPU。

正文摘录

笔记本跑 7000 亿参数 GLM!无 GPU 也行? SSD 当显存用火爆 GitHub 25GB 笔记本硬跑 744B GLM-5.2,32GB 内存挑战 2.8T Kimi K3—— GitHub 现在最火热的大模型开源小蜂鸟 Colibrì,纯 C 实现、零引擎依赖的分层推理框架,已经狂揽 32k Star。 正常情况下,744B 的总参数规模已经让普通消费级电脑望而却步,但 Colibrì 的办法可以说是相当简单粗暴: 模型里暂时用不到的部分,直接扔在 SSD 里;等推理真的需要哪个专家,再现场从硬盘把它捞出来。 于是,GLM-5.2 经过 int4 处理后大约 372GB 的权重,可以在最低 16GB、推荐 24GB 左右 RAM 的机器上运行,GPU 甚至不是必需品。 它目前已经覆盖 9 个模型家族,从 GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,一路支持到了 975B 的 Inkling,以及 2.8T 参数的 Kimi K3。 以 GLM-5.2 为例。虽然整个模型足足有 744B 参数,但 MoE 并不会在生成每个 token 时把 744B 参数全部计算一遍。 它会先通过 Router 判断:这个 token 该交给哪些“专家”处理?然后只激活其中一小部分。 GLM-5.2 总参数 744B,但每个 token 实际激活的参数大约只有 40B,这就留下了一个很大的操作空间: Attention、Embedding、共享专家这些每次推理都要用到的 Dense 部分,大约 17B 参数,int4 之后只占约 9.9GB,直接常驻 RAM。 模型开始生成 token 之后,Router 先选出当前真正需要参与计算的专家;Colibrì 再检查它们是否已经在高速内存中,没有命中的部分,才临时从 SSD 读取。

阅读原文(qbitai.com)→

行业新闻田, 晏林2026-09-26原文

相关内容