开源推理系统 FreeToken 让消费级显卡运行大规模 MoE 模型
FreeToken 用软硬件协同设计,把 MoE 模型搬到消费级显卡上,让本地跑前沿大模型成为可能。
FreeToken 是一个新的开源边缘端推理系统,专为 MoE 大模型设计。它通过动态带宽感知、双缓冲预取等技术,让 RTX 5090 单卡跑满血 DeepSeek-V4-Flash,速度超过 33 token/s。系统已开源,提供桌面 App。
正文摘录
markdown .jpg) 编辑 | 泽南 「这个结果太疯狂了。」 本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。  Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。  来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。