行业新闻

开源推理系统 FreeToken 让消费级显卡运行大规模 MoE 模型

FreeToken 用软硬件协同设计,把 MoE 模型搬到消费级显卡上,让本地跑前沿大模型成为可能。

FreeToken 是一个新的开源边缘端推理系统,专为 MoE 大模型设计。它通过动态带宽感知、双缓冲预取等技术,让 RTX 5090 单卡跑满血 DeepSeek-V4-Flash,速度超过 33 token/s。系统已开源,提供桌面 App。

正文摘录

markdown ![](https://image.jiqizhixin.com/uploads/article/coverimage/2a3ad604-bf9a-4891-b859-d0c02fc30b86/049(2).jpg) 编辑 | 泽南 「这个结果太疯狂了。」 本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqFP966sUia5mqpHib2CXm7kdicV4l3Jcy8RkHSHBMpIwZlUmRU4Ldvb4Jme4eiboct9pv6NVC2sPic6QE3gUzTL0a8cwxMjAPtSod1A/640?wxfmt=png&from=appmsgimgIndex=1) Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqFc6gKlxIPHt4ZxmcCHmn7dTRV43M7oChd0hNiclnzkDDaFIl4TG5EIF9iacdsvRJqeqyCZP3Lq0ZCuV188PY2PMcbgWRuGRMcek/640?wxfmt=png&from=appmsgimgIndex=2) 来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-22原文

相关内容