北大与DeepSeek联合开源DSpark框架 大模型推理速度提升60%-85%
DSpark通过推测解码大幅提升大模型推理速度,并在GitHub开源,为高并发场景提供可落地加速方案。
北大与DeepSeek联合开源的DSpark推理加速框架,采用半自回归候选生成与置信度调度验证,让小模型先批量预判、大模型一次性校验,将单用户生成速度提升60%-85%,已部署于DeepSeek-V4预览版服务。
正文摘录
北大与DeepSeek合作 热度:80293 微博讨论摘录 1. 万维视频 :【北大与DeepSeek合作】北大与DeepSeek联合开源DSpark今日,DeepSeek联合北京大学正式发布DSpark推理加速框架,旨在解决大语言模型在高并发生产环境中的推理效率瓶颈。该框架已部署与DeepSeek-V4-Flash 与DeepSeek-V4-Pro的预览版服务引擎中,相比此前生产环境采用的token推测解码基线MTP-1,在同等吞吐量水平下可将单用户生成速度提升60%至85%。相关论文、训练代码等已在GitHub上开源。(IT之家)@万维视频 L万维视频的微博视频   2. IT九熙 :DeepSeek发布DSpark6月27日DeepSeek联合北大开源DSpark,算是把推测解码技术落地到生产环境了。简单说就是小模型先批量预判文字,大模型一次性校验,不用逐字计算,V4交互速度直接提57%-85%,吞吐最高翻4倍,还能迁移适配Qwen、Gemma多款开源模型。 它解决了老方案预判准度和速度不能兼顾的痛点,靠半自回归架构+置信度调度稳住输出质量,线上实测负载高低都稳定。但门槛很现实,跑通要8卡GPU、38TB存储,普通玩家很难本地部署,更适合企业和科研团队。 好消息是MIT协议全流程开源,给行业提供了可落地的加速基准;