行业新闻

北大与DeepSeek联合开源DSpark框架 大模型推理速度提升60%-85%

DSpark通过推测解码大幅提升大模型推理速度,并在GitHub开源,为高并发场景提供可落地加速方案。

北大与DeepSeek联合开源的DSpark推理加速框架,采用半自回归候选生成与置信度调度验证,让小模型先批量预判、大模型一次性校验,将单用户生成速度提升60%-85%,已部署于DeepSeek-V4预览版服务。

正文摘录

北大与DeepSeek合作 热度:80293 微博讨论摘录 1. 万维视频 :【北大与DeepSeek合作】北大与DeepSeek联合开源DSpark今日,DeepSeek联合北京大学正式发布DSpark推理加速框架,旨在解决大语言模型在高并发生产环境中的推理效率瓶颈。该框架已部署与DeepSeek-V4-Flash 与DeepSeek-V4-Pro的预览版服务引擎中,相比此前生产环境采用的token推测解码基线MTP-1,在同等吞吐量水平下可将单用户生成速度提升60%至85%。相关论文、训练代码等已在GitHub上开源。(IT之家)@万维视频 L万维视频的微博视频 ![](https://tvax1.sinaimg.cn/crop.0.0.600.600.180/0089lW6tly8ibcdsc9wcaj30go0go759.jpg?KID=imgbed,tva&Expires=1782579016&ssig=DlogwkT%2BSS) ![](https://h5.sinaimg.cn/upload/108/1866/2022/11/02/svvip2.png) 2. IT九熙 :DeepSeek发布DSpark6月27日DeepSeek联合北大开源DSpark,算是把推测解码技术落地到生产环境了。简单说就是小模型先批量预判文字,大模型一次性校验,不用逐字计算,V4交互速度直接提57%-85%,吞吐最高翻4倍,还能迁移适配Qwen、Gemma多款开源模型。 它解决了老方案预判准度和速度不能兼顾的痛点,靠半自回归架构+置信度调度稳住输出质量,线上实测负载高低都稳定。但门槛很现实,跑通要8卡GPU、38TB存储,普通玩家很难本地部署,更适合企业和科研团队。 好消息是MIT协议全流程开源,给行业提供了可落地的加速基准;

阅读原文(s.weibo.com)→

行业新闻2026-06-27原文

相关内容