DeepSeek V4 推出 DSpark 推理加速框架,速度提升 60%-85%
DeepSeek 用 DSpark 把推理速度提升 60%+,关键技术是半自回归草稿和动态验证调度。
DeepSeek 推出 DSpark 投机解码框架,通过半自回归生成和置信度调度验证,在不改变输出分布的前提下大幅加速 LLM 推理。线上部署实测显示,用户生成速度提升 60%-85%。技术报告和框架 DeepSpec 已开源。
正文摘录
.993.jpg) 编辑|泽南、杨文 刚刚,DeepSeek V4 进行了一次更新。 新推出了投机解码(Speculative Decoding)框架 DSpark,并同步开源了支撑该版本的全栈推测性解码框架 DeepSpec。 DeepSeek-V4-Pro-DSpark 并非全新架构模型,而是在 DeepSeek-V4-Pro 基础上引入了推测性解码模块。此次更新的重点在于工程落地,而非模型能力本身的迭代。 DSpark 已被部署在 DeepSeek-V4(Flash 和 Pro)的真实线上流量中,大幅加速了大语言模型(LLM)的推理速度。  - 技术报告:《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》 - 技术报告链接:https://github.com/deepseek-ai/DeepSpec/blob/main/DSparkpaper.pdf DSpark 的核心初衷是解决在生产环境中(尤其是高并发场景下)LLM 推理面临的延迟和吞吐量瓶颈…