行业新闻

阶跃星辰开源 JetSpec,大模型解码速度提升近10倍

JetSpec用因果并行树提高token接受率,让大模型推理加速近10倍,是Agent规模化落地的关键技术。

阶跃星辰提出JetSpec投机解码方法,通过因果并行树生成更多有效token,在Qwen3-8B上实现最高9.64倍端到端加速。在数学、代码、对话任务上均显著优于现有方法,有助于降低Agent场景的推理延迟。

正文摘录

近期,DeepSeek 推出投机解码框架 DSpark,让大模型推理效率再次成为行业焦点。 几乎同一时间,另一大模型基座代表阶跃星辰提出了 JetSpec ,也把问题指向了同一个方向:当模型开始被 Agent 高频调用,智能能不能更快、更稳定输出出来? ![](https://image.jiqizhixin.com/uploads/article/coverimage/9b637638-7d1b-4f36-b463-25991ac447c6/04(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqETZ9x2PwKib1aKQtPicWmDhsT7Coj2oyyXGhJqiapicCu93TM6NL4PSzcD6wYfvmqnzpEUJBhstrsTKuzwWN6zGWgKxIicnkGW0Jps/640?wxfmt=png&from=appmsgimgIndex=1) - JetSpec 项目地址:https://jetspec-project.github.io/jetspec-web/ - 论文地址:https://arxiv.org/abs/2606.18394 - 开源地址:https://github.com/hao-ai-lab/JetSpec 简单来说,DSpark 更关注推理服务中的验证效率,JetSpec 则从 Draft 生成本身入手,用因果并行树生成提高一次验证能接受的 Token 数。前者是在系统层面减少无效计算,后者是在算法层面提高有效 Token 生成率。 从结果来看,DSpark 展示了推理服务在生产系统中仍有 60%-85%(Flash 模型)和 57%-78%(Pro 模型)的速度提升空间。JetSpec 则从算法侧给出了一组更直接的加速结果。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-30原文

相关内容