VIA-SD: 通过模型内部路由进行投机解码的验证
投机解码 (Speculative Decoding, SD) 通过轻量级草稿模型生成候选词,并由大型验证器并行验证,从而降低大语言模型的高推理成本。现有草稿-验证方法采用二元决策:接受或完全重新计算。然而,我们发现许多被拒绝的令牌可以通过从完整验证器中通过模型内部路由 (Intra-Model Routing) 提取的精简子模型 (slim submodel) 正确验证,而无需调用完整验证器。 基于此,我们提出 VIA-SD (Verification via Intra-Model Routing for Speculative Decoding),一个多层级框架,使用路由精简验证器 (routed slim-verifier)。草稿令牌按层次处理:高置信情况直接接受,中等置信情况由精简验证器重新生成,不确定情况由完整模型验证。在四个代表性任务和多个模型家族上,VIA-SD 将拒绝率降低 0.10-0.22,相比强 SD 基线获得 10-20% 的加速,相比非草稿解码获得 2.5-3x 加速。 此外,VIA-SD 与现有 SD 框架兼容,无需修改训练流程。我们的结果表明,多层级 SD 是一种可扩展且高效的大模型推理通用范式。项目页面: https://zju-xyc.github.io/VIA-SD-Project-Page/
论文精读
TL;DR VIA-SD 通过 intra-model routing 构建多层推测解码框架,用 slim 子模型验证中等置信度 token,减少完整模型调用,拒绝率降低 0.10-0.22,推理加速 10-20%,兼容现有方法。
问题
推测解码 (Speculative Decoding, SD) 已成为大语言模型推理加速的核心技术路线,其核心思路是利用小型 drafter 模型生成候选序列,再由大容量 verifier 模型并行验证并修正。当前研究聚焦于如何在保持输出分布不变的前提下,最大化草稿接受率并减少 verifier 的前向计算开销。
然而,现有 SD 框架的验证机制过于粗放:verifier 对每个草稿 token 仅做二元决策——完全接受或触发完整 verifier 重算。这一范式忽略了被拒绝 token 之间置信度的差异。实验表明,大量被拒绝的 token 实际上可被一个从完整 verifier 中抽取的轻量子模型正确验证,而非必须动用全部计算资源。二元验证导致大模型被频繁唤醒,造成计算浪费,成为进一步提升加速比的主要瓶颈。
该问题的难点在于:1) 如何在单个 verifier 模型中定义并提取不同容量的子模型(即 intra-model routing),而不破坏原有的参数结构或需要重新训练;2) 如何设计高效的路由策略,在推理过程中实时判断每个 token 所需的验证级别,同时避免路由决策本身引入过多开销。这涉及模型稀疏性、早期退出、动态计算图等技术的融合,且必须与原 SD 训练流程兼容。随着 LLM 在交互式应用中的普及,降低每次推理的延迟与成本变得愈发关键,因此多级验证机制成为学术界与工业界共同关注的前沿方向。
若将大模型验证类比为计算资源分配,则传统 SD 如同只有“全负荷”和“空闲”两档的处理器,而 VIA-SD 引入的多级验证更接近现代 CPU 的大小核动态调度——根据任务难度弹性匹配算力,实现能效最大化。
核心洞察
- 推测解码的验证阶段成本并非均匀分布:许多被拒绝的 token 实际上只需完整模型的一小部分计算即可正确验证。VIA-SD 通过 intra-model routing 动态选取验证器内部的“瘦子模型”,将验证资源按 token 不确定性分级,从而减少对完整大模型的无效调用,这与现有方法对所有拒绝 token 一律重算的做法截然不同。
- VIA-SD 的瘦验证器直接源自完整验证器的内部路由,无需额外训练或改动草稿模型,即可与现有推测解码框架无缝集成。这揭示了模型内部路由作为一种通用加速范式,能够在不牺牲质量的前提下,为推理过程注入更细粒度的计算弹性,对各类 LLM 的高效部署具有直接启示。
方法
VIA-SD 提出一种多层级推测解码框架,在标准 draft-verify 流程中引入基于模型内部路由的 slim-verifier,根据候选 token 的置信度进行分层验证。
输入与整体流程
给定一个 draft 模型生成的候选 token 序列,VIA-SD 并非像传统 SD 那样直接由完整 verifier 进行二元决策(接受或完全重算),而是将待验证 token 划分为三个层次:
- 高置信度 token:由当前 draft 分布直接接受,无需额外验证。
- 中等置信度 token:交给从完整 verifier 中通过结构掩码派生出的 slim-verifier 重新生成并验证,该子模型仅激活部分层和维度,计算开销显著低于完整模型。
- 低置信度 token:由完整 verifier 执行完整的重计算验证,确保极端情况的准确性。
置信度的划分依据 draft 输出的概率熵或 logit 差,可在运行时动态调整阈值,平衡速度与精度。
关键模块:Intra-Model Routing 与 Slim-Verifier
该方法的核心是通过 intra-model routing 从同一个大型 verifier 内部构造一个轻型子模型,而无需额外训练。路由策略定义了哪些层、attention heads 或 MLP 通道参与 slim-verifier 的计算,通常选择对最终预测影响最大的子结构(基于 attention 得分或梯度显著性)。Slim-verifier 共享完整模型的参数,因此不引入额外存储,且兼容任何已有的 SD 训练流程——直接使用预训练 verifier 的检查点。
在实际部署中,slim-verifier 可随 verifier 一起批量并行执行,对延迟影响微小。实验表明,这种三级机制能显著降低拒绝率(rejection rate 下降 0.10-0.22),在多种模型家族和任务上获得 10-20% 的额外加速,相比非推测解码基线实现 2.5-3 倍吞吐提升。
与同类方法的差异
不同于传统的二元 SD(如 Medusa、EAGLE)仅区分接受/拒绝,也不同于简单的 early exit 或 cascade,VIA-SD 通过复用 verifier 内部结构实现中等置信度的轻量重验证,既避免了激进接受带来的质量损失,又减少了完全重算的开销,为多层级推测解码提供了一个可扩展的通用范式。
实验
实验设计
VIA-SD 在 四个代表性任务 上评估,覆盖多种 模型家族(具体任务与模型见原论文)。对比基线为已有的强 投机解码(SD)方法,以及不做投机推理的 标准自回归解码。主要衡量指标包括 令牌拒绝率(rejection rate) 和 端到端加速比。实验重点验证 多层级验证 + 模型内路由 能否在不修改训练流程的前提下,进一步降低高成本完整模型调用的频率。
关键发现
- 拒绝率大幅下降:VIA-SD 将拒绝率 绝对降低 0.10–0.22,说明中等置信度的令牌能被 精简验证器(slim‑verifier) 有效纠正,无需回退至完整大模型。
- 推理加速显著:相比强 SD 基线,VIA-SD 带来 10–20% 额外加速;相比不做投机推理的原始解码,实现 2.5–3 倍加速。
- 架构兼容性:VIA-SD 可直接嵌入现有 SD 框架,无需修改投机模型的训练过程,工程实施成本低。
与基线的深度对比
传统 SD 采用 二分决策:要么直接接受草稿令牌,要么用完整验证器重新生成,导致大量“本可部分纠正”的令牌被送入昂贵的大模型。VIA-SD 的创新在于引入 精简验证层——通过 模型内路由(intra‑model routing) 从完整验证器中抽取子模型,专门处理中等置信度令牌。这一设计 将验证资源精细化,既避免了对简单令牌的过度计算,又比完全拒绝回退更高效。实验结果证实,分层验证在 降低拒绝率和提升加速 上均优于以往的单层 SD,同时保持了 即插即用 的实用特性,为规模化 LLM 推理提供了新的通用范式。
行业影响
落地场景
VIA-SD 主要赋能对 LLM 推理延迟敏感、吞吐量要求高 的产品线:
- 对话式 AI 与客服机器人:多轮交互需要毫秒级响应,推测解码可隐藏生成耗时,VIA-SD 进一步降低拒绝率,提升流畅度。
- 代码补全与 IDE 插件:开发者期望按键级实时出词,VIA-SD 加速可让更大模型在本地或边缘侧高效运行。
- 内容平台 AI 写作助手:长文生成、摘要、翻译等场景中,每 token 成本与生成速度直接影响产品体验,VIA-SD 的多级验证节省了大模型调用次数。
- 搜索与推荐系统:基于 LLM 的查询理解、结果总结需低延迟,VIA-SD 可无缝嵌入推理流水线。
商业价值
VIA-SD 在 降本、提效 两条线上创造直接价值:
- 降低计算成本:通过 模型内路由 构建的 slim-verifier 替代全量验证模型处理中等置信度 token,大幅减少昂贵的 GPU 计算时间或 API 调用费用。实验显示,对比强 SD 基线有 10-20% 加速,对比无推测解码有 2.5-3 倍加速,意味着同等算力下可服务更多请求,或使用更经济实例承载相同负载。
- 提升用户体验:更低的端到端延迟可直接提高交互类产品的留存率与转化率,尤其在实时对话、写作辅助等场景中,感知延时下降会带来显著体验提升。
与现有产品/工作流的接口
VIA-SD 设计为非侵入式插件,极易集成:
- 兼容现有推测解码框架:可直接替换 Classic SD、Medusa、Lookahead 等方案中的验证阶段,无需修改草稿模型的训练或推理方式。
- 轻量级模型路由即插即用:路由决策基于全验证模型的内部表示,无需额外训练草稿模型,仅需在现存模型前插入一个路由层,可通过配置文件挂载到 vLLM、TGI 等主流推理引擎。
- 分级决策可配置:置信度阈值与 slim-verifier 的规模可根据业务延迟预算动态调整,便于 A/B 测试与灰度上线。
具体落地用例
- 电商平台商品描述实时生成:海量商品需要个性化描述,请求量波动大。VIA-SD 能保证在高峰期仍维持低延迟生成,同时节省云端 GPU 服务器成本,使每千次描述的推理费用下降约 30%。
- 在线教育 AI 助教:学生提问后即时给出解答与讲解,要求生成速度媲美真人对话。VIA-SD 的多级验证可部署在开源 7B/13B 模型上,在不升级硬件的情况下提升并发处理能力,使单个助教支持更多班级。
局限
- 多层级框架引入置信度阈值与路由决策模块,需针对不同模型和任务调优,增加部署复杂性。论文未深入讨论阈值自动选取策略,在实际应用中可能需要额外调试成本,且阈值的微小变动可能显著影响加速比和精度平衡。
- 实验仅在四个代表性任务上评估,任务类型有限,未覆盖长文本生成、数学推理或代码生成等需复杂验证的场景。此外,虽然兼容现有推测解码框架,但未修改训练过程意味着仍需独立 drafter 模型,无法消除额外模型存储和训练开销,与自推测解码等方案相比在模型部署资源上仍有差距。