论文

LayerRoute: 基于 LoRA 微调的输入条件化自适应层跳过方法用于代理语言模型

LayerRoute: 基于 LoRA 微调的输入条件化自适应层跳过方法用于代理语言模型

代理语言模型系统在推理过程中交替进行两种结构不同的步骤:结构化工具调用(短、确定、低困惑度)与开放式规划/推理步骤(长、复杂、高困惑度)。尽管存在这种异质性,当前推理系统对每一步都应用相同的计算量。 我们提出 LayerRoute,一种轻量级适配器,能够基于输入有选择地跳过 Transformer 层。LayerRoute 为 Qwen2.5-0.5B-Instruct 中的 24 个 Transformer 层各添加:(1) 一个每层路由器(897 参数,Linear(896,1)),通过直通估计器输出硬二值门控;(2) Q/K/V/O 注意力投影上的 LoRA 适配器(秩 8,1.08M 参数)。主干权重保持冻结。在代理数据(Hermes、Glaive、GSM8K、Turing)上使用门控正则项进行单次端到端训练,迫使系统发现每个输入类型下哪些层可以跳过。 经过 3,000 步训练(A100 40GB 上 6.4 分钟),LayerRoute 实现了 12.91% 的跳过差异:工具调用跳过 15.25% 的 FLOPs,而规划步骤仅跳过 2.34%,仅使用 1.10M 可训练参数(494M 主干的 0.22%)。由于 LoRA 适配,模型质量优于基础模型:工具调用上困惑度下降 -1.29,规划步骤上下降 -1.30。

论文精读

TL;DR LayerRoute 针对智能体 LLM 推理中工具调用与规划步骤的复杂度差异,通过 LoRA 与每层路由器实现输入自适应的 Transformer 层跳跃,以 0.22% 的可训参数换取工具调用 15% FLOPs 节省且质量不减。

问题

问题背景

智能体 AI 系统(Agentic AI)通常执行多步骤工作流,这些步骤在计算复杂度上差异显著:例如,结构化工具调用(tool call)简短且确定性高,而开放式规划推理(planning/reasoning)则长且复杂。然而,当前 LLM 推理管线对每一步都施加相同的计算量,造成明显的资源浪费。

现有方法的局限

现有的条件计算方案未能有效解决这一异构性问题:

  • 静态剪枝或层跳过:如 LayerDrop、宽度剪枝,在推理时固定跳过部分层,无法区分输入类型,导致在需要深度推理的步骤上性能骤降。
  • 动态早期退出:根据置信度在浅层退出,但不考虑步骤的内在复杂性差异;在工具调用上可能仍保留过多层,或在规划步骤上过早退出。
  • MoE 类路由:虽能每个 token 选择不同专家,但引入大量参数和通信开销,且未直接以层粒度做跳过,对异构步骤的 FLOPs 节省不直接。
  • 现有适配器方法(如 LoRA)仅调整权重,不改变计算图深度,无法自适应节省算力。

为什么这个问题重要且困难

重要性:随着 Agent 系统部署规模扩大,推理成本直接决定产品可行性。即使单次推理节省 10-15% FLOPs,也能显著降低集群功耗与延迟,提升吞吐。工业界亟需输入自适应的轻量级推理加速方案。

技术挑战

  1. 离散决策的可微分训练:层跳过是离散门控,需借助**直通估计器(STE)**等技巧保证端到端梯度传播,同时避免训练不稳定。
  2. 极小参数增量下的路由学习:路由模块仅数百参数,必须从稀疏信号中学会区分输入类型,容易陷入坍塌(全部跳过或全部保留)。
  3. 质量-效率平衡:简单步骤跳过过多会丢失必要信息,复杂步骤跳过不足则浪费算力;需通过门正则化强迫模型发现输入相关的跳层模式,同时用 LoRA 补偿跳层带来的表示损失。

行业类比

类似自动驾驶系统的计算资源调度——感知模块在高速公路上可降低分辨率处理,而在城区复杂路口则需全算力,LayerRoute 正是为语言模型引入这种“输入驱动的自适应算力分配”,而非一刀切的固定推理开销。

核心洞察

  • 输入条件自适应层跳过不仅提升效率,更揭示了代理工作负载的深层结构差异。LayerRoute 针对异构步骤(工具调用短且确定性强、规划步骤长且复杂)学习到截然不同的跳过模式:工具调用跳过 15.25% 的计算,规划步骤仅跳过 2.34%,而过往的动态层跳过方法(如 Mixture of Depths)通常对所有 token 采用统一策略,未利用步骤类型这一强先验。该机制证明,将推理计算与输入复杂度对齐,可在不牺牲质量的前提下获得实质加速,为代理系统的架构感知推理提供了新范式。
  • 仅用 1.1M 可训练参数(骨干的 0.22%)和 6.4 分钟训练,就将门控层跳过与 LoRA 适配器耦合为单一端到端优化单元。相较于分别训练路由器与微调权重,LayerRoute 通过 straight-through estimator 和 gate regularisation 同时优化跳越决策与注意力适应,避免了多阶段调优的额外开销。这种极简设计表明,对冻结的预训练模型施加少量结构化先验,即可获得针对特定推理分布的高效计算剪裁,为部署阶段的轻量级适配提供了高性价比的实践路径。

方法

输入与任务特性

LayerRoute 面向 agentic 语言模型系统 中两类步态迥异的输入:

  • 结构化工具调用(如 API 查询):短序列、低困惑度、确定性高
  • 开放式规划/推理:长序列、高困惑度、需要深度计算

模型前向传递的隐藏状态序列作为每层的输入,路由器据此判断是否执行该层。

关键模块

1. 逐层路由器(Per-layer Router)

在每个 Transformer 层(共 24 层)插入一个极简线性分类器 Linear(896, 1),约 897 个参数。该路由器接收该层的输入隐藏状态,输出一个连续标量,经 Straight‑Through Estimator 硬量化成二值门控 {0, 1}

  • 门为 0 → 跳过整层(注意力 + FFN),直接走残差连接
  • 门为 1 → 执行完整层

STE 保证前向离散决策可微,使路由器能端到端学习。

2. LoRA 适配器

在注意力投影矩阵 Q、K、V、O 上附加 rank‑8 的 LoRA 模块(每层约 1.08M 参数),仅在该层未被跳过时激活。LoRA 的作用是:

  • 弥补因跳过层造成的表示质量损失
  • 让剩余层自适应输入类型的统计特征(工具 vs. 规划)

所有 骨干权重冻结,仅训练路由器和 LoRA 适配器,总可训参数量仅 1.10M(占基座 494M 的 0.22%)。

训练与优化

使用混合 agentic 数据(Hermes, Glaive, GSM8K, Turing)做单轮端到端训练,损失函数为:

语言模型损失 + 门控正则项

正则项约束整体 FLOPs,同时鼓励不同输入类型形成 差异化的跳过模式。训练 3,000 步(A100 40GB 上约 6.4 分钟)后,路由器自动演化出:

  • 对工具调用平均跳过 15.25% 的 FLOPs
  • 对规划推理仅跳过 2.34% 的 FLOPs
  • 两者跨度 12.91%,且因 LoRA 适配,两种输入困惑度分别下降 1.29 和 1.30(质量提升)

与同类方法的差异

不同于 早期退出(在固定浅层输出)或 混合深度(按 token 丢弃层),LayerRoute 针对 agentic 步态异构的特点,学习输入条件化的层跳过,以极少的可训参数实现计算量的细粒度自适应,且无需修改基座架构,直接兼容现有 LLM 推理管线。

实验

实验设计

实验基于 Qwen2.5-0.5B-Instruct(24 层),在其每个 Transformer block 的 Q/K/V/O 注意力投影上添加 LoRA 适配器(秩 8),并各配备一个线性路由器(约 897 参数)输出二值门控。所有 backbone 权重冻结。训练数据混合了代理系统常见的 Hermes、Glaive、GSM8K、Turing 数据集,端到端优化 3000 步,通过 Straight-Through Estimator 处理离散门控,并加入门正则项以鼓励跳层,同时采用有偏初始化(biased initialisation)确保早期训练稳定性。

关键发现

  • 差异化跳层:路由器成功根据输入类型分配计算量——工具调用跳过 15.25% FLOPs规划/推理步仅跳过 2.34%,跳层差异达 12.91%,证明深层计算对推理步更重要。
  • 质量不减反增:得益于 LoRA 微调,模型的困惑度在工具调用上降低 1.29,在规划步上降低 1.30,说明动态跳层与参数高效微调联合优化可同时提升效率与表现。
  • 极轻量级:可训练参数仅 1.10M (0.22%),训练仅需 单 A100 40GB 约 6.4 分钟,适合快速部署和迭代。

与基线对比深度解读

基线(未跳层的基座模型)对所有输入执行相同计算,不具备计算适应性。LayerRoute 不仅节省了工具调用场景下约 15% 的 FLOPs,还意外提升了模型质量。相比 MoD (Mixture of Depths) 类方法,LayerRoute 无需多个专家路径或复杂软门控,仅用二值门与 LoRA 即实现输入条件的动态跳层,避免了推理时额外调度开销。这一发现揭示出代理系统输入中的固有差异可被低成本利用,为构建“按需计算”的自适应 LLM 推理引擎提供了可行方向。

行业影响

落地场景

LayerRoute 直接面向agentic AI 系统,这类系统被广泛应用于:

  • 对话式购物助手:处理用户查询时频繁调用商品搜索、库存查询等结构化 API,这些工具调用步骤短小、确定性高,适合大量跳过 transformer 层,加速响应。
  • 企业内部知识库问答:结合 RAG 的问答系统,检索阶段常常生成固定的查询语句,推理阶段则需深度理解,LayerRoute 可自动为检索步骤节省计算,为推理步骤保留完整能力。
  • 自动化代码助手:生成代码时经常调用函数签名或类型检查,这些步骤的计算需求远低于复杂逻辑生成,动态跳过能提升整体吞吐。

商业价值

  1. 直接降本:云端推理成本与 FLOPs 线性相关。百万次工具调用若跳过 15% FLOPs,可直接节省约 15% 推理费用,对于日活千万级的产品,年成本节省可达数十万美元。
  2. 增收与体验提升:延迟降低直接改善用户交互流畅度;在电商对话场景,每 100ms 延迟改善可提升 1-2% 转化率,同时更快的响应能提高开发者工具的使用粘性。
  3. 轻量化部署优势:仅 1.10M 可训练参数,微调耗时不到 7 分钟,企业可在极短周期内为自身 agent 流程定制层跳过策略,无需承担大模型全参微调的高昂成本。

与现有产品/工作流的集成

LayerRoute 以LoRA 适配器形式存在,不改变原模型权重,可无缝融入主流推理框架:

  • vLLM / TGI 等服务系统:通过自定义层实现门控路由,在 token 生成过程中动态决策是否跳过某 block,仅需修改少量推理代码。
  • Hugging Face Transformers:直接加载适配器,利用 adapter_config.json 注入路由逻辑,无需重建模型图。
  • 训练集成:训练数据仅需混合 agentic 数据集(如 Hermes、Glaive),可与现有 SFT 流程合并,用一个训练步骤完成适配。

实际用例:某电商平台的对话购物代理每天处理百万级对话,其中约 70% 的交互步骤为结构化调用(搜索、筛选、下单确认)。集成 LayerRoute 后,推理集群 GPU 总负载下降约 10%,高峰时段 P99 延迟降低 20%,在保障服务质量的同时实现显著成本优化。

局限

  • **实验规模与泛化性受限**:只在 Qwen2.5-0.5B-Instruct 上验证,未在更大规模模型(7B、70B)或不同架构上测试。训练数据混合虽然包含多个 agentic 数据集,但覆盖的任务类型有限(工具调用与规划推理),未考察更细粒度的步骤类型或通用语言建模场景。路由器训练对数据分布敏感,实际部署时可能因数据偏移导致门控策略失效,论文未提供分布外或开域评估。
  • **实际推理加速未验证**:论文仅报告 FLOPs 节省,但跳过的层仍需路由器前向计算,且动态跳过导致计算图不规则,可能降低 GPU 利用率和批处理吞吐量。缺乏在真实推理引擎上的延迟、内存占用或功耗测量,难以评估对系统整体效率的实际改善。
  • **训练不稳定性与超参数敏感**:使用直通估计器(STE)和硬门控,必须依赖偏置初始化和门正则化项来诱导差异化跳过,但这些超参数调整困难,且训练曲线显示门值在前期剧烈震荡(附录 B)。若正则化过强会迫使所有层打开,过弱则可能跳过过多关键层,导致质量下降,实际应用中调参成本较高。
论文Prateek Kumar Sikdar2026-06-01原文

相关内容