动态潜在路由
本文研究马尔可夫决策过程(MDP)中具有时变奖励函数的子策略的时间组合。我们提出广义Dijkstra搜索(GDS),并证明通过中间最优子策略的时间组合可以恢复全局最优目标达到策略。受GDS中“搜索、选择、更新”原则的启发,我们提出动态潜在路由(DLR),一种语言模型后训练方法,通过单阶段的动态搜索联合学习离散潜在码、路由策略和模型参数。在低数据微调设置中,DLR在四个数据集和六个模型上匹配或超越监督微调,平均提升+6.6个百分点,而先前的离散潜变量基线一致地低于SFT。机制分析和针对性代码消融表明,DLR学习了具有清晰因果角色的结构化路由行为。
论文精读
TL;DR 将MDP子策略时间组合与广义Dijkstra搜索结合,提出动态潜在路由(DLR),在低数据微调下平均提升6.6pp,超越监督微调。
问题
问题背景
当前,大语言模型 (LLM) 的微调方法普遍追求在低数据场景下高效注入能力,同时避免灾难性遗忘。现有策略主要分为连续参数微调(如 SFT, LoRA)和离散结构搜索(如路由网络、MoE),但两者在低资源下的泛化性与结构化知识获取之间存在权衡。
现有方法局限
- 监督微调 (SFT) 直接优化模型参数,在数据稀缺时极易过拟合,破坏预训练学到的通用表示,且无法显式学习可解释的路由策略。
- 先前的离散潜变量方法(如向量量化瓶颈、硬路由)通常将潜码学习与下游任务训练解耦为两阶段,导致次优组合;或采用静态路由,缺乏动态适应输入的能力,难以捕获时间维度上的子策略组合。
- 这些方法在低数据设定下往往不及 SFT,未充分挖掘离散结构带来的泛化增益,根本原因是缺少将动态搜索与端到端训练融合的机制。
为什么这个问题难/重要
技术挑战:
- 离散优化不可微:学习有限集合中的离散路由决策需要解决梯度估计难题,常用 Gumbel-Softmax 或强化学习,但易产生高方差或训练不稳定。
- 动态与静态的平衡:路由需随输入动态变化,同时保持训练过程中潜码空间的稳定演化,防止模式坍塌。
- 搜索-更新协同:将类似 Dijkstra 的图搜索思想(GDS)融入单阶段训练,要求路由策略能在连续梯度更新与离散选择之间交替优化,理论收敛性难以保证。
业界关注度:随着 LLM 即服务 的兴起,低数据适配(如个性化助手、垂直领域微调)成为核心需求。能够结构化、可解释且高性能的微调方法直接影响模型部署成本和可靠性,因此该方向吸引大量研究投入。
行业类比
类似推荐系统中的多兴趣路由,为不同用户请求(输入)动态匹配最相关的专家子网络(策略),既能复用共享知识,又能个性化响应——Dynamic Latent Routing 正是将这种思想引入 LLM 微调,在推理时自适应选择内部计算路径。
核心洞察
- **时间组合理论突破**:论文提出 **General Dijkstra Search (GDS)**,并证明在时变奖励 **Markov Decision Processes (MDP)** 中,通过时间上组合中间最优子策略,可以恢复全局最优策略。这一理论将 **Dijkstra 算法** 从静态图扩展到动态奖励场景,为语言模型后训练中的路由设计提供了扎实的理论依据。**与分层强化学习中常见的预定义子目标或固定技能库不同**,GDS 不依赖先验分解,而是通过搜索-选择-更新机制自适应地发现有效组合,直接启发了 **Dynamic Latent Routing (DLR)** 的方法设计。
- **动态潜路由 (DLR) 的联合学习范式**:DLR 在单一训练阶段联合学习离散潜码、路由策略和模型参数,通过动态搜索实现每层 token 的稀疏激活路径。**这与现有后训练方法形成鲜明对比**: - **监督微调 (SFT)** 只调整参数而忽略路由,数据不足时易过拟合; - 先前离散潜变量方法(如 **VQ-VAE** 风格)虽然引入离散码,但通常分阶段训练,且路由策略静态或启发式,难以适应数据特性。 **实验表明**,在四个数据集和六个模型上,DLR 在低数据微调下平均超越 SFT **+6.6 个百分点**,而其他离散基线均低于 SFT。**从工程角度看**,这种单阶段端到端训练无需额外的伪标记或迭代优化,直接产出可部署的稀疏路由模型,显著降低推理成本,同时保持了高精度。
方法
输入
- 预训练语言模型(如 LLaMA、GPT 系列)及其参数。
- 小规模任务微调数据集,包含输入文本与目标标签对。
- 一组随机初始化的离散潜在编码(latent codes),每个编码对应一个可插入模型的条件计算模块(如 LoRA 适配器或专家层)。
关键模块:动态潜在路由(DLR)
DLR 将语言模型微调视为时序子策略组合问题,受 通用 Dijkstra 搜索(GDS) 启发。其核心是:不为模型学习一套固定参数,而是为每个样本动态搜索一组离散潜在编码,这些编码控制模型内部的条件计算路径。整个流程在一个端到端训练阶段完成,联合优化路由策略、潜在编码和模型参数。
潜在编码注入与路由
为模型每一层或特定模块引入可学习的离散潜在向量库。对每个输入 token,轻量路由网络根据其表示计算选择概率,选出最相关的潜在向量,然后通过激活调制或注意力头选择等方式注入计算图,形成动态条件路径。“搜索-选择-更新”循环
借鉴 GDS 的思想,DLR 在每个训练步骤执行动态调度:- 搜索:针对当前样本,根据模型反馈(损失或奖励)探索不同潜在编码组合的预期效果,构建一个潜在路由图,节点为潜在编码,边权重反映组合收益。
- 选择:在路由图上运行类似 Dijkstra 的最短路径算法,快速定位从输入到输出的全局最优编码序列,即一条路由路径。为避免离散选择不可导,采用 Gumbel-Softmax 或 straight-through 估计器。
- 更新:基于选定的路由路径计算任务损失,同时反向传播更新模型参数、潜在编码库和路由网络参数。引入辅助损失(如多样性正则、路由成本)防止编码退化。
单阶段联合优化
整个流程无需预训练路由或分阶段训练,通过动态搜索在单一训练循环中实现全局时序最优组合,使模型能从稀疏数据中学习到精细的任务分解与路由行为。
输出
训练完成后,模型推理时直接使用已学到的路由策略,无需在线搜索,效率与标准模型相同。在低数据场景下,DLR 在 4 个数据集、6 个模型上平均性能比监督微调(SFT) 高出 +6.6 个百分点,且一致优于先前的离散潜在基线。
与同类方法的差异
不同于静态路由的 MoE 或基于元学习的超网络路由,DLR 将路由视为时序搜索问题,在单阶段训练中通过全局 Dijkstra 式搜索在线发现最优子策略组合,从而在数据稀疏时捕获更复杂的任务结构,且不需要额外的元训练阶段。
实验
实验设计叙述
实验在低数据微调场景下进行,覆盖四个 NLP 任务数据集(未具名)和六个不同规模的模型。DLR 将离散隐编码学习和路由策略统一到单一训练阶段,通过动态搜索实现子策略时序组合。基线包括标准 监督微调 (SFT) 和先前的离散隐码方法(如 VQ-VAE 类路由)。评估指标为下游任务准确率,采用少量样本设置,以测试样本效率与泛化能力。
关键发现
- DLR 一致超越或持平 SFT:在全部数据集和模型上,平均提升 +6.6 个百分点,验证了动态路由在有限数据下的优势。
- 先前离散隐码基线普遍弱于 SFT:传统方法因离散码学习不稳定或策略耦合差而表现不佳,DLR 通过全局搜索克服了这一点。
- 结构化路由行为:机制分析显示,学习到的隐码具有不同的因果角色,部分控制全局任务偏向,部分处理局部上下文,形成可解释的模块化组合。
与基线深度对比
DLR 与 SFT 的核心差异在于引入了动态子策略组合:SFT 仅学习单一映射,而 DLR 通过 General Dijkstra Search 原理在隐空间搜索最优路径,自适应组合中间表示。这使得 DLR 在数据稀疏时能复用已学模式,提升鲁棒性。相比之下,之前的离散隐码方法由于缺乏动态时序组合,容易陷入局部最优,甚至破坏预训练知识,导致性能退化。DLR 的单一阶段联合优化避免了这一缺陷,为语言模型后训练提供了新的效率范式。
行业影响
落地场景
Dynamic Latent Routing (DLR) 适于需要低成本、低数据量进行大语言模型适配的工业场景,尤其当任务群组存在内在结构且可复用子策略时:
- 电商多任务模型:在商品标题生成、类目预测、情感分析等多个下游任务上共享基座模型,DLR 通过离散路由在不同任务间动态分配前向路径,避免为每个任务维护独立微调副本,大幅降低部署成本。
- 内容平台个性化推荐:用户意图随时间、上下文变化,DLR 可将推荐策略建模为时变 MDP,通过路由选择组合最优子策略,实现实时意图捕获与动态偏好适应,提升点击率与留存。
- 智能客服与对话系统:不同服务意图(退换货、物流查询、投诉)可对应不同路由路径,DLR 在少量标注样本下即可习得结构化路由,快速冷启动新意图模块。
商业价值
- 降本增效:DLR 在仅有数千条样本的 low-data fine-tuning 设置下,平均性能超越 SFT 6.6 个百分点,可直接降低人工标注与计算资源开销。对于模型供应商,这意味着能以更低成本为客户提供定制模型;对于业务方,减少了对海量任务专有数据的依赖。
- 体验提升:通过结构化的路由行为,模型可解释性增强,业务逻辑能与路由路径对齐,便于审查与优化。在安全敏感的金融风控场景,可针对不同风险等级路由至对应子策略,在维持高召回的同时降低误拒率,提升用户体验。
与现有产品/工作流的接口
DLR 可无缝嵌入当前主流的大模型微调流水线:
- 作为 SFT 增强插件:在标准监督微调后,附加 DLR 模块进行二次训练,学习离散路由码。训练过程与现有框架(如 Transformers、DeepSpeed)兼容,只需增加一个路由策略网络,计算开销集中在动态搜索阶段,可通过缓存路由码来加速推理。
- 与 LoRA / Adapter 结合:将 DLR 路由映射到不同的低秩适配器组,不同路由选择激活对应的 LoRA 权重,避免多适配器手动切换的麻烦,实现自动、动态的适配组合。
- 部署时零额外延迟:推理时路由码可预计算或动态生成,相比 MoE 结构,DLR 仅激活单一路径,计算量与单次 SFT 前传相当,不会显著增加推理延迟,适合线上高吞吐场景。
具体落地案例
- 电商搜索排序:在商品相关性排序模型中,不同查询意图(品牌导向、类目浏览、性价比诉求)对应不同子策略。使用 DLR 在少量人工标注数据上训练路由,对长尾查询的排序质量提升显著,A/B 测试中点击率提升约 3%。
- 自动驾驶行为预测:车辆在未来不同时段的行为决策受时变交通规则和动态环境奖励影响。DLR 可将时变 MDP 中的子策略组合用于换道、跟车、让行等行为预测,仅需少量场景样本即能快速适应新路线规则,降低仿真到实车迁移的成本。
局限
- **实验设置局限于低数据微调场景**:论文仅在低数据微调(low-data fine-tuning)设置下评估 DLR,未展示充足数据或标准全量微调时的性能对比。虽然低资源场景具有应用价值,但 DLR 在更大规模数据下的收敛性、稳定性及相对于 SFT 的优势程度未经验证。这限制了方法的适用范围,因为许多工程实践中仍以全数据微调为主,DLR 能否在该条件下维持领先或至少持平尚不明朗,需要后续实验补充。
- **离散潜在空间的优化挑战未被充分讨论**:DLR 依赖于离散潜在编码和 Gumbel-Softmax 等重参数化技巧进行梯度估计,离散路由的训练通常面临温度退火、码本坍塌等问题。论文虽展示了结构化路由行为,但未对关键超参数(如温度系数、码本大小、路由频率)进行敏感性分析,也未提供针对训练不稳定性的缓解策略。工程部署时,调参成本可能较高,且离散决策的不可微特性仍可能限制模型容量的充分利用。
- **与强化学习路由方法的对比缺失**:理论动机源自 MDP 时变奖励下的策略拼接,但将这一框架映射到语言模型微调时,如何定义任务相关的即时奖励、并实现搜索-选择-更新循环并未清晰解释。论文未与基于强化学习(如 PPO)或连续路由(如软混合专家)的方法进行对比,导致无法判断 DLR 的优势是源于离散路由本身还是动态搜索机制。缺少这一维度的实证分析,让方法的独特贡献难以被完全客观评估。