MoTE: 任务专家混合用于多任务视频理解
程序性视频语言模型需要从同一视觉证据中解决异构任务,如动作识别、预测和程序预测。密集Transformer解码器在任务间共享相同的前馈网络,这可能导致任务行为纠缠,并使受控能力扩展困难。稀疏专家混合(MoE)解码器提供了条件计算,但token级学习路由并不自然地对齐任务级程序目标。 我们提出 MoTE (任务专家混合),一种解码器架构,将大语言模型的前馈网络转换为任务特定专家,同时保持多模态骨干共享。每个样本遵循一条样本级任务路由,因此激活的任务专家计算量与存储的任务专家数量无关。我们将该设计实例化为 VideoLLM-MoTE,并使用显式任务路由在 五个 COIN 基准 上进行评估。 该五专家模型每个样本激活约 2B LLM 参数,平均 top-1 准确率 高于近期 VideoLLM 基线。在相同专家拓扑下,它优于密集全专家激活和学习的稀疏路由控制。结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。
论文精读
TL;DR MoTE 将 LLM 解码器前馈网络改为任务专用专家,用样本级任务路由做稀疏计算,在 COIN 多任务视频理解上平均 top-1 准确率超过近期 VideoLLM 基线。
问题
问题背景
程序性视频理解(procedural video understanding)要求模型从同一段视频中同时支持动作识别、步骤预测、过程推理等异构任务,多任务视频语言模型(VideoLLM)成为统一处理这些需求的候选架构。
现有方法局限
- 密集解码器共享 FFN:传统 transformer 解码器在所有任务上复用同一组前馈网络(feed-forward networks),导致不同任务的梯度更新相互干扰,任务行为耦合,难以对某个任务单独扩展能力,且调试和可解释性差。
- 稀疏 MoE 的 token 级路由:近年引入的 Mixture-of-Experts 通过条件计算减少激活参数,但路由决策通常在 token 粒度上学习,与任务级目标并不对齐。这带来三个具体问题:路由不可解释、专家负载不均衡、无法提供任务级别的隔离或模块化增删能力。
为什么这个问题难/重要
多任务视频理解面临计算效率、任务隔离与可解释性的三难困境。密集模型全参数激活成本高;token 级稀疏路由虽降低计算,但丢失任务结构,使模型难以按任务扩展或裁剪。实际部署中,不同任务对时延、能力边界有不同要求,比如动作识别需要低延迟,而过程推理更看重逻辑连贯。业界对统一多任务模型的需求上升,但缺乏一种既保持共享视觉骨干、又能按任务组织解码器的稀疏化机制。MoTE 将 LLM 的 FFN 转化为任务专家,通过样本级任务路由实现“参数稀疏但任务专用”,为可扩展、可解释的多任务视频语言模型提供了新方向。
行业类比
类似在微服务架构中为不同业务拆分独立服务实例,而非在同一单体中处理全部请求,以获得更好的隔离性、独立扩缩容和故障定位能力。
核心洞察
- 任务级路由比 token 级路由更符合多任务视频理解的目标一致性。MoTE 将路由粒度从 token 提升到 sample,每个样本沿单一任务路径激活,避免了 token-level MoE 中不同 token 可能路由到不同专家导致的任务行为碎片化。与 dense 共享 FFN 相比,任务专家互相隔离,消除了跨任务参数纠缠,同时激活参数量不随存储专家数增长,实现稀疏计算与任务结构的对齐。
- 将 LLM FFN 直接改造为任务专家,提供了一种模块化能力扩展机制。通过在预训练 LLM 基础上复制或替换 FFN 为任务特定专家,可以独立添加新任务专家或移除旧专家,不影响已有任务性能。与常规 MoE 在每层增加新专家路由器不同,MoTE 的专家拓扑与任务标签绑定,专家添加/移除即对应任务能力增减,带来可解释的参数管理和部署灵活性。
- 显式任务路由作为条件信号,减少了多任务指令调优中的任务冲突。在 prompt 中显式指定任务路由或使用任务标签,模型无需从 token 分布中隐式推断任务类型,降低了路由不确定性。与 learned sparse routing 相比,显式路由在训练和推理中更稳定,避免了路由坍塌或负载不均衡问题,并在 COIN 五任务上取得了更高平均准确率。
方法
方法流程
MoTE 面向多任务视频-语言理解,输入为视频帧序列与任务指令(如动作识别、动作预测、程序步骤预测)。整体流程:
- 共享多模态骨干:视频经过视觉编码器,文本指令经 tokenizer,两者特征送入统一的 LLM backbone,负责跨模态融合与上下文建模。
- MoTE decoder blocks:将标准 Transformer decoder 中的 feed-forward networks (FFN) 替换为多个 task-specific experts。每个 expert 是一个独立 FFN,专用于一个任务。
- Task-route selection:每个训练样本根据其任务标签选择唯一 expert 进行前向计算。这一路由是样本级显式路由,而非 token 级动态路由,因此 active expert 计算量与存储的 expert 数量解耦。实验中也支持 prompt-conditioned route selection,在推理时通过 prompt 推断任务路由。
- 模块化任务专家适配:新增任务时可仅添加对应 expert 并冻结其余参数微调;移除任务时直接丢弃该 expert,不影响其他任务能力。
训练目标采用多任务联合监督:每个任务使用其自身的交叉熵损失,路由选择与任务标签对齐,避免不同任务在共享 FFN 中相互干扰。模型输出对应任务预测结果(如动作类别、未来步骤)。
工程启示:MoTE 将任务路由与高层任务目标对齐,相较于 token-level learned sparse MoE,减少了路由学习的噪声与不可控性,同时保持了稀疏计算的优势。
与同类方法的差异点:MoTE 使用任务级样本路由替代 token 级动态路由,使专家激活直接对应任务语义,提升了多任务视频-语言学习中路由的可解释性和计算效率。
实验
实验设计
MoTE 被实例化为 VideoLLM-MoTE,将 LLM 前馈网络替换为任务特定专家,保持 多模态 backbone 共享。每个样本走一条 sample-level task route,激活对应专家。在 COIN 数据集的五个 benchmark 上,使用 显式任务路由 进行评估。模型共五个专家,每样本激活约 2B LLM 参数。
关键发现
- 五专家模型平均 top-1 准确率超过近期 VideoLLM 基线。
- 在相同专家拓扑下,MoTE 优于 dense all-expert activation 和 learned sparse-routing 控制组。
- 任务级路由带来 可解释性 和 计算效率:激活参数与存储专家数无关,便于扩展。
与基线对比解读
相比 dense all-expert activation,MoTE 仅激活单一路由的专家,每样本计算量固定且更低,但准确率更高,表明任务无关的全专家激活引入了任务间干扰或浪费。相比 token-level learned routing,MoTE 使用 任务级路由 直接对齐程序性目标,避免了 token 路由与任务目标的潜在错位。此外,MoTE 支持 模块化专家添加/移除,实现可控能力扩展,这对持续学习和多任务演进有工程价值。
行业影响
落地场景
MoTE 适合多任务视频理解场景:同一段视频需要同时输出动作识别、动作预测、流程预测等结果。典型用例:
- 电商直播 / 商品视频分析:对烹饪、组装类视频实时提取步骤、预测下一步动作,自动生成商品卖点或教程摘要。
- 视频内容平台:对长视频自动打多类标签(动作类别 + 步骤预测 + 流程完整性判断),用于搜索、推荐和 AI 摘要。
- 企业内部流程质检:对标准操作流程视频做违规动作识别与流程偏离预测。
商业价值
- 降本:MoTE 每样本只激活一个任务专家,计算量不随存储专家数增长。相比 dense all-expert 激活,推理成本显著下降,可支持更多任务并行部署。
- 增收 / 体验提升:准确率高于近期 VideoLLM 基线,可为下游自动化内容生成、精准推荐提供更可靠的多任务输出。
- 模块化扩展:专家可独立增加或移除,新任务接入不影响已有任务性能,降低持续迭代的工程风险。
与现有产品 / 工作流的接口
MoTE 直接替换现有 VideoLLM decoder 中的 feed-forward network 为任务专家层,不需要改动 multimodal backbone。集成方式:
- 训练阶段:为每个任务定义显式 route,用样本级任务标签控制路由(也可使用 prompt-conditioned 路由)。
- 推理阶段:根据输入任务类型选择固定专家,无需动态 top-k 路由,部署简单、可解释性强。
- 现有 transformer 推理框架只需增加专家权重存储和路由选择逻辑,与 FlashAttention、KV cache 等优化兼容。
局限
- - **显式任务路由依赖预定义任务标签**:MoTE 采用 sample-level 任务路由,要求每个训练样本带有明确任务标签,推理时也需要知道任务类型(或通过 prompt 推断 route)。这限制了在任务边界模糊、开放式指令或零样本新任务上的应用,与 token-level learned routing 相比灵活性不足。论文虽提到 prompt-conditioned route selection,但本质上仍需预测或指定任务,对真实世界流式视频理解中的动态任务切换适应性存疑。
- - **评估范围局限于 COIN procedural 数据集**:实验仅在 COIN 五个基准上验证,COIN 是操作步骤类视频,任务定义清晰但领域单一。论文虽补充了跨数据集和跨域评估,但总体仍集中在程序性活动,未覆盖更广泛的视频问答、字幕、检索等通用视频语言任务。因此 MoTE 架构在非 procedural 多任务场景下的有效性尚未得到充分证明,其优势可能源于 COIN 任务间的低干扰特性,而非普适的架构改进。
- - **专家数量与规模扩展性未深入探索**:模型使用 5 个专家,每个样本激活约 2B LLM 参数,虽然激活参数独立于专家总数,但存储所有专家仍需大量内存,并且随着专家数量增加,训练时的任务路由、负载均衡和优化复杂度会上升。论文讨论了 expert addition/removal,但未展示大规模(如数十个专家)时的性能和训练稳定性,也缺乏与更大规模稀疏 MoE 的对比,限制了对实际部署中可扩展性的判断。