论文

Maestro:强化学习编排分层模型-技能集成体

Maestro:强化学习编排分层模型-技能集成体

大型语言模型(LLM)和模块化技能的激增赋予了自主代理越来越强大的能力。然而,现有框架通常依赖单一 LLM 和固定逻辑来与这些技能交互,导致关键瓶颈:不同 LLM 在不同领域具有独特优势,但当前框架未能利用模型和技能的互补优势,从而限制了下游任务的性能。 本文提出 Maestro(多模态专家技能目标强化编排代理),一种基于强化学习(RL)的编排框架,将异构多模态任务重新定义为在分层模型-技能注册表上的顺序决策过程。Maestro 训练一个轻量级策略,动态组合冻结的专家模型和两级技能库,每步决定是否调用外部专家、选择哪个模型-技能对以及何时终止。策略通过结果导向的 RL 优化,无需步骤级监督。 我们在十个代表性多模态基准上评估 Maestro,涵盖数学推理、图表理解、高分辨率感知和领域特定分析。仅用 4B 编排器,Maestro 平均准确率达 70.1%,超越 GPT-5(69.3%) 和 Gemini-2.5-Pro(68.7%)。关键的是,学到的协调策略无需重新训练即可泛化到未见模型和技能:用域外专家扩充注册表后,在四个挑战性基准上获得 59.5% 平均准确率,优于所有闭源基线。Maestro 还保持了低延迟的高计算效率。 代码开源:https://github.com/jinyangwu/Maestro

论文精读

TL;DR Maestro 用强化学习训练小型调度器,动态编排异构模型与技能库,以极低成本超越 GPT-5 等超大模型,并无需重训练即可泛化到新组件。

问题

问题背景

当前自主代理(autonomous agents)的性能高度依赖大型语言模型(LLM)与模块化技能(modular skills)的有效集成。业界正从单一模型打天下转向组合多个专家模型与工具,以应对日益复杂的多模态任务。

现有方法局限

主流框架(如 LangChain、AutoGPT)仍采用 单一 LLM 作为中央控制器,搭配固定规则(fixed logic)调用技能。这种架构存在明显瓶颈:

  • 模型能力单一:不同 LLM 在各领域(数学推理、图表理解、高分辨率感知等)优势各异,但单一模型无法同时精通所有场景;
  • 调度逻辑僵化:固定的 if-else 流程或静态模板无法根据任务上下文动态切换最合适的模型-技能组合;
  • 扩展性差:新增专家模型或技能需重写大量胶水代码,且无法自动学习最优调用策略。

为什么这个问题难且重要

技术挑战在于:异构模型与技能构成一个庞大的组合动作空间,如何让智能体每一步都决策该调用哪个外部专家、选择哪对模型-技能、何时终止,且整个过程缺乏逐步监督信号。这本质上是一个序列决策问题,需要与环境交互来探索最优编排。业界高度关注,因为多模态代理落地(如医疗影像问答、机器人控制)亟需超越单一模型的性能上限,同时控制计算开销。

行业类比

这类似于 AI 代理的操作系统调度器:正如操作系统根据任务类型动态分配 CPU/GPU 资源,Maestro 的 RL 策略动态编排专家模型与技能,实现“什么任务用什么组合”的最优匹配。

核心洞察

  • **基于结果的强化学习** 使编排器无需步骤级监督即可学习任务自适应的模型-技能组合。与依赖固定规则或监督微调的工具调用范式不同,Maestro 将多模态任务编排建模为在层次化注册表上的序列决策过程,仅通过最终任务奖励优化轻量策略。这避免了昂贵的人工步骤标注,同时允许策略自主发现最优的调用顺序与组合,从而在复杂推理和感知任务上超越单一超大模型。
  • 编排策略对**未见专家和技能的强泛化能力**。学到的策略并非简单记忆特定的模型-技能对,而是习得了一种“何时调用外部专家、选择何种技能”的元决策能力。因此当注册表中加入全新领域的模型或技能时,**无需任何重训**即可有效利用新增能力,这在开放、持续演进的智能体应用场景中,比任何静态路由或随能力更新就需重新训练的集成方法都更具工程可扩展性。

方法

输入与任务建模

Maestro 接收多模态任务输入(文本、图像等),并维护一个层次化模型-技能注册表:其中包含多个冻结的专家模型(如不同规模的 LLM 和视觉专家)以及一个两层技能库(基础技能 S1–S5 和可扩展技能 S6–S9)。任务被建模为顺序决策过程:每步通过策略决定调用哪个外部专家和哪项技能,组合成 模型-技能对 执行,直到终止。

核心模块:策略与 RL 优化

  • 轻量级策略网络:基于当前任务状态和注册表信息,输出下一步要选择的模型-技能对或终止信号。为支持大规模组合动作空间,引入层次化动作压缩,先选择专家模型再选择技能,减少探索难度。
  • RL 训练:采用结果驱动奖励(任务最终成功与否、中间推理质量等),无需步骤级监督。使用Token 级策略梯度,并对每个时间步动作空间施加掩码以屏蔽无效组合(如不兼容的模型-技能对)。奖励由多维度函数建模,平衡任务完成度、执行效率等。
  • 上下文转换:每步执行后,获得的子结果追加到上下文,策略继续决策,直至终止。

输出与部署

策略在推理时即时组合专家与技能,动态调度资源。无需修改冻结的专家模型,可即插即用新增专家或技能,而无需重新训练(通过掩码适配新的模型-技能兼容性)。

与同类方法的差异:Maestro 使用 RL 学习动态编排策略,而非依赖固定逻辑或让单一 LLM 承担所有子任务,能利用异构模型的互补优势,并以轻量级策略实现低延迟的高效协作。

实验

实验设计

10 个覆盖数学推理、图表理解、高分辨率感知与领域分析的多模态基准上评估 Maestro。训练一个 4B 参数量的轻量级策略网络,通过 基于结果的强化学习 优化序贯决策,无需步骤级监督。对比基线包括 GPT-5、Gemini-2.5-Pro 等顶尖闭源模型,以及固定路由策略的消融变体。实验涵盖 域内表现、域外泛化、未见专家/技能扩展、效率与消融

关键发现

  • 性能超越巨型模型:仅用 4B 编排器,平均准确率 70.1%,分别超过 GPT-5 (+0.8%) 与 Gemini-2.5-Pro (+1.4%)。
  • 强域外泛化:在 4 个挑战性域外基准上平均 59.5%,优于所有闭源基线,证明策略学到了可迁移的编排知识。
  • 即插即用扩展:动态加入全新专家与技能时,无需重新训练,准确率仍可提升。
  • 计算效率:低延迟与低 token 消耗,保持实用部署价值。

与基线的深度对比

传统框架依赖 单一 LLM 与固化逻辑,无法利用不同模型在特定领域的互补优势。Maestro 将任务转化为 分层模型-技能注册表 上的序列决策,RL 优化让编排策略学会何时调用外部专家、选择哪对模型-技能、何时终止。相比同等甚至更大参数量的单体模型,组合式专家的动态集成 带来了显著增益。消融实验证实:分层动作空间设计多维奖励建模(任务正确性、效率、资源成本)是性能核心,去除任一组分均导致准确率下滑。该结果揭示了 任务感知的模型-技能协作 比盲目扩大模型规模更具性价比,为构建可扩展、可进化的 Agent 系统提供了新范式。

行业影响

落地场景

Maestro 的模型-技能动态编排能力,可直接赋能需要复杂多模态推理的工业级产品:

  • 智能客服与支持系统:处理用户上传的截图、图表、数学公式、产品图片等多模态工单,自动调度 OCR、图表解析、几何推理等专家技能与最匹配的模型,大幅提升首次解决率。
  • 内容创作与审核平台:面对图文混排的广告物料、商品描述,系统自动调用感知模型检测物体、理解场景,再由 Python 代码生成器或图表专家进行合规分析,减少人工介入。
  • 医疗影像与报告分析:结合高分辨率感知专家、科学推理技能,以较低计算开销动态处理不同模态的医学数据(X 光片、病理图、文本报告),辅助诊断决策。
  • 金融研究自动化:分析包含复杂表格、数值趋势的财报 PDF,编排图表理解技能、数学推理模型,生成摘要或异常检测,提升投研效率。

商业价值

  • 降本:4B 轻量编排器胜过大体量闭源模型(GPT-5、Gemini-2.5-Pro),总参数量与 FLOPs 显著更低,单次调用 token 消耗少,推理延迟可控(论文中延迟约 3~5 秒),可大幅减少 API 费用或 GPU 资源占用。
  • 增收与体验提升:70.1% 的平均准确率超过最强闭源模型;动态选择专家带来任务级最优组合,避免单一通用模型的性能妥协。可扩展至新领域(OOD 59.5% 准确率)且无需重训,加速产品迭代,提升用户满意度与留存。
  • 屏蔽生态绑定:支持开源专家池、即插即用,下游供应商可自由替换或扩展模型与技能,降低对单一供应商的依赖风险。

现有产品/工作流集成

Maestro 以轻量 RL 策略形式提供,非常适合作为 “模型路由器”或“技能编排中间件” 嵌入现有 AI 代理框架:

  • 与 LLMOps 平台对接:通过 API 封装为 model-skill orchestrator 服务,接收任务描述,返回最佳模型与技能组合。可集成到 LangChain / AutoGen / Semantic Kernel 等代理框架的策略节点,替换固定路由逻辑。
  • 微服务架构兼容:状态性顺序决策(POMDP)适合部署为有状态 service,训练好的策略模型可用 TensorFlow Serving 或 vLLM 加载,通过 gRPC 与上游产品交互。
  • 具体用例
    • 全球电商商品发布系统:用户上传任意格式的商品图与参数表 → Maestro 触发 OCR 技能提取文字 → 场景感知技能确认实物属性 → 图表技能解析规格对比图 → 最后用通用 LLM 总结并填入表单。整个过程动态适配不同品类,准确率高且延迟低。
    • 在线编程教育作业批改:学生提交包含示意图、手写公式、代码片段的作业 → Maestro 依次调用几何解题器、图表解题器、Python 代码执行器,由 RL 策略决定何时汇总评分,避免为每个学科定制单一模型,系统通用性极强。

启示:Maestro 证明了“小模型编排队 + 专家群”的范式在成本、性能、扩展性上全面优于追求巨型单体模型,为工业界构建模块化、可演进的智能体系统提供了明确路径。

局限

  • **技能描述依赖性** 较高,层次化技能库的构建依赖人工设计与领域知识,编排策略的性能对技能描述的质量和覆盖度敏感。论文在附录 G.4 中验证了描述变动后性能的波动性,并指出微调可恢复,但未提供自动化技能发现或描述优化的机制。在开放域或动态变化的任务中,这一人工设计瓶颈会显著增加维护成本,限制系统的即插即用泛化能力。
  • **稀疏奖励下的 RL 训练稳定性** 未充分讨论。策略仅接收最终 outcome 作为奖励,缺乏中间步骤的监督信号,可能导致训练收敛缓慢或陷入局部最优。方法部分提及 token-level 策略梯度与 masking,但未分析稀疏奖励带来的高方差问题、所需的训练样本量或收敛曲线。对于长序列决策场景,稀疏信号可能使策略难以学习有效编排,限制了在更复杂 agentic 任务中的实用价值。
  • **小模型 orchestrator 的容量上限** 可能成为扩展瓶颈。4B 参数的轻量策略虽保障了低延迟与成本,但其推理能力有限,尤其在面临大规模异构技能池或需要深层多步规划的任务时,可能无法最优地组合专家模型。论文虽展示了一定的 scaling 分析,但未涉及极限技能数量下的性能退化,也未对比更大 orchestrator 带来的增益,这为实际超大系统部署留下了不确定性。
论文Jinyang Wu2026-05-21原文

相关内容