论文

SciOrch:学习编排专家 LLM 以解决前沿多模态科学推理任务

SciOrch:学习编排专家 LLM 以解决前沿多模态科学推理任务

前沿科学推理仍是大型语言模型(LLM)的重大挑战,即使最强大的商业系统也达不到专家级性能。深入观察模型行为发现,单一模型评估掩盖了实质性的互补性:不同前沿模型擅长不同问题类型,没有任何单一模型能覆盖全局。 我们提出 SciOrch 框架,训练一个轻量级 8B 模型编排前沿 LLM 进行科学推理。编排器分解问题,通过 API 调用将子问题委派给选定的商业模型,并合成最终答案。编排器训练相比常规智能体强化学习更困难:每个动作触发一次昂贵(成本和延迟)的 API 调用,使标准的在线 rollout 不可行。为此我们采用 MCTS 方法生成多样化编排轨迹,提取每节点单步样本,并利用 GRPO 样式的训练优化编排器。 在包含 SGI-Reasoning 和 Scientists' First Exam 的 240 题测试集上,SciOrch 达到 56.66% 平均准确率,超过最强单一商业模型 3.74%,超过最强多智能体基线 3.33%。同时它在两个数据集上均达到最佳准确率,API 成本不到典型多智能体方法的一半。

论文精读

TL;DR SciOrch 训练 8B 编排器,通过 MCTS 与 GRPO 学习调度多个前沿 LLM 协同推理,在科学推理任务上准确率超越最强单模型 3.74%,成本不到典型多智能体方法一半。

问题

问题背景

前沿科学推理(如物理、生物、化学的开放性难题)对 LLM 仍是硬骨头——即便是最强商业模型也远未达到专家级精度,且单一模型在不同子领域表现参差不齐,隐藏了模型间的互补潜力。

现有方法局限

当前主流方案存在三类瓶颈:

  1. 单模型依赖:仅用某一个最强模型,无视不同模型在抽象推理、符号计算、多模态对齐等维度上的优势差异,导致上限受制于单一模型的能力边界。
  2. 多代理手动编排:虽尝试组合多模型,但路由规则与融合逻辑靠人工设计,扩展性差,无法自适应问题的异构性。
  3. 在线强化学习训练不可行:直接训练一个策略模型来动态调用 API,每一步动作都触发昂贵的外部调用(金钱与延迟),导致标准 rollout 采集成本爆炸,无法通过试错优化。

为什么这个问题难且重要

难点在于离线生成高质量、多样化的协作轨迹:既要让编排器学会识别问题类型并分派子任务,又必须控制 API 调用次数以节约成本。技术上需要平衡探索与利用,同时面对科学问题长上下文、多模态输入、开放答案的挑战。业界高度关注的原因:

  • 降低顶尖模型的实际使用门槛,将多模型协作从“奢侈试错”变为“可部署工程”;
  • 科学推理是 LLM 迈向可靠辅助科研的试金石,能直接提升文献理解、实验设计、假设验证等环节的效率;
  • 若能用小模型枢轴调度大模型,可大幅节约推理成本,启发更经济的 LLM 系统设计。

行业类比

这类似微服务架构中使用 API 网关 + 轻量路由层 替代直连单一后端:网关根据请求特征分配不同服务,既复用各服务的优势又能整体降本,与 SciOrch 用小模型编排多个前沿 LLM 的思路异曲同工。

核心洞察

  • **揭示前沿模型的互补性,挑战单模型最优假设:** SciOrch 通过细粒度问题类型分析,发现 GPT-4o、Claude 3.5 Sonnet 等前沿模型在不同科学推理子任务上各有所长——例如某模型在数学推导上领先,但在图表理解上逊于另一模型。这打破了基准测试中仅看平均得分的惯例,证明多模型协同的潜力大于任意单体,为多智能体系统提供了直接证据。
  • **用 MCTS 生成离线训练轨迹,绕过在线 API 交互的成本与延迟瓶颈:** 传统基于 RL 的智能体训练需要实时调用 LLM API 进行 rollout,开销巨大且难以扩展。SciOrch 改用 MCTS 预先采样多样化的编排路径,再从中提取单步决策样本进行 GRPO 优化,将高成本的在线交互转化为离线训练。这一做法显著降低了 API 费用(实验中仅花费典型多智能体方法的 45% 左右),同时让 8B 级轻量模型也能习得复杂调度策略。
  • **轻量级协调器实现高效知识整合,替代重量级融合方法:** 与直接使用超大模型或多轮辩论等昂贵的融合方案不同,SciOrch 仅用 8B 参数的模型作为调度核心,通过将问题分解、子问题路由及答案合成转化为序列决策任务,在不依赖模型内部修改的前提下,达到了比任何单体模型及多智能体基线更高的准确率(56.66%),证明了小模型在元认知层面的强大潜力。

方法

输入与问题建模

SciOrch 接收多模态科学推理问题(文本 + 图像 + 表格),问题涉及学科交叉、需多步推理。框架将问题求解建模为API 协调决策过程:协调器需判断问题如何拆解、子问题分配给哪些商用 LLM、答案如何整合。

关键模块:协调器训练

协调器是一个 8B 参数轻量模型,采用 MCTS(蒙特卡洛树搜索) 在离线环境中生成多样化协调轨迹,每条轨迹记录每一步推理动作(拆解/调用/合成)及结果。为解决直接在线 RL 交互代价过高的问题,该方法从 MCTS 树中提取单节点交互样本,构建监督数据集,再以 GRPO(Group Relative Policy Optimization)风格训练优化协调策略。GRPO 在近端策略优化(PPO)基础上引入分组相对优势,使训练更稳定,同时兼容离策略样本。训练时,协调器学习三个核心技能:

  • 问题分解:将复杂问题拆为可独立求解的子任务。
  • 模型选择:根据问题特征(如数学推导、图表理解)动态调用最适合的前沿模型(如 Claude、GPT-4o)。
  • 答案合成:聚合多模型输出,消解矛盾并给出最终答案。

输出与推理

训练完成后,协调器在推理时无需额外 RL 交互,直接对输入问题生成协调计划,通过 API 调用模型并输出最终答案,从而大幅降低延迟和成本。测试集 SGI-ReasoningScientists' First Exam 共 240 题,结果达 56.66% 平均准确率,API 成本仅为典型多智能体基线的一半以下。

与同类方法的差异

不同于基于静态拆分或固定路由表的多智能体系统,SciOrch 通过 MCTS+GRPO 训练协调器学习自适应决策,能根据问题类型动态组合不同模型的长处,且训练成本可控,避免了在线探索的高额 API 开销。

实验

实验设计

SciOrch 基于 240 题测试集,涵盖 SGI-ReasoningScientists' First Exam (SFE) 两个科学推理基准。编排器是一个 8B 参数的轻量模型,训练时采用 MCTS 生成多样化的子问题分解与模型分配轨迹,并提取每个节点的单步样本;然后通过 GRPO 风格损失优化编排器的决策策略。每次编排动作会触发对商用前沿 LLM 的 API 调用,但训练过程不依赖在线 rollout,从而避免高昂的 API 开销。

关键发现

  • SciOrch 取得 56.66% 的平均准确率。
  • 相比最强单一商业模型(如 GPT‑4 或 Claude 等),准确率提升 3.74%
  • 相比最强多智能体基线(包括投票、流水线等方法),提升 3.33%
  • SGISFE 两个子榜上均达到最高准确率。
  • API 调用成本降低至典型多智能体方案的 一半以下,证明编排器能以极低成本利用模型互补性。

与基线对比的深度解读

单一前沿模型在不同题型上表现落差明显,用同一模型处理所有子问题必然存在短板;传统多智能体方法虽能组合多个模型,但往往依赖固定路由或全量调用,带来巨大的计算与金钱成本。SciOrch 的编排器经过专门训练,学会了按需分解问题动态指派最适合的子模型,在提升准确率的同时大幅压缩 API 调用次数。与简单的“全模型投票”相比,它用更少的调用实现了更高的正确率,验证了“训练编排器”相较“训练更大的统一模型”或“硬编码协作协议”的工程优势。这一范式为科学推理等需要专业知识的领域提供了一条低成本、高可扩展的路径。

行业影响

落地场景

SciOrch 适用于需要高精度科学推理的 AI 产品,例如:

  • 在线教育与智能辅导:学生提交物理、化学、生物等复杂问题时,系统自动分解问题、调用多个前沿 LLM 分别求解子任务,最终合成准确答案。
  • 企业研发辅助:研发人员查询专利、文献或进行实验设计,orchestrator 调用各模型交叉验证,提升结论可信度。
  • 医疗决策支持:分析影像报告、基因数据等多模态输入,协调不同模型给出鉴别诊断或治疗方案建议。
  • 金融量化分析:解读研报、经济数据,通过多模型协作降低单一模型偏差,生成更稳健的洞察。

商业价值

  • 降本增效:论文表明 SciOrch 的 API 成本不到典型多智能体方法的一半,同时准确率超越最强单模型 (56.66% vs. 52.92%)。用轻量 orchestrator 代替大量昂贵的协同调用,直接降低推理服务的 token 开销。
  • 体验提升:端到端准确率提高 3.74%,尤其在高难度科学问题上,显著减少错误答案带来的返工或误导。对于按次付费或订阅制的知识服务,准确率直接关联用户留存与付费转化。
  • 可伸缩利润:通过动态选择性价比最优的模型组合,业务方可以针对不同难度问题使用不同模型,在毛利润与服务等级之间灵活调节。

与现有产品/工作流的接口

SciOrch 可作为中间件服务嵌入现有 LLM 应用栈:

  • 统一 API 网关:orchestrator 暴露一个 /ask 端点,接收多模态问题,内部通过 API 调用 GPT-4、Claude、Gemini 等商业模型。可集成到 LangChainLLMChainSemantic Kernel 的 planner 中。
  • 离线批处理:对历史题库、文献批量推理时,orchestrator 生成可复用的子问题分解方案,后续只需执行 API 调用,进一步平摊训练成本。
  • 成本追踪与回退:可与现有 LLM 监控平台(如 LangSmithHelicone)对接,记录每次调用模型、耗时、成本,并设置预算上限,超出时自动降级至弱模型组合。

具体落地用例

  1. 在线科学问答平台(如 CheggKhan Academy 的辅导模块):用户上传一道化学平衡题,SciOrch 分解为“平衡常数计算”、“勒夏特列原理分析”两个子问题,分别调取擅长数值计算的 GPT-4 与擅长概念推理的 Claude,然后合成步骤清晰的解答。相比单一模型,准确率更高;相比多模型投票,节省 50%+ API 费用。
  2. 生物医药公司的文献情报系统:分析师需要快速总结某靶点的最新研究进展。orchestrator 协调多个模型分别提取论文中的实验方法、药效数据、毒性结果,并交叉比对矛盾之处,最终生成带引用标记的综述。这避免了人工阅读数十篇论文,且通过多模型协作提升了信息抽取的召回率。

局限

  • - **基准覆盖与模型依赖**:实验仅在 **SGI-Reasoning** 和 **Scientists' First Exam** 两个基准的 240 道题上验证,难以反映编排器在开放域或跨学科科学推理中的泛化性。训练依赖 **GPT-4**、**Claude** 等特定前沿模型,一旦这些模型迭代,编排器的分解策略与模型选择可能失效,需重新进行昂贵的 **MCTS** 采样与 **GRPO** 训练,维护成本较高。
  • - **可解释性与最优性**:编排器作为一个 8B 黑箱模型,其决策过程缺乏透明性,无法解释为何选择特定模型或分解路径。**MCTS** 生成的训练轨迹仅保证多样性,不保证分解最优,可能限制性能上限。此外,未与人类专家设计的分解流程或基于符号推理的分解方法对比,难以判断编排器学习到的策略是否真正高效。
论文Jingru Guo2026-06-14原文

相关内容