从生产流量到后训练:构建覆盖企业请求混合的自托管 LLM
数据驻留限制迫使企业自托管 LLM,但持续采用新模型而不淘汰旧模型会导致服务集群膨胀,使有限的 GPU 池碎片化。本文将来自 200 多个内部应用 的流量整合到单一模型上,通过沿三个维度(指令遵循、函数调用及内部任务分布)的生产错误分析来弥补质量差距。质量通过按生产流量分层、并由 确定性验证器 或 校准 LLM 评判器 评分的离线基准进行跟踪。 本文未进行多目标联合优化(这会引入跨域奖励干扰),而是为每个维度训练独立的 GRPO 专家,并通过 两阶段 SLERP 进行合并。每个专家的奖励暴露一种不同的失败模式:语义崩塌、过度调用 与 冗长作弊,每个都需要特定领域的修复。 在非推理模式下,该配方在内部 Arena 上以 69.6 对 65.8 超越总参数量 {sim}7 倍 的基线,在指令遵循上为 0.85 对 0.83,在函数调用上为 0.79 对 0.77,同时提升了通用对话基准。该模型吸收了 50% 的平台流量(每月 1.16 亿次请求),而服务成本仅为原来的一小部分。
论文精读
TL;DR 针对企业自托管 LLM 需求,论文从生产流量错误分析出发,分别训练指令遵循、函数调用、内部任务三个 GRPO 专家,并用两阶段 SLERP 合并避免奖励干扰,使较小模型超越大得多基线且成本更低。
问题
问题背景
企业因数据驻留约束需要自托管 LLM,但持续引入新模型而不退役旧模型导致服务舰队扩张,有限 GPU 池被碎片化。如何用一个模型覆盖企业内部请求混合成为关键。
现有方法局限
- 多模型并行服务浪费 GPU:每个新模型占用独立实例,不同应用绑定不同模型,硬件利用率低下。
- 直接采用公开模型不匹配生产流量:企业内部指令遵循、函数调用、任务分布与公开基准差异大,质量差距被掩盖。
- 联合多目标训练引入奖励干扰:同时优化指令遵循、函数调用等目标造成跨域冲突,表现为语义坍塌、过度调用、冗长作弊等失败模式,需要逐轴修复。
- 评估体系不适应:依赖通用 LLM 评委或公开基准,缺少针对生产流量的分层基准、确定性验证器和校准评委。
为什么难/重要
自托管场景下 GPU 池有限,无法为每个新模型分配资源,必须合并流量到单一模型。但不同能力轴的失败模式迥异,分别训练专家模型再合并需要解决权重融合与能力迁移问题,且合并策略直接影响最终效果。业界高度关注企业级 LLM 服务的降本增效:本工作用比基线小 7 倍的模型,在内部 Arena 上取得 69.6 vs 65.8 的胜率,吸收 50% 平台流量,显著降低服务成本。
行业类比
类似内部 AI 助手平台:若为每个应用部署独立微调模型,运维成本与 GPU 碎片严重;统一训练一个模型覆盖 200+ 应用的请求混合——同时处理指令遵循、函数调用、对话等任务,是更可持续的工程路径。
核心洞察
- - 独立训练的 GRPO 专家与两阶段 SLERP 合并,解耦了多能力优化中的跨域奖励干扰。本文与常见多目标联合 RLHF 不同,实证发现联合优化会引发指令遵循、函数调用与内部任务间的奖励冲突;每个专家单独训练时暴露的失败模式(语义崩溃、过度调用、冗长攻击)需要不同修复,合并而非联合允许独立迭代且不牺牲整体性能。这种模块化路线更适合企业持续演进模型。
- - 生产流量错误分析驱动的训练目标与分层离线基准,让自托管小模型精准适配企业请求混合。差异在于不依赖公开通用评测,而是从 200+ 内部应用的真实错误分布中提取三轴 gap,构建内部 Arena / IFEval / BFCL 及确定性验证器、校准 LLM 评委;这使得非推理模式下超越 7 倍参数 baseline 的指标提升可复现,并支撑 50% 流量迁移至低成本小模型。该方法强调评测直接锚定生产分布,而非学术榜单。
方法
输入:生产流量驱动的数据构造
从 200+ 内部应用的真实请求出发,做生产错误分析,归纳出指令遵循、函数调用、内部任务分布三类质量缺口。据此构建离线基准,评分采用确定性验证器 或 校准 LLM 评委。
关键模块:单轴 GRPO 专家 + 两阶段 SLERP 合并
不采用联合优化所有目标,而是分别为每个轴训练独立 GRPO 专家:
- 指令遵循专家:奖励信号暴露语义坍缩(生成空洞但格式合规的回复),通过约束生成与反向翻译校验构造训练数据,奖励中加入约束满足与语义保持项。
- 函数调用专家:奖励暴露过度调用(不必要的工具触发),设计工具空间与对话生成方案,用覆盖过滤与严格指标抑制误调用。
- 内部任务专家:奖励暴露冗长作弊(靠长度提升分数),引入长度惩罚与任务特化参考。 每个专家单独训练后,用两阶段 SLERP 按顺序合并,而非直接线性插值,避免跨域奖励干扰。
输出:统一小模型
合并后模型在非推理模式下,参数规模约为基线模型的 1/7 ,在内部 Arena、IFEval、BFCL 等基准上超越基线;部署后吸收 50% 平台流量(每月 1.16 亿请求),降低服务成本。
与同类方法差异:用单轴独立 GRPO + SLERP 合并 替代联合 RL,将跨域奖励干扰问题转化为每个专家针对特定失败模式的领域内修复,并以两阶段合并顺序控制冲突。
实验
实验设计
- 从 200+ 内部应用 的生产流量出发,通过错误分析定位三大能力差距:指令跟随、函数调用 与内部任务分布。
- 为每个能力轴分别训练 GRPO expert,而非联合优化,以避免跨域奖励干扰。
- 各 expert 的奖励设计针对特定失败模式:语义崩溃、过度调用、冗长黑客,并采用领域特定修复。
- 使用两阶段 SLERP 合并专家。
- 评估采用分层基准,匹配生产流量分布,评分使用确定性验证器或校准的 LLM 裁判。
关键发现
- 非推理模式下,合并模型在 In-house Arena 上取得 69.6,高于 7 倍参数基线模型的 65.8。
- 指令跟随 得分 0.85,基线 0.83;函数调用 得分 0.79,基线 0.77。
- 通用对话基准也有所提升。
- 该模型吸收 50% 平台流量(116M 请求/月),服务成本大幅降低。
对比解读
- 与参数规模大 7 倍的基线相比,本模型在关键企业指标上全面占优,证明以生产流量为导向的后训练 + 分治专家合并,比单纯扩大模型规模更有效。
- 联合优化所有目标会带来奖励干扰,而分离专家合并(SLERP)成功规避了这一问题,并针对各领域失败模式进行精细修复。
- 对工程实践的启示:企业私有化部署时,可优先考虑对流量分布进行定向后训练,而非追求最大模型;评估体系需贴近生产分布,并使用确定性或校准后的裁判以减少噪声。
行业影响
落地场景
企业自托管 LLM 的典型场景包括 金融合规问答、医疗文书处理、电商客服自动化。本论文方法适合有数据驻留要求、内部应用众多(200+)且请求类型混合的企业。例如,电商平台 的客服系统常需同时处理指令遵循(政策解读)和函数调用(订单查询/退款),传统方案部署多个专职模型,导致 GPU 池碎片化;该方法可合并为一个模型,统一响应。
商业价值
核心价值在 降本:模型参数仅为基线 1/7,却能吸收 50% 平台流量(每月 1.16 亿请求),直接减少 GPU 租赁或采购成本。同时,体验提升 来自更高的指令遵循(0.85 vs 0.83)和函数调用准确率(0.79 vs 0.77),降低错误兜底成本。增收 体现在可释放 GPU 资源用于新业务,或提升内部工具采用率。
与现有工作流接口
- 模型服务层:用单个自托管模型替换多模型路由,简化 API 网关,降低运维复杂度。
- 训练流水线:可复用生产流量错误分析(
production error analysis)作为数据飞轮,持续收集失败案例,定期触发 GRPO 专家训练与 SLERP 合并,实现无痛迭代。 - 评估体系:内置的确定性验证器(
deterministic verifiers)和校准 LLM 法官可接入现有 CI/CD,作为上线门禁。
局限
- **评估依赖内部基准与 LLM 裁判**:论文的核心评估基于 in-house Arena、内部 IFEval/BFCL 等生产流量分层基准,这些基准的构造细节、任务分布和标签生成流程未完全公开,外部团队难以复现或在同一标准下比较。同时,大量分数由 calibrated LLM judges 给出,虽然做了校准,但裁判模型本身仍可能引入系统偏差,且对内部数据的过拟合风险难以量化。这削弱了方法在跨组织场景下的可信度和迁移性。
- **部署范围与语言限制**:方法主要面向特定企业流量整合,训练与评估大量使用俄语任务(如 Russian IFEval、Russian BFCLv3、Russian MultiChallenge),对其他语言和不同领域的通用性缺乏验证。论文仅报告了非推理模式下的效果,推理模式(如 chain-of-thought)下的质量、延迟和成本未被系统评估。此外,合并系数选择和 GRPO 超参数依赖内部验证集,泛化到不同基础模型或任务组合时可能需要重新调优。
- **数据隐私与模型家族范围**:训练依赖内部生产数据,带来数据溯源、去污染和隐私保护的固有挑战,论文虽提及但难以完全解决。SLERP 合并策略和分离专家训练只在单一模型家族(未明确具体模型)上验证,是否适用于其他规模或架构的模型未知。人类标注环节成本较高,且可能引入标注者偏差。这些因素限制了该方法作为通用后训练配方在更广泛场景下的直接复用。