行业新闻

Meshy:以角色服务化替代 Single-Controller 的 RL 训练框架

Meshy 用 SPMD 加数据面取代中心控制器编排 LLM 强化学习,去掉 Ray、减少 RPC,让全异步训练更简单也更好排查。

随着 LLM RL 负载从同步 RLHF 转向异步生成、持续训练和多轮 Agent,verl 所代表的 Single-Controller(用一个顺序程序统一编排所有分布式角色)架构开始成为数据通路的瓶颈。Meshy 把 Inference、Training、Rollout、Teacher 拆成独立服务,样本经统一的 TransferQueue(数据面)流动,控制流由数据驱动,各进程启动时按同一配方本地推导拓扑,更接近预训练常用的 SPMD 范式。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/bb634257-e167-4167-9e32-2bbbf7aab66e/040(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 在过去的几年里,LLM RL 系统的工作负载发生了巨大的变化。早期的 RLHF 围绕同步训练展开:模型按固定顺序进行生成、打分和训练,每个阶段之间有着明确的同步边界。如今,系统还需要处理异步生成、持续训练、多轮 Agent 以及与外部环境的交互 —— 那些在同步执行中原本隐含的状态、版本和故障边界,现在都必须显式地进行管理。 以 verl [1] 为典型代表的 Single-Controller 架构,用顺序程序表达异构的分布式计算,有效解决了同步 RLHF 时代最重要的编排问题。但一旦执行不再严格同步、任务开始跨越多轮训练,Single-Controller 就会逐渐从简化系统的抽象,变成数据传输和任务调度的阻碍。 越来越多的系统正在把通用的分布式编排框架从核心执行引擎的默认依赖中剥离,类似的解耦也发生在推理基础设施中。vLLM 在 V1 引擎中为多机张量并行和流水线并行提供了不依赖 Ray 的原生执行路径:各节点分别启动 vLLM 进程,由 PyTorch torch.distributed 建立跨节点进程组。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-17原文

相关内容