miles
面向企业级大规模 LLM/VLM 后训练的强化学习框架,接管 SGLang 做 rollout、Megatron-LM 做训练,并支持 FSDP2 后端。主打万亿参数级别的稳定性,亮点包括全异步 RL、MoE 路由重放(R3)消除专家失配、MXFP8/NVFP4 低精度训练、P2P RDMA 秒级权重更新,以及断点不重启的容错。对 DeepSeek-V4、Kimi-K3 等前沿模型有 day-0 支持,也覆盖 agentic 环境和扩散模型 RL。适合有大规模调优预算的团队评估。
README

企业级强化学习(Reinforcement Learning)框架,用于大规模模型后训练(post-training)
| 网站 | 文档 | 快速开始 | 已支持模型 | Miles Diffusion | 博客 | Slack (#miles-rl) |
最新动态
- [2026/08] 🔥 Miles v0.1 正式发布!博客文章见:Miles v0.1: Production-level Post-training。
- [2026/07] 朝着 Blackwell-Native 8-bit 与 4-bit RL 演进:Miles 中的端到端 MXFP8 与 NVFP4 RL(博客)。
- [2026/07] 🔥 SGLang 与 Miles 为 Kimi K3 提供 day-0 支持(博客)。
- [2026/07] on-policy 蒸馏功能登陆 Miles(博客)。
- [2026/07] 🔥 SGLang 与 Miles 为前沿多模态模型 Inkling 提供 day-0 支持(博客)。
- [2026/07] DeepSeek-V4 Flash RL 训练通过 Miles 登陆 AMD Instinct MI355X(博客)。
- [2026/06] SGLang 与 Miles 为 NVIDIA Nemotron 3 Ultra 提供 day-0 支持(博客)。
- [2026/05] 不遗漏任何 token:Miles 中的 token-in-token-out(博客)。
- [2026/04] 秒级更新 1T 参数:大规模分布式 RL 中的 P2P 权重传输(博客)。
- [2026/04] 🔥 DeepSeek-V4 day-0:借助 SGLang 与 Miles,从快速推理到 verified RL(博客)。
关于 Miles
Miles 是一个高性能、企业级就绪的强化学习(RL)框架,专为**大规模模型后训练(post-training)**设计。它将 SGLang 的高吞吐 rollout 与 Megatron-LM 的可扩展训练相结合,并内置了万亿参数规模 RL 所需的高精度、稳定性和可观测性特性。对于希望直接训练 HuggingFace 实现的场景,Miles 也提供 PyTorch FSDP2 后端;不过训练配方、并行策略和最大的模型都运行在 Megatron-LM 之上。详见 Training Backends。
"千里之行,始于一次 rollout。"
性能
- 完全异步 RL。 rollout worker 与训练 worker 完全解耦,支持可配置的 on-policy(同策略)/ off-policy(异策略)调度、针对更少 bubble 优化的流水线,以及可定制的异步 rollout 与 eval 模式。详见 Fully Async RL。
- 快速 agentic rollout。 生成任务运行在 SGLang 之上,由路由器在多个 engine 之间分发请求,保留每个请求的元数据,并对整个 engine 集群进行健康检查。专门为多轮 agentic 工作负载调优。
- 快速权重更新。 新权重可以在数秒内同步到线上 engine,即使是 Kimi-K2.6 这样的万亿参数模型也不例外;对于分离式部署,P2P RDMA 是权重快速同步的路径。
- 低精度训练。 MXFP8 与 NVFP4 训练配合数值稳定的 RL 配方,可减少精度导致的训练发散。同时支持 FP8、INT4 QAT、BF16 与 FP16。
- LoRA 与 multi-LoRA。 低秩适配器(LoRA) 让前沿规模模型只需少量 GPU 即可训练,并且同一份适配器可以直接加载到 SGLang 中用于 rollout。
正确性与鲁棒性
- Token-in-token-out(TITO)。 所有模型和所有黑盒 harness 均支持 TITO,rollout 与训练之间无需经过 detokenize/retokenize 的往返转换。
- Rollout Routing Replay(R3)。 rollout 阶段记录的专家路由会被在训练前向传播中重放,消除可能导致大训练不稳定的 MoE(混合专家)路由不一致问题;计算与通信相互重叠,以控制额外开销。
- 容错。 当某个 SGLang engine 崩溃时,Miles 会在原地恢复它并继续训练:无需重启,无需暂停。
Miles 的运行能力
- Day-0 模型支持。 DeepSeek-V4、Kimi-K3、GLM-5.2、Inkling 和 Nemotron 均在发布当天获得支持。除了 day-0 支持外,几乎所有前沿模型都可以运行在 Miles 上,包括 Kimi-K2.6 与 Qwen3.5。详见 Models。
- 广泛的硬件支持。 NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100,以及通过 ROCm 支持的 AMD MI300X、MI325、MI350 和 MI355X。各 GPU 的支持状态及对应容器镜像见 Installation。
- 广泛的方法支持。 RL 支持 GRPO、GSPO、PPO 和 REINFORCE++,同时支持 SFT 与 on-policy 蒸馏。
- Agentic 环境。 通过 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等连接器训练代码生成与计算机使用 agent,每个连接器都可接入匹配的 rollout 层,任务沙箱支持 AgentENV、Daytona、E2B 和 Modal。详见 Agentic Environments。
- 扩散模型。 在 Miles-diffusion 中,通过 sglang-diffusion rollout engine 与 FSDP2 trainer 支持 Flow-GRPO、DiffusionNFT 和 SFT。
快速开始
致谢
Miles 派生自 slime,并集成了 SGLang、Megatron-LM 和 torch_memory_saver。
Miles 的形态受到基于它构建并支持其发展的团队的影响——从硬件与云厂商到模型实验室、agent 基础设施与学术界:

引用
如果 Miles 对你的研究或产品有帮助,请引用它:
@misc{miles2026,
title = {Miles: Enterprise-Grade Reinforcement Learning for Large-Scale Model Post-Training},
author = {Miles Team},
year = {2026},
howpublished = {\url{https://github.com/radixark/miles}}
}