动态

NVIDIA开源训练后栈及RL环境

Oleksii Kuchaiev
3/4. 整个训练后栈是开源的(Apache 2.0):

NeMo-Gym(环境收集和编排):
https://github.com/NVIDIA-NeMo/Gym
NeMo-RL(RL训练):
https://github.com/NVIDIA-NeMo/RL

所有SFT + RL数据也在HuggingFace上开放。欢迎PR和新环境!
完整技术报告:
动态Oleksii Kuchaiev2026-03-11原文

相关内容