NVIDIA开源训练后栈及RL环境
3/4. 整个训练后栈是开源的(Apache 2.0):
NeMo-Gym(环境收集和编排):
https://github.com/NVIDIA-NeMo/Gym
NeMo-RL(RL训练):
https://github.com/NVIDIA-NeMo/RL
所有SFT + RL数据也在HuggingFace上开放。欢迎PR和新环境!
完整技术报告:
NeMo-Gym(环境收集和编排):
https://github.com/NVIDIA-NeMo/Gym
NeMo-RL(RL训练):
https://github.com/NVIDIA-NeMo/RL
所有SFT + RL数据也在HuggingFace上开放。欢迎PR和新环境!
完整技术报告: