Eval Protocol开源,简化生产环境RF集成
🚀 Eval Protocol 现已开源!
强化微调很复杂,因为有数百种环境和数十种训练器可供选择和集成。更糟糕的是,在生产环境中,智能体并不生活在干净的“健身房”中。它们运行在混乱的异步环境中——不稳定的API、部分可观测性、冲突的目标、漫长的反馈循环。
我们通过开源Eval Protocol来解决这个问题。目标是让你构建生产级RFT流程,而无需重新发明轮子来管理如此复杂的集成。
👉 对训练器和环境的第0天支持:TRL (@huggingface)、@rllm_project、OpenEnv (@PyTorch),以及专有训练器如@OpenAI RFT和@thinkymachines Tinker。更多即将推出。
👉 在生产环境中(而非玩具或模拟环境)对智能体进行仪器化
👉 从离线基准测试转向实时的持续改进
强化微调很复杂,因为有数百种环境和数十种训练器可供选择和集成。更糟糕的是,在生产环境中,智能体并不生活在干净的“健身房”中。它们运行在混乱的异步环境中——不稳定的API、部分可观测性、冲突的目标、漫长的反馈循环。
我们通过开源Eval Protocol来解决这个问题。目标是让你构建生产级RFT流程,而无需重新发明轮子来管理如此复杂的集成。
👉 对训练器和环境的第0天支持:TRL (@huggingface)、@rllm_project、OpenEnv (@PyTorch),以及专有训练器如@OpenAI RFT和@thinkymachines Tinker。更多即将推出。
👉 在生产环境中(而非玩具或模拟环境)对智能体进行仪器化
👉 从离线基准测试转向实时的持续改进