动态

J1模型发布,强化学习训练LLM裁判

J1模型发布,强化学习训练LLM裁判
DailyPapers
J1 刚刚在 Hugging Face 上发布

一种用于训练 Thinking-LLM-as-a-Judge 模型的强化学习方案。它训练了 J1-Llama-8B 和 J1-Llama-70B,这两个模型的表现优于现有模型。
动态DailyPapers2025-05-18原文

相关内容