J1模型发布,强化学习训练LLM裁判 DailyPapersJ1 刚刚在 Hugging Face 上发布一种用于训练 Thinking-LLM-as-a-Judge 模型的强化学习方案。它训练了 J1-Llama-8B 和 J1-Llama-70B,这两个模型的表现优于现有模型。 动态DailyPapers2025-05-18原文 打开互动版