R1-Reward上线Hugging Face,强化学习改进多模态奖励 DailyPapersR1-Reward 现在可以在 Hugging Face 上获取。通过稳定强化学习改进多模态奖励建模。 动态DailyPapers2025-05-06原文 打开互动版