FIRM引入鲁棒奖励模型用于RL图像编辑与生成 DailyPapers信任你的批评者FIRM 引入了稳健的奖励模型,用于基于强化学习的图像编辑和生成,包含37万编辑样本和29.3万生成样本,专门的8B批评者,以及FIRM-Bench基准。 动态DailyPapers2026-03-13原文 打开互动版