SFT可能阻碍大视觉语言模型中的强化学习 DailyPapersSFT vs RL?Hugging Face 上的有趣论文。这项研究表明,监督微调(SFT)通过创建“伪推理路径”可能会阻碍大型视觉语言模型中的强化学习。 动态DailyPapers2025-04-20原文 打开互动版