动态

SFT可能阻碍大视觉语言模型中的强化学习

SFT可能阻碍大视觉语言模型中的强化学习
DailyPapers
SFT vs RL?Hugging Face 上的有趣论文。这项研究表明,监督微调(SFT)通过创建“伪推理路径”可能会阻碍大型视觉语言模型中的强化学习。
动态DailyPapers2025-04-20原文

相关内容