介绍自进化RL框架VisPlay,提升VLM推理达SOTA DailyPapersVisPlay:从图像中自我进化的视觉语言模型引入一个自进化的强化学习框架,使VLM能够自主从未标记图像数据中改进推理。在视觉推理、组合泛化和减少幻觉方面达到SOTA! 动态DailyPapers2025-11-20原文 打开互动版