上海AI实验室推出VPPO方法,提升多模态推理 DailyPapers上海AI实验室推出VPPO用于多模态强化学习。该方法聚焦“token感知”以提升LVLMs的推理能力。它在8个基准测试上实现了最先进的结果,具有卓越的稳定性和更快的收敛速度。 动态DailyPapers2025-10-15原文 打开互动版