单样本强化学习提升LLM数学推理,Qwen模型准确率从36%升至73.6%。 DailyPapers仅用一个例子进行强化学习?单次RLVR提升LLM数学推理能力。Qwen2.5-Math-1.5B在MATH500上从36%跃升至73.6%。 动态DailyPapers2025-04-30原文 打开互动版