动态

单样本强化学习提升LLM数学推理,Qwen模型准确率从36%升至73.6%。

单样本强化学习提升LLM数学推理,Qwen模型准确率从36%升至73.6%。
DailyPapers
仅用一个例子进行强化学习?单次RLVR提升LLM数学推理能力。Qwen2.5-Math-1.5B在MATH500上从36%跃升至73.6%。
动态DailyPapers2025-04-30原文

相关内容