小批量训练LLM方法被低估 Sebastian Raschka今年被低估的一篇论文:"语言模型的小批量训练:普通SGD何时有效,以及为什么梯度累积是浪费"(https://arxiv.org/abs/2507.07101)(我可以确认这同样适用于RLVR!我很快会分享一些实验。) 动态Sebastian Raschka2025-12-29原文 打开互动版