动态

小批量训练LLM方法被低估

小批量训练LLM方法被低估
Sebastian Raschka
今年被低估的一篇论文:"语言模型的小批量训练:普通SGD何时有效,以及为什么梯度累积是浪费"(https://arxiv.org/abs/2507.07101)
(我可以确认这同样适用于RLVR!我很快会分享一些实验。)
动态Sebastian Raschka2025-12-29原文

相关内容