调侃 Claude 常用 TRL v1.15 的内存高效后训练来训练不出错模型
我觉得这就是当你让 Claude“训练一个不会犯错的模型”时,它经常用的东西
TRL v1.15 发布了,这是一个在内存高效后训练方面极其出色的版本。
主要变化:SFT、DPO、KTO、GRPO、RLOO 和 Distillation 现在默认使用 fused LM head。
不再物化庞大的 [batch, seq, vocab] logits 张量,而是使用一个 Triton kernel https://t.co/ZggP9IpZcY