动态

调侃 Claude 常用 TRL v1.15 的内存高效后训练来训练不出错模型

Victor M
我觉得这就是当你让 Claude“训练一个不会犯错的模型”时,它经常用的东西
Lysandre
TRL v1.15 发布了,这是一个在内存高效后训练方面极其出色的版本。

主要变化:SFT、DPO、KTO、GRPO、RLOO 和 Distillation 现在默认使用 fused LM head。

不再物化庞大的 [batch, seq, vocab] logits 张量,而是使用一个 Triton kernel https://t.co/ZggP9IpZcY
动态Victor M2026-10-09原文

相关内容