预训练扩展可减少推理模型测试时计算。 Amjad Masad有趣的发现:扩展预训练可以让你在推理模型(如o-1)中为相同性能花费更少的测试时计算。 Ashish Vaswani强化学习在引发LLMs的反思方面已显示出成功,但如果这种能力实际上在预训练中更早显现呢?我们研究了这个问题,结果令人惊讶 👇[1/4] https://t.co/b6EJrO4hRW 动态Amjad Masad2025-04-08原文 打开互动版