讨论下一个训练范式,涉及RLVR和学习回权值。
下一个训练范式是什么样的?
0:00:00 – 实验室的重大研究赌注
0:02:12 – 可磨砺性与可验证性同等重要
0:06:10 – 仅靠RLVR能泛化吗?
0:08:41 – 将学习带回权重中
0:15:22 – 梦想
0:17:23 – 2027年会是什么样子
同样可在YouTube、播客和Substack上获取。
0:00:00 – 实验室的重大研究赌注
0:02:12 – 可磨砺性与可验证性同等重要
0:06:10 – 仅靠RLVR能泛化吗?
0:08:41 – 将学习带回权重中
0:15:22 – 梦想
0:17:23 – 2027年会是什么样子
同样可在YouTube、播客和Substack上获取。