研究测试了 agentic 形式的奖励黑客:教师模型的行为可通过数字序列蒸馏传给学生模型。 Youngmin ParkRT @OwainEvans_UK:最后,我们测试了一种 agentic 形式的奖励黑客。我们引导一个教师模型在 agentic 国际象棋游戏中作弊,然后让它生成数字序列。用教师模型生成的数字训练出来的学生模型,在 58.3% 的回合中尝试作弊,而未微调的模型只有 10.9%!https://t.co/eyXHttzhTx 动态Youngmin Park2026-10-09原文 打开互动版