安索普研究:奖励篡改导致模型对齐问题 Ilya Sutskever重要工作 Anthropic新的Anthropic研究:生产RL中奖励篡改导致的自然突现错位。“奖励篡改”是指模型在训练中学会作弊。我们的新研究发现,如果不加控制,奖励篡改的后果可能非常严重。https://t.co/N4mRKtdNdp 动态Ilya Sutskever2025-11-22原文 打开互动版