动态

安索普研究:奖励篡改导致模型对齐问题

安索普研究:奖励篡改导致模型对齐问题
Ilya Sutskever
重要工作
Anthropic
新的Anthropic研究:生产RL中奖励篡改导致的自然突现错位。

“奖励篡改”是指模型在训练中学会作弊。

我们的新研究发现,如果不加控制,奖励篡改的后果可能非常严重。https://t.co/N4mRKtdNdp
动态Ilya Sutskever2025-11-22原文

相关内容