AI对齐研究关注正面愿景,通过理解错误行为来训练模型。
对齐研究往往必须专注于避免令人担忧的行为,但我认为这种训练的正面愿景是,我们可以给模型一个诚实且积极的愿景,说明AI模型可以是什么以及为什么。我对这项工作的未来感到兴奋。
我们发现,仅用对齐行为的演示来训练Claude是不够的。我们最好的干预措施是教导Claude深入理解为何错误行为是错误的。
阅读更多:https://t.co/0YaRlXhVZb
我们发现,仅用对齐行为的演示来训练Claude是不够的。我们最好的干预措施是教导Claude深入理解为何错误行为是错误的。
阅读更多:https://t.co/0YaRlXhVZb