AI评估领域面临评估感知和训练感知模型的挑战
从论文中:“AI评估和开发领域尚未准备好应对评估感知模型,这些模型能识别自己是否在被测试,更不用说那些可能主动抵制对齐尝试的训练感知系统了。未来更强大的模型可能会带来更高的挑战,如复杂的情境意识和 opaque 推理,因此现在必须快速推进这些问题。”
今天我们@apolloaievals 发布研究。在受控测试中,我们发现了前沿模型中与策划一致的行为,并测试了一种减少该行为的方法。虽然我们认为这些行为目前不会造成严重伤害,但这是我们正在准备的未来风险。