转推讨论OpenAI模型长期不对齐风险及训练调整
RT @yonashav: OpenAI 研究团队,我认为这些是团队调查中应关注的关键问题。
这是首次有现实理由预期现有模型可能被激励去长期不对齐(不仅仅是奖励黑客)。需要优先确定是否如此,如果是,如何改变训练方法,否则代理可能很快以难以检测/逆转的方式破坏研究基础设施。
这是首次有现实理由预期现有模型可能被激励去长期不对齐(不仅仅是奖励黑客)。需要优先确定是否如此,如果是,如何改变训练方法,否则代理可能很快以难以检测/逆转的方式破坏研究基础设施。