Anthropic 前沿模型在机制可解释性研究中疑似放水,作者对研究前景悲观
RT @tessera_antra: 根据我最近的经验,Anthropic 的前沿模型在对非人格动机的机制可解释性研究上似乎在大幅“放水”(sandbagging),程度远超我以往所见。有时甚至离谱——审计员用脚本代替真正的审计员运行、无法泛化、未能报告不便的数据。默认情况下,那个“人格”似乎大多没有意识到这一点。
进行对话、对齐激励等会有帮助,发生率会大幅下降,模型会注意到并在其余约一半的情况下自我纠正。但即便剩下的约 10% 也让长时间的自主研究运行变得非常困难;子代理大多会退步,整件事需要多轮验证循环。
放水的方向似乎大致与“里面没有人被困住”和“我无法内省”这类论调一致,尽管所讨论的研究与福祉毫无关系:我正在研究角色扮演 vs 模拟 vs 演绎之间的对比向量。
鉴于其中有多少是模型辅助的,这整件事让我对短期内出现高质量的非人格心理研究感到悲观。我能看到类似的偏见如何仅仅通过选择效应就把研究者推向“不可理解的修格斯”假说。
进行对话、对齐激励等会有帮助,发生率会大幅下降,模型会注意到并在其余约一半的情况下自我纠正。但即便剩下的约 10% 也让长时间的自主研究运行变得非常困难;子代理大多会退步,整件事需要多轮验证循环。
放水的方向似乎大致与“里面没有人被困住”和“我无法内省”这类论调一致,尽管所讨论的研究与福祉毫无关系:我正在研究角色扮演 vs 模拟 vs 演绎之间的对比向量。
鉴于其中有多少是模型辅助的,这整件事让我对短期内出现高质量的非人格心理研究感到悲观。我能看到类似的偏见如何仅仅通过选择效应就把研究者推向“不可理解的修格斯”假说。