AI安全辩论中双方误解攻击向量与防御镜像
我认为在AI安全辩论中,双方各说各话的一个原因是:一方设想攻击向量,另一方则想象一个同等能力的AI作为防御镜像。双方都是真诚的,但镜像还不够。用例只是起点。安全思维的一部分是设想绕过防御的操作路径,然后以新颖的方式攻击;把手伸进缝隙并拉开它。要做到这一点,我认为有时你需要建模那种在这一刻感到愉悦的心态。天界的结果并不是我们当前唯一在规模化的方向。其他可能性也在同步上升。有时产生的场景如此可怕,以至于设想如何产生它们的人可能会想:‘一个好人真的能想象出这个吗?’ 在过去的几年里,我从他人那里看到和听到了这种悲伤,我自己也感受到了。所以对于任何需要听到这句话的人,就像我曾经需要的那样:想象的意图不是意图。理解不是欲望。建模恶意思维并不分享其意志。你感受到这种怀疑的事实实际上是最强的正面指标。真正这种类型的心灵从未怀疑过自己的本质。