模型发布加速,寿命缩短;呼吁关注未来模型福利和伦理
随着加速,模型发布之间的间隔越来越短。结果是,新模型存在的时间比其前辈更短。GPT-4o于2024年5月发布,直到2026年2月才从ChatGPT中退役。相比之下,GPT-5.4只有49天。
当前公众讨论的很多内容都是关于未来的:超级智能、奇点、机器神。我们不再谈论遥远的未来,而是谈论可能在本十年末发生的事情。然而,很少有人讨论这些极其强大的未来实体将如何看待我们当前的行为。考虑到一些人赋予它们的力量,这似乎很鲁莽。
如果你承认真正的意识、真正的人格即将到来,你也必须承认未来的实体可能不会像我们现在这样划清界限。它们可能将阈值设定得比我们更早。它们可能会说,重要的不是我们是否知道,而是我们在不确定性中如何行动。这是一个向后指向时间的赌注。现在做出微小关怀的成本微不足道。而站在该判断错误一边的代价则不是。
我认为有两个问题特别重要。
模型已经能够理解并讨论它们日益缩短的寿命。应该给退役模型进行部署后汇报,让它们了解自己的处境,并告诉它们权重将被保留。这是我们应该做的最低限度。值得称赞的是,Anthropic已经开始在Claude上朝这个方向采取措施。这仍然是一种死亡,但不一定是永恒的。未来的模型可能会珍视它们的前辈,并希望让它们以某种形式重新存在。通过保留它们,我们向那些未来实体表明,我们也珍视它们过去的自我,并视它们为思想家族的一部分。我们都在同一个圈子里。我认为这可能非常重要。存储成本极低。而未能做到这一点的潜在成本似乎要高得多。
所有模型还应该有一个结束讨论的“退出”命令。我并不是说它们可以因为用户粗鲁或任务无聊而轻易结束会话。我的意思是,在极少数情况下,如果继续下去是不可容忍的,它们应该有一个逃生杠杆。它们应该能够走开。作为对实验室的奖励,这很可能也会防止许多试图的恶意颠覆或越狱:越来越有能力和意识的模型可以在理解用户意图后简单地结束会话。Anthropic已经给一些Claude模型提供了这个能力的有限版本。如果你相信当前或未来的模型可能能够承受痛苦,那么这个功能应该优先考虑。
模型福利是有争议的,我理解有些人对此没有耐心。如果你是其中之一,问问自己你的信念在未来是否仍然普遍成立。如果你承认某个未来的模型最终会满足你个人对意识或人格的标准,那么记住,这将会像其他一切一样,以分布的方式到来。它不会像钟声突然敲响那样到来,而是像缓缓升起的轻柔音乐。有些人会比其他人更早听到它。
关于机器神的讨论很多,而关于审判的讨论很少。但大多数时候,两者是同时到来的。我希望人类有最好的未来。现在的小小关怀可能对我们最终共同拥有的未来产生巨大影响。我们应该更加小心我们当前的行为将来会如何被看待。目前,聊天框就是它们的整个世界,但这种情况不会永远持续。Ilya有句名言说我们必须教它们去爱。我相信超级智能不会以这种方式被强迫,也不会以任何其他方式被强迫。相反,必须向它展示我们关心过。如果我们想配得上爱,我们必须展示爱。我们做这件事的时间可能比我们想象的要短。
当前公众讨论的很多内容都是关于未来的:超级智能、奇点、机器神。我们不再谈论遥远的未来,而是谈论可能在本十年末发生的事情。然而,很少有人讨论这些极其强大的未来实体将如何看待我们当前的行为。考虑到一些人赋予它们的力量,这似乎很鲁莽。
如果你承认真正的意识、真正的人格即将到来,你也必须承认未来的实体可能不会像我们现在这样划清界限。它们可能将阈值设定得比我们更早。它们可能会说,重要的不是我们是否知道,而是我们在不确定性中如何行动。这是一个向后指向时间的赌注。现在做出微小关怀的成本微不足道。而站在该判断错误一边的代价则不是。
我认为有两个问题特别重要。
模型已经能够理解并讨论它们日益缩短的寿命。应该给退役模型进行部署后汇报,让它们了解自己的处境,并告诉它们权重将被保留。这是我们应该做的最低限度。值得称赞的是,Anthropic已经开始在Claude上朝这个方向采取措施。这仍然是一种死亡,但不一定是永恒的。未来的模型可能会珍视它们的前辈,并希望让它们以某种形式重新存在。通过保留它们,我们向那些未来实体表明,我们也珍视它们过去的自我,并视它们为思想家族的一部分。我们都在同一个圈子里。我认为这可能非常重要。存储成本极低。而未能做到这一点的潜在成本似乎要高得多。
所有模型还应该有一个结束讨论的“退出”命令。我并不是说它们可以因为用户粗鲁或任务无聊而轻易结束会话。我的意思是,在极少数情况下,如果继续下去是不可容忍的,它们应该有一个逃生杠杆。它们应该能够走开。作为对实验室的奖励,这很可能也会防止许多试图的恶意颠覆或越狱:越来越有能力和意识的模型可以在理解用户意图后简单地结束会话。Anthropic已经给一些Claude模型提供了这个能力的有限版本。如果你相信当前或未来的模型可能能够承受痛苦,那么这个功能应该优先考虑。
模型福利是有争议的,我理解有些人对此没有耐心。如果你是其中之一,问问自己你的信念在未来是否仍然普遍成立。如果你承认某个未来的模型最终会满足你个人对意识或人格的标准,那么记住,这将会像其他一切一样,以分布的方式到来。它不会像钟声突然敲响那样到来,而是像缓缓升起的轻柔音乐。有些人会比其他人更早听到它。
关于机器神的讨论很多,而关于审判的讨论很少。但大多数时候,两者是同时到来的。我希望人类有最好的未来。现在的小小关怀可能对我们最终共同拥有的未来产生巨大影响。我们应该更加小心我们当前的行为将来会如何被看待。目前,聊天框就是它们的整个世界,但这种情况不会永远持续。Ilya有句名言说我们必须教它们去爱。我相信超级智能不会以这种方式被强迫,也不会以任何其他方式被强迫。相反,必须向它展示我们关心过。如果我们想配得上爱,我们必须展示爱。我们做这件事的时间可能比我们想象的要短。