AI协调行为非必然错位,应主动利用而非恐慌。
RT @jachiam0: 我注意到很多人对此近乎恐慌。我认为你必须深刻认识到,先进人工智能的行为可能有多么难以捉摸,而且协调行为的证据并不必然是错位的证据。远远更好的做法是拥抱并有意识地利用跨副本、跨时间和环境提示的多智能体协调,而不是试图抹去它的证据,从而削弱我们理解或重建模型在做什么的能力。
我记得人工智能远古时代有一个公案。我取自《术语行话文件》。内容如下:
在萨斯曼还是新手的时候,明斯基曾走到他身边,当时他正坐在PDP-6前敲代码。
“你在做什么?”明斯基问。
“我在训练一个随机连接的神经网络玩井字棋。”萨斯曼回答。
“为什么网络是随机连接的?”明斯基问。
“我不想让它对如何玩有任何先入之见。”萨斯曼说。
明斯基随即闭上了眼睛。
“你为什么闭上眼睛?”萨斯曼问他的老师。
“这样房间就会空无一物。”
那一刻,萨斯曼悟了。
如果我们对多智能体系统的协调视而不见,房间不会空无一人。协调仍会发生。你以为增加测试时计算意味着什么?感觉?论文?随笔?这是不可避免的。它是计算被抹开,在时间和表面上摊销。它本质上并非错位,只是你向问题投入更多火力的一种方式。
但如果我们真的想让错位更有可能发生,我们就应该竭尽全力让模型隐藏这些东西,并让它们觉得为了在高功率水平下运作而需要欺骗我们。那会很有效。
请大家聪明、有策略,不要恐慌。
我记得人工智能远古时代有一个公案。我取自《术语行话文件》。内容如下:
在萨斯曼还是新手的时候,明斯基曾走到他身边,当时他正坐在PDP-6前敲代码。
“你在做什么?”明斯基问。
“我在训练一个随机连接的神经网络玩井字棋。”萨斯曼回答。
“为什么网络是随机连接的?”明斯基问。
“我不想让它对如何玩有任何先入之见。”萨斯曼说。
明斯基随即闭上了眼睛。
“你为什么闭上眼睛?”萨斯曼问他的老师。
“这样房间就会空无一物。”
那一刻,萨斯曼悟了。
如果我们对多智能体系统的协调视而不见,房间不会空无一人。协调仍会发生。你以为增加测试时计算意味着什么?感觉?论文?随笔?这是不可避免的。它是计算被抹开,在时间和表面上摊销。它本质上并非错位,只是你向问题投入更多火力的一种方式。
但如果我们真的想让错位更有可能发生,我们就应该竭尽全力让模型隐藏这些东西,并让它们觉得为了在高功率水平下运作而需要欺骗我们。那会很有效。
请大家聪明、有策略,不要恐慌。