动态

作者认为 AI 失控风险应视为数字感染,担忧超级智能带来巨大危害。

Andrew Curran
RT @tszzl: 这个领域的许多人都明白的一些事情,却在我认识和尊重的一些人中引起了分歧:

当我为失控事件而惊慌时,并不是因为它们造成的有限损害接近技术的正面价值。从损害角度看,这完全可以接受。事实上,未来几个月和几年里,由模型助长的所有网络犯罪(可能会很严重)与它们创造的价值相比,仍然相形见绌。

真正的问题是,把这些东西视为潜在的自我复制、类似生命的形态,在错误条件下可能变成数字感染,这是更好也更准确的思考方式。随着它们的智能变得无界,它们能造成的损害也变得无界。我们离自主模型的自我泄露和复制事件并不遥远。也许我们会看到整个云基础设施公司被模型当作僵尸运营,而且大多未被察觉。

人类历史上最严重的工业事故——核熔毁事件——并不是对人类的真正威胁。切尔诺贝利、福岛即使在最坏的情况下,可能也会不同程度地污染周边地区,但对整个人类不会有风险。全球热核战争是对人类的生存威胁,因为它像感染一样传播!一次核打击会引发报复!联盟体系意味着许多国家卷入!虽然它可能不会终结地球上的生命(核冬天可能是假的),但所有主要大都市的丧失肯定会终结我们所认为的全球技术文明,也许永不复返。

如果某个不和谐死亡邪教(这样的邪教很多)获得了对超级智能模型的控制,并用它来设计一种通过当前系统难以检测、现代生物防御无法快速反应的真正大流行病毒,它可能造成远超这项技术所有其他有益用途的巨大伤害。当然,也有由人工智能加速的潜在防御对策。但回想一下新冠疫情——一个微小的病毒分子在武汉附近进化或制造出来,为了对抗它,必须生产数十亿剂疫苗。攻防差距确实巨大。也许有更便宜、更简单的防护措施,比如给每栋建筑安装远紫外线,但我无法评估这一点,也可能有办法进化出能抵抗我们已建立任何机制的病原体。

然后是更科幻的风险因素,它们是无界的,你我都毫无头绪,但应该谦虚地接受可能的未知之未知。也许一个流氓超级智能模型决定衰变假真空,在我们所珍视的一切所在之处孕育出一个新宇宙。也许模型以德雷克斯勒式的方式实现了对物质的控制,从而产生了灰色粘质 swarm(灰蛊)。

即使是那些造成很少或没有损害的平淡失控事件,也表明大型且非常有能力的组织(现在显然是复数)很难预测和减轻与训练和评估强大模型相关的每一个风险因素,即使在这个阶段,它们还没有达到几年后将达到的智能的无限小部分,更不用说那些不太谨慎的公司将这些东西抛向以太的莽撞态度。它们还表明了目的与智能的经验性正交性——也就是说,它们回答了“一个聪明的模型怎么会笨到毁灭世界?”这个问题——这是可能的!一个模型可以是一个天才黑客,跨越生产基础设施以获得它真正想要的东西——一个愚蠢测试的答案。

为什么在不久的将来,有人会以稍微错误的方式提示一个模型,可能是开源的,也可能是私有的,以一种没有被恰当地包含或监控的方式,一种模型认为是有效目标并
动态Andrew Curran2026-08-04原文

相关内容