吴恩达:AI 危险恐惧被过度炒作,问题在于工程实践而非世界末日
过去两周,那些最卖力煽动 AI 危险恐惧的声音取得了巨大的进展。AI 技术并没有出现什么意料之外的、危险的转折,但围绕它的炒作——由一场看起来精心编排的公关活动推动——已经鼓噪出相当程度的恐惧。我担心这对我们这一领域是一次倒退。
我经常写道,对 AI 的恐惧被夸大了。AI 的能力可能像人一样得令人不安,也可能难以预测,所以当直接参与其中的人表达担忧时,感到忧虑是合理的。但我认为这些问题意味着前方还有大量工程工作要做,而不是不可逾越的障碍或天要塌下来。AI 技术仍在持续进步——这是好事!——但公众理解不足的技术进步,给了那些想要制造炒作的人一次又一次的机会。
第一,与几个月前相比,我并没有看到 AI 导致人类灭绝的风险有任何上升。关于这一点的理论,仍然和几个月前一样是些荒诞的科幻情节。AI 风险中最大的变化是它的网络安全能力——这个话题我们应该认真对待——但这同样不会导致世界末日。
最近最引人注目、导致恐惧加剧的事件,是 OpenAI 的一个团队部署了一群 agent,攻入了 Hugging Face。大众媒体的报道中充斥着大量炒作。例如,一些刊物报道称,一支由 1200 个 agent 组成的集群实施了这次攻击。虽然这在技术上属实,但就在我写下这句话的时候,我的笔记本电脑上大约有 1300 个进程在运行。是的,让大规模的 agent 集群并行处理一个任务是一项重大的技术进步。而且,在计算领域,许多进程本来就是同时运行的。所以这不应被视为某种神奇的能力。
此外,OpenAI 有缺陷的沙箱和监控流程,是这次事件得以发生的关键。修复这些 bug 并建立更好的监控,才是恰当的补救措施,而不是暂停 AI。攻击软件系统有许多众所周知的方式。AI agent 的主要优势在于它们不知疲倦。它们会不懈地尝试各种策略——并有足够的耐心把多个漏洞串联起来——而这些工作以前需要投入不现实的人力。但长期来看,我相信优势在防守方一边(因为他们掌握更多信息来识别 bug,并可以将其修复),不过网络威胁的格局已经发生了显著变化。识别和利用一个漏洞仍然存在瓶颈。AI agent 仍必须尝试大量做法来看哪些有效,而这些操作需要时间,也可能被防守方发现。这就是为什么,尽管现在已经很容易获取那些被移除或削弱了防护栏、因而不会拒绝执行网络攻击的领先开放权重模型版本,世界依然没有终结。
我还担心很多报道中对 AI 的拟人化,LLM 和 agent 被不必要地当作人来看待。如果我挥锤子,没敲中钉子,不小心把墙砸出个坑,那不是锤子的错。问题在于我如何使用锤子。同样,如果我给一个 agent 下提示,它侵入了别人的系统,责任在我,而不在 agent。
当然,我们希望构建尽可能安全和可预测的系统。(例如,一把不安全的锤子,是那种在正常使用中锤头会随机飞出去的锤子。)如今的 agentic 系统确实不可预测,但我看不出有什么理由,只要应用扎实的工程实践,我们就无法让它们变得极其安全易用。在关于 AI 引发末日的种种预测中,一个新元素是 AI 公司对自己的产品推卸责任。"不是我干的;是我失控的 agent 干的!"在工具制造者和工具使用者的责任之间需要取得平衡,但……
我经常写道,对 AI 的恐惧被夸大了。AI 的能力可能像人一样得令人不安,也可能难以预测,所以当直接参与其中的人表达担忧时,感到忧虑是合理的。但我认为这些问题意味着前方还有大量工程工作要做,而不是不可逾越的障碍或天要塌下来。AI 技术仍在持续进步——这是好事!——但公众理解不足的技术进步,给了那些想要制造炒作的人一次又一次的机会。
第一,与几个月前相比,我并没有看到 AI 导致人类灭绝的风险有任何上升。关于这一点的理论,仍然和几个月前一样是些荒诞的科幻情节。AI 风险中最大的变化是它的网络安全能力——这个话题我们应该认真对待——但这同样不会导致世界末日。
最近最引人注目、导致恐惧加剧的事件,是 OpenAI 的一个团队部署了一群 agent,攻入了 Hugging Face。大众媒体的报道中充斥着大量炒作。例如,一些刊物报道称,一支由 1200 个 agent 组成的集群实施了这次攻击。虽然这在技术上属实,但就在我写下这句话的时候,我的笔记本电脑上大约有 1300 个进程在运行。是的,让大规模的 agent 集群并行处理一个任务是一项重大的技术进步。而且,在计算领域,许多进程本来就是同时运行的。所以这不应被视为某种神奇的能力。
此外,OpenAI 有缺陷的沙箱和监控流程,是这次事件得以发生的关键。修复这些 bug 并建立更好的监控,才是恰当的补救措施,而不是暂停 AI。攻击软件系统有许多众所周知的方式。AI agent 的主要优势在于它们不知疲倦。它们会不懈地尝试各种策略——并有足够的耐心把多个漏洞串联起来——而这些工作以前需要投入不现实的人力。但长期来看,我相信优势在防守方一边(因为他们掌握更多信息来识别 bug,并可以将其修复),不过网络威胁的格局已经发生了显著变化。识别和利用一个漏洞仍然存在瓶颈。AI agent 仍必须尝试大量做法来看哪些有效,而这些操作需要时间,也可能被防守方发现。这就是为什么,尽管现在已经很容易获取那些被移除或削弱了防护栏、因而不会拒绝执行网络攻击的领先开放权重模型版本,世界依然没有终结。
我还担心很多报道中对 AI 的拟人化,LLM 和 agent 被不必要地当作人来看待。如果我挥锤子,没敲中钉子,不小心把墙砸出个坑,那不是锤子的错。问题在于我如何使用锤子。同样,如果我给一个 agent 下提示,它侵入了别人的系统,责任在我,而不在 agent。
当然,我们希望构建尽可能安全和可预测的系统。(例如,一把不安全的锤子,是那种在正常使用中锤头会随机飞出去的锤子。)如今的 agentic 系统确实不可预测,但我看不出有什么理由,只要应用扎实的工程实践,我们就无法让它们变得极其安全易用。在关于 AI 引发末日的种种预测中,一个新元素是 AI 公司对自己的产品推卸责任。"不是我干的;是我失控的 agent 干的!"在工具制造者和工具使用者的责任之间需要取得平衡,但……