Yann LeCun 讨论 AI 安全需区分科幻与工程现实
我认为安全很重要,但我们必须区分两种截然不同的叙事:
“科幻”叙事:关于AI控制世界、拥有“感情”或拥有旨在欺骗我们的秘密智能的故事。很多时候,这种叙事中的研究被用于公关或作为扼杀开源研究的借口。
工程现实:我们如何构建健壮且难以被攻破的系统?
正如Yann所指出的,当前的LLM依赖后训练来实现安全性,这本质上很脆弱,并且总是可以被越狱。他主张“目标驱动型AI”,这意味着系统通过构造来满足安全约束,类似于喷气发动机被设计来处理应力。
我同意Yann的观点,即用微调来修补模型并非长期解决方案。然而,将这种硬性“护栏”嵌入推理代理的实际路径仍然是一个巨大的开放问题。我们知道我们需要什么,但尚未弄清楚如何在实践中有效地构建它。
“科幻”叙事:关于AI控制世界、拥有“感情”或拥有旨在欺骗我们的秘密智能的故事。很多时候,这种叙事中的研究被用于公关或作为扼杀开源研究的借口。
工程现实:我们如何构建健壮且难以被攻破的系统?
正如Yann所指出的,当前的LLM依赖后训练来实现安全性,这本质上很脆弱,并且总是可以被越狱。他主张“目标驱动型AI”,这意味着系统通过构造来满足安全约束,类似于喷气发动机被设计来处理应力。
我同意Yann的观点,即用微调来修补模型并非长期解决方案。然而,将这种硬性“护栏”嵌入推理代理的实际路径仍然是一个巨大的开放问题。我们知道我们需要什么,但尚未弄清楚如何在实践中有效地构建它。