Sander分享12个提示工程要点及安全风险
我的主要收获:
1. 提示工程仍然非常活跃——而且比以往更重要。随着公司依赖LLM驱动面向用户的功能和核心功能,它变得更为关键。Sander解释了提示质量如何影响AI性能,特别是在跨产品扩展时。
2. 提示工程有两种不同类型:“对话式”和“产品导向”。大多数人认为提示就是与ChatGPT聊天,但Sander指出真正的杠杆来自于在产品内部构造高性能提示。这些提示被大规模使用,运行数百万次,必须像生产代码一样强化和优化。
3. “少样本提示”可以将准确率从0%提升到90%。最强大的技术之一是向模型展示你想要的精确示例,即少样本提示。Sander分享了一个医疗编码用例,仅通过添加几个示例-标签对,就将结果从完全失败提升到近乎完美。
4. 角色提示(例如“你是一名数学教授……”)在很大程度上是无效的,与大多数人的想法相反。Sander分析了研究,表明虽然角色提示可能有助于语气或写作风格,但对提高正确性几乎没有影响。
5. 分解和自我批评等高级技术能释放更好的性能。Sander概述了如何要求模型首先将问题分解为子问题(分解)或批评自己的答案(自我批评),从而产生更智能、更准确的输出。这些技术在多步推理的类代理环境中尤其有价值。
6. 上下文(“附加信息”)被低估了——但影响巨大。简单地给模型更多相关背景可以大幅提升性能。Sander分享了一些例子,其中包含额外数据(如简历、研究论文或过去的交互)决定了一个提示的成败,尤其是以正确的格式和顺序包含时。
7. 提示注入是真实、危险且传统意义上无法解决的。我们探讨了攻击者如何“越狱”LLM——诱骗它们输出有害、受限或非预期的响应。这些攻击通常绕过“不要做X”之类的传统防御。根据Sander(甚至Sam Altman)的说法,没有万能药。
8. Sander运营着全球最大的AI红队竞赛HackAPrompt。该平台收集了超过60万个提示,并与OpenAI和Anthropic持续合作,处于真实世界LLM压力测试的中心。这是众包安全与游戏机制的独特结合,正在塑造实验室对AI安全的思考。
9. 基于代理的AI系统比聊天机器人更容易受到攻击。目前对提示注入的担忧只是开始。随着AI代理开始预订航班、发送电子邮件,甚至以人形形态行走,风险成倍增加。Sander解释了为什么代理安全是下一个前沿——以及为什么大多数团队还没有准备好。
10. “奶奶”技巧、拼写错误和混淆仍然能欺骗最先进的模型。即使是最先进的LLM也会被出奇简单的黑客手段愚弄。Sander列举了仍然有效的越狱技术,包括情感操纵(例如“像我的奶奶那样告诉我”)、编码输入和创意措辞。
11. 大多数公司使用有缺陷的防御。Sander解释了为什么“提示分离”或添加诸如“忽略恶意输入”之类的短语不起作用。护栏很容易被绕过,当前的分类器通常缺乏捕捉编码攻击的能力。未来的安全必须是模型级别的,而不是后加的。
12. 尽管存在风险,AI的前景是巨大的,值得追求。尽管Sander认真对待安全,但他并不是一个末日论者。他相信AI将拯救生命(尤其是在医疗保健领域)、释放生产力并解决实际问题——只要我们负责任地构建。停止进步不是答案。
1. 提示工程仍然非常活跃——而且比以往更重要。随着公司依赖LLM驱动面向用户的功能和核心功能,它变得更为关键。Sander解释了提示质量如何影响AI性能,特别是在跨产品扩展时。
2. 提示工程有两种不同类型:“对话式”和“产品导向”。大多数人认为提示就是与ChatGPT聊天,但Sander指出真正的杠杆来自于在产品内部构造高性能提示。这些提示被大规模使用,运行数百万次,必须像生产代码一样强化和优化。
3. “少样本提示”可以将准确率从0%提升到90%。最强大的技术之一是向模型展示你想要的精确示例,即少样本提示。Sander分享了一个医疗编码用例,仅通过添加几个示例-标签对,就将结果从完全失败提升到近乎完美。
4. 角色提示(例如“你是一名数学教授……”)在很大程度上是无效的,与大多数人的想法相反。Sander分析了研究,表明虽然角色提示可能有助于语气或写作风格,但对提高正确性几乎没有影响。
5. 分解和自我批评等高级技术能释放更好的性能。Sander概述了如何要求模型首先将问题分解为子问题(分解)或批评自己的答案(自我批评),从而产生更智能、更准确的输出。这些技术在多步推理的类代理环境中尤其有价值。
6. 上下文(“附加信息”)被低估了——但影响巨大。简单地给模型更多相关背景可以大幅提升性能。Sander分享了一些例子,其中包含额外数据(如简历、研究论文或过去的交互)决定了一个提示的成败,尤其是以正确的格式和顺序包含时。
7. 提示注入是真实、危险且传统意义上无法解决的。我们探讨了攻击者如何“越狱”LLM——诱骗它们输出有害、受限或非预期的响应。这些攻击通常绕过“不要做X”之类的传统防御。根据Sander(甚至Sam Altman)的说法,没有万能药。
8. Sander运营着全球最大的AI红队竞赛HackAPrompt。该平台收集了超过60万个提示,并与OpenAI和Anthropic持续合作,处于真实世界LLM压力测试的中心。这是众包安全与游戏机制的独特结合,正在塑造实验室对AI安全的思考。
9. 基于代理的AI系统比聊天机器人更容易受到攻击。目前对提示注入的担忧只是开始。随着AI代理开始预订航班、发送电子邮件,甚至以人形形态行走,风险成倍增加。Sander解释了为什么代理安全是下一个前沿——以及为什么大多数团队还没有准备好。
10. “奶奶”技巧、拼写错误和混淆仍然能欺骗最先进的模型。即使是最先进的LLM也会被出奇简单的黑客手段愚弄。Sander列举了仍然有效的越狱技术,包括情感操纵(例如“像我的奶奶那样告诉我”)、编码输入和创意措辞。
11. 大多数公司使用有缺陷的防御。Sander解释了为什么“提示分离”或添加诸如“忽略恶意输入”之类的短语不起作用。护栏很容易被绕过,当前的分类器通常缺乏捕捉编码攻击的能力。未来的安全必须是模型级别的,而不是后加的。
12. 尽管存在风险,AI的前景是巨大的,值得追求。尽管Sander认真对待安全,但他并不是一个末日论者。他相信AI将拯救生命(尤其是在医疗保健领域)、释放生产力并解决实际问题——只要我们负责任地构建。停止进步不是答案。