介绍自监督提示词优化方法SPO,自动迭代改进提示词
这套自监督提示词优化提示词的方法(Self-Supervised Prompt Optimization,SPO)挺有参考价值的:
- 你输入初始提示词和3个测试输入(不需要输出结果)
- 让 AI 对提示词进行优化
- 然后根据测试输入和两组提示词去生成A和B两个结果
- 让 AI 从 A 和 B 中选择更好的输出,然后把生成更好结果的提示词标记为当前最优
- 下一轮继续让 AI 对当前最优的提示词进行优化
- 继续用“新提示词”和“当前最优提示词”+测试输入生成A和B两套结果,继续选出最优,继续优化,继续生成,一直迭代
有点像养蛊,只是同时只有2个提示词,判定提示词好坏的依据就是看生成结果,由AI自己判断哪个结果好还是坏,整个过程完全自动。
从结果来看还不错。
- 你输入初始提示词和3个测试输入(不需要输出结果)
- 让 AI 对提示词进行优化
- 然后根据测试输入和两组提示词去生成A和B两个结果
- 让 AI 从 A 和 B 中选择更好的输出,然后把生成更好结果的提示词标记为当前最优
- 下一轮继续让 AI 对当前最优的提示词进行优化
- 继续用“新提示词”和“当前最优提示词”+测试输入生成A和B两套结果,继续选出最优,继续优化,继续生成,一直迭代
有点像养蛊,只是同时只有2个提示词,判定提示词好坏的依据就是看生成结果,由AI自己判断哪个结果好还是坏,整个过程完全自动。
从结果来看还不错。
无需标签?ØvO 来帮你!很高兴分享我们的新论文:自监督提示词优化 (https://t.co/PsJcS762yW) 🔥 关键特性:ØvO:输出对比输出 - 无需标签或人工反馈!成本降低 99%(0.15 美元),仅需 3 个示例即可达到 SOTA 性能。1/5 https://t.co/cmjtzNwRky