动态

LLM非确定性是可靠性挑战,人类审查是关键

Gergely Orosz
LLM的非确定性本质是可靠使用它们最大的挑战之一。“运行3/10/100次”是一种权宜之计,而非可靠的解决方案。

这就是为什么LLM最适合在人类审查输出的场景中使用,人类可以判断何时丢弃或重新开始!
eric zakariasson
只需要多花点tokens。长远来看更便宜。

模型是概率性的。它们可能(也将会)产生幻觉。

解决方法很简单:多次运行它们。

在cursor中,您可以使用best-of-n或只需重新运行类似“验证实现”的提示词1-n次(尝试这里:
动态Gergely Orosz2026-01-03原文

相关内容