动态

新论文揭示LLM长程执行幻觉,大模型未来在测试时计算

新论文揭示LLM长程执行幻觉,大模型未来在测试时计算
Shashwat Goel
新鲜出炉的论文:关于递减回报的幻觉——衡量LLM中的长程执行能力。

小型模型是代理AI的未来吗?由于递减回报,扩展LLM计算是否不值得成本?自回归LLM是否注定失败,思考是否是幻觉?

LLM扩展的看空论点都关联到一个单一能力:长程执行。然而,这恰恰是您应该看好扩展模型规模和测试时计算的原因!

> 首先,还记得METR图吗?它可能可以用@ylecun的复合误差模型来解释。
> 模型的任务长度在单步精度上呈超指数增长(@DaveShapi)。
> 结果1:不要被典型短任务基准上进展放缓所迷惑,这足以让任务长度呈指数增长。

但我们超越了@ylecun的模型,对LLM进行了实证测试……

> 即使您提供了必要的计划和知识,LLM执行起来也很困难。
> 我们不应将执行失败误解为无法“推理”。
> 即使小模型有100%的单步准确率,大模型在成功率阈值以上也能执行更多的轮次。

> 注意到您的代理任务越长性能越差吗?这不仅仅是长上下文限制……
> 我们观察到:自我条件效应!
> 当模型看到自己历史上犯过的错误时,它们在未来的轮次中更可能犯错。
> 增大模型规模会加剧这个问题——这是一个罕见的逆缩放案例!

那么思考呢……?

> 思考不是幻觉,而是执行的引擎!
> 即使是DeepSeek v3、Kimi K2在要求无链式思考(CoT)执行时,也无法潜在地完成5个轮次……
> 而有了CoT,它们可以完成10倍以上的任务。

那么前沿呢?

> GPT-5 Thinking远远领先于我们测试的所有其他模型,可以一次执行1000步以上的任务。
> 第二名是Claude 4 Sonnet,432步;然后是Grok-4,384步。
> Gemini 2.5 Pro和DeepSeek R1远远落后,只有120步。

> 这就是GPT-5代号为Horizon的原因吗?🤔
> 开源还有很长的路要走!
> 让我们一起成长!我们开源所有代码和数据。

我们进行了深入的探讨,并在下方展示了最佳的总结和精彩图表👇
动态Shashwat Goel2025-09-12原文

相关内容