前沿模型依赖内容记忆,缺乏高阶泛化知识
这进一步证明当前前沿模型仍完全依赖于内容级记忆,而非更高级的可泛化知识(如元学习知识、问题解决策略等)。
🚨 震惊:前沿LLM在标准编程基准上得分85-95%。我们给他们提供了他们不可能记住的语言的等效问题。他们的分数降至0-11%。
推出EsoLang-Bench。
已被ICLR 2026的逻辑推理和ICBINB研讨会接受🧵 https://t.co/UElU6wTPg4
🚨 震惊:前沿LLM在标准编程基准上得分85-95%。我们给他们提供了他们不可能记住的语言的等效问题。他们的分数降至0-11%。
推出EsoLang-Bench。
已被ICLR 2026的逻辑推理和ICBINB研讨会接受🧵 https://t.co/UElU6wTPg4