前沿LLM在陌生编程语言上表现骤降,EsoLang-Bench被接收。 Lossfunk令人震惊:前沿LLM在标准编码基准上得分85-95%。我们给出了等价的问题,但使用它们无法记忆的语言。它们得分骤降至0-11%。推出EsoLang-Bench。已被ICLR 2026的逻辑推理和ICBINB工作坊接收。 动态Lossfunk2026-03-19原文 打开互动版