动态

RL在已知区域提升性能,未知区域导致幻觉

RL在已知区域提升性能,未知区域导致幻觉
François Chollet
强化学习是一把双刃剑:在已知领域性能提升,但在未知领域,模型容易产生幻觉,认为自己正在执行一个完全不同的训练任务。
Chris
GPT-5.5 在 ARC AGI 3 上得分 0.43%!

- GPT-5.5: 0.43%
- Opus 4.7: 0.18%
- GPT-5.4: 0.20%
- Claude 4.6: 0.45%
- Gemini 3.1: 0.4%

报告显示 GPT-5.5 的失败原因:

- 真实局部效应,错误的世界模型
- 从训练数据中提取的抽象层次错误
- 解决了 https://t.co/6NRTUnzGpY
动态François Chollet2026-05-01原文

相关内容