RL在已知区域提升性能,未知区域导致幻觉
强化学习是一把双刃剑:在已知领域性能提升,但在未知领域,模型容易产生幻觉,认为自己正在执行一个完全不同的训练任务。
GPT-5.5 在 ARC AGI 3 上得分 0.43%!
- GPT-5.5: 0.43%
- Opus 4.7: 0.18%
- GPT-5.4: 0.20%
- Claude 4.6: 0.45%
- Gemini 3.1: 0.4%
报告显示 GPT-5.5 的失败原因:
- 真实局部效应,错误的世界模型
- 从训练数据中提取的抽象层次错误
- 解决了 https://t.co/6NRTUnzGpY