介绍S1-Bench,评估LRMs在简单任务上的表现 DailyPapersS1-Bench来了!一个新颖的基准测试,用于评估大型推理模型(LRMs)在偏向直觉性“系统1”思维的简单任务上的表现。 动态DailyPapers2025-04-20原文 打开互动版