动态

介绍S1-Bench,评估LRMs在简单任务上的表现

介绍S1-Bench,评估LRMs在简单任务上的表现
DailyPapers
S1-Bench来了!

一个新颖的基准测试,用于评估大型推理模型(LRMs)在偏向直觉性“系统1”思维的简单任务上的表现。
动态DailyPapers2025-04-20原文

相关内容