OpenCompass 发布 SWE-Bench Pro 验证版,前沿模型得分远低于此前报告
转推 @HuggingPapers:SWE-Bench Pro 验证版
OpenCompass 发布了 SWE-Bench Pro 的验证版本,修复了奖励作弊(reward hacking)和任务质量问题,结果显示前沿模型的得分远低于此前报告的水平。https://t.co/Kge7PMDE3K
OpenCompass 发布了 SWE-Bench Pro 的验证版本,修复了奖励作弊(reward hacking)和任务质量问题,结果显示前沿模型的得分远低于此前报告的水平。https://t.co/Kge7PMDE3K