推出VideoGameBench基准测试,评估视觉语言模型玩游戏的实时能力
VideoGame Bench
发布VideoGameBench的研究预览,这是一个基准测试,挑战视觉语言模型实时完成20种来自掌机和PC的不同流行视频游戏。
GPT-4o、Claude Sonnet 3.7、Gemini 2.5 Pro和Gemini 2.0 Flash在VideoGameBench-Lite上使用相同输入提示玩《毁灭战士II》(默认难度)!模型取得了不同程度的成功,但没有一个能通过第一关。
发布VideoGameBench的研究预览,这是一个基准测试,挑战视觉语言模型实时完成20种来自掌机和PC的不同流行视频游戏。
GPT-4o、Claude Sonnet 3.7、Gemini 2.5 Pro和Gemini 2.0 Flash在VideoGameBench-Lite上使用相同输入提示玩《毁灭战士II》(默认难度)!模型取得了不同程度的成功,但没有一个能通过第一关。