Gaia2基准测试:模拟智能手机场景评估AI agent
Gaia2: 基准测试
• 在类似智能手机的世界中设置1,120个场景,包含12个应用程序(聊天、日历、购物、电子邮件等)。
• 六大挑战类型:搜索、执行、适应性、时间、模糊性和Agent间协作(示例见第12–14页,GUI截图中显示了事件图)。
• 场景可验证:将oracle写操作与agent的操作进行比较,使用硬检查(ID、顺序)和软LLM评判(内容)。
• 在类似智能手机的世界中设置1,120个场景,包含12个应用程序(聊天、日历、购物、电子邮件等)。
• 六大挑战类型:搜索、执行、适应性、时间、模糊性和Agent间协作(示例见第12–14页,GUI截图中显示了事件图)。
• 场景可验证:将oracle写操作与agent的操作进行比较,使用硬检查(ID、顺序)和软LLM评判(内容)。