发布开源AI agent评估框架Claw-Eval,包含104项任务
智能体正在做实际工作,但现有基准仍孤立测试它们。今天我们发布Claw-Eval:一个开源、透明的AI智能体评估框架。我们提供104项任务,涵盖日常助手、办公QA、深度金融研究和终端使用。通过可配置的错误注入,在真实和模拟服务上测试完成度、鲁棒性和安全性。完全可追溯且经过人工验证。首个排行榜结果:Claude Opus 4.6通过率最高(68.3%),但Gemini 3.1 Pro在平均分上略胜(0.764 vs 0.759)。智能体还有很长的路要走。查看:https://claw-eval.github.io