ClawBench 评测:AI Agent 真实网站任务成功率最高仅 33%
这项研究用真实网站测试 AI agent,发现它们连日常操作都难以完成,最强模型成功率也只有三成。
新基准 ClawBench 让 AI agent 在 144 个真实网站上执行订票、购物等日常任务,结果最强模型 Claude Sonnet 4.6 成功率仅 33%,GPT-5.4 只有 6.5%。现有沙箱评测的高分无法迁移到真实场景,且模型常卡在最后一步不提交。
正文摘录
.jpg)   - 论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks? - GitHub: https://github.com/TIGER-AI-Lab/ClawBench - 项目主页: https://claw-bench.com/ - 论文链接: https://arxiv.org/abs/2604.08523 - Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench 如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。