行业新闻

ClawBench 评测:AI Agent 真实网站任务成功率最高仅 33%

这项研究用真实网站测试 AI agent,发现它们连日常操作都难以完成,最强模型成功率也只有三成。

新基准 ClawBench 让 AI agent 在 144 个真实网站上执行订票、购物等日常任务,结果最强模型 Claude Sonnet 4.6 成功率仅 33%,GPT-5.4 只有 6.5%。现有沙箱评测的高分无法迁移到真实场景,且模型常卡在最后一步不提交。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/7ad621b0-56cb-458a-975a-03708c600c8b/015(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) ![图片](/r/blog/6f1dbdae0e3d17e63106ceb4cf8a07ea7dad0451cc2ce9251ac5d8bf44573884.png) - 论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks? - GitHub: https://github.com/TIGER-AI-Lab/ClawBench - 项目主页: https://claw-bench.com/ - 论文链接: https://arxiv.org/abs/2604.08523 - Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench 如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-02原文

相关内容