百度文心助手任务 Agent 在智能体评测 PinchBench 登顶
百度文心助手任务 Agent 在 PinchBench(工程向智能体评测)上夺冠,证明其任务完成能力领先 Claude、GPT 等模型,且开源评测流程可供复现。
PinchBench 考核智能体完成真实工作场景任务的能力,而非仅知识问答。百度文心助手任务 Agent 以 94.6% 的最高分超越 Claude、GPT 等模型,成为首个登顶该榜单的国产智能体系统。评测流程已开源,可逐条复现。
正文摘录
2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。 在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast (93.5%)、阿里通义千问 Qwen3.7-max (92.5%)、Anthropic Claude Opus 4.8 (90.5%)、OpenAI GPT-5.6-luna (88.7%)。 PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。 当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。 更关键的是,PinchBench 用于衡量模型与 Agent 框架的综合能力。即便是同一底座模型,搭载不同 Agent 框架,最终评测得分也会存在较大差距。这也说明,文心助手任务 Agent 取得榜首成绩,代表的是模型能力与系统工程协同打造的综合实力第一。 百度 AI 搜索团队在 GitHub 上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全量公开,任何人都可以逐条复现。