百度文心助手任务Agent PinchBench v2评测登顶,超越Claude和GPT
百度文心助手任务Agent在工程向AI智能体评测中夺冠,证明系统工程能力可显著释放模型潜力。
百度文心助手任务Agent在PinchBench v2评测中获94.6%最高分,超越Claude、GPT等模型。该榜单测试智能体完成真实任务的能力,涵盖办公、编码、分析等场景。百度开源完整评测流程,可复现。
正文摘录
2026 年 7 月 17 日,百度文心助手任务 Agent —— 一种能自主理解意图并分步执行任务的人工智能系统,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。 在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。  这个榜单,测的是最难作假的能力 PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。 当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制 —— 先由程序自动核对结果,再让大语言模型评判过程质量,全程零人工干预。