Salesforce MCP-Universe 测试 AI Agent,GPT-5 领先
来自 Salesforce 的 MCP-Universe: 模拟真实世界 MCP 工具测试 AI Agent 能力,GPT-5 比 Claude-4 分数要高?
- GPT-5,得分 43.72%
- Grok-4,成绩是 33.33%
- Claude-4-Sonnet,只有 29.44%
- Gemini-2.5-Pro,22.08%
- GPT-5,得分 43.72%
- Grok-4,成绩是 33.33%
- Claude-4-Sonnet,只有 29.44%
- Gemini-2.5-Pro,22.08%
🚀 推出 MCP-Universe,一个全面的基准测试,将 LLM 和 AI Agent 推入由真实世界模型上下文协议(MCP)服务器驱动的丰富工具环境!🔌 虽然 MCP 已成为将 LLM 连接到外部工具的“AI 的 USB-C”标准