动态

智谱AI发布ZClawBench基准测试,用于评估AI agent在办公、编码和数据分析任务

智谱AI发布ZClawBench基准测试,用于评估AI agent在办公、编码和数据分析任务
DailyPapers
智谱AI刚刚在Hugging Face上发布了ZClawBench,一个用于评估AI智能体在现实OpenClaw任务(涵盖办公自动化、编码和数据分析)中表现的现实基准,包含116个多样化的测试用例。
动态DailyPapers2026-03-24原文

相关内容