智谱AI发布ZClawBench基准测试,用于评估AI agent在办公、编码和数据分析任务 DailyPapers智谱AI刚刚在Hugging Face上发布了ZClawBench,一个用于评估AI智能体在现实OpenClaw任务(涵盖办公自动化、编码和数据分析)中表现的现实基准,包含116个多样化的测试用例。 动态DailyPapers2026-03-24原文 打开互动版