行业新闻

15家学术机构联合发布评测系统HarnessEval,将评测流程智能体化

HarnessEval 将评测过程本身变为可规划的智能体工作流,用于动态、可追溯地评估复杂 AI 系统。

AI Agent 的能力不再只取决于模型,还依赖上下文管理、工具调用、任务拆解等系统层组件。评测也应如此。HarnessEval 由清北、Berkeley、MIT 等机构联合发布,把评测任务拆解为计划、路由、分解、验证四阶段,让评测智能体动态决定测什么、怎么测,并生成可追溯的证据树,而非套用固定指标。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-18原文

相关内容