美团发布 Agent 评测白皮书:拆解评测体系的四个模块与两条 Loop
美团系统讲解 Agent 评测体系怎么搭:评测集是量具也得定期校准,线上真实样本同时喂给「评测演进」和「Agent 演进」两条 Loop。
搭 Agent 的门槛在快速降低——基座模型能力变强、框架组件越来越标准,但「怎么把 Agent 做好」的评测认知仍然稀缺。大量项目死在 Demo 阶段、扩量阶段或说不清业务价值上,共性是缺少可靠的判断机制。美团把两年实践总结成完备评测体系:四个模块、三种能力、两条相互咬合的 Loop,以及可复用的评测资产。
正文摘录
 《Agent 评测白皮书》系列01:Agent 评测全览 图灵Agent评测 2026-09-10 Agent评测 大模型 综述 搭一个 Agent 正在变得越来越容易 过去三年,有两条趋势在同时发生。 一是 基座模型的能力持续进化 ,它带来的结果是对使用者的要求在往下降。早期要让模型稳定地按格式输出、正确地选中一个工具,需要反复打磨 Prompt、设计各种兜底。现在这些能力越来越多地由模型本身承担,长上下文、原生工具调用、更强的指令遵循和多步推理,把大量原本需要工程去补的地方补上了。 二是 Agent 框架的功能持续丰富 。从早期需要自己实现规划、记忆、工具注册和状态管理,到现在框架和协议层把这些抽象成标准组件,接一个工具、加一个 Skill,工作量都在显著下降。 两条曲线叠加,结论很直接:搭建 Agent 门槛正在逐年降低。这带来的直接变化是 Agent 落地场景越来越多,越来越发散。 评测认知的稀缺 自 2022 年底 ChatGPT(基于 GPT-3.5)发布以来,市场上出现了一波又一波 Agent 项目。但是那些真正走过冷启动、完成灰度扩量、推到全量的项目数量屈指可数。这导致掌握 Agent 评测方法的人非常稀缺。 过去三年绝大部分 Agent 项目都死掉了。它们消失的原因有一些共性: - 停在 Demo :演示效果很好,一接真实流量就发现覆盖不住,用户的问法、数据的脏乱、场景的边界远超预期,团队疲于打补丁,最后不了了之。 - 卡在扩量 :小范围试用还行,一放量各种问题集中暴露。