美团 LongCat 开源 VitaBench 2.0,评测 AI 长期动态用户建模能力
VitaBench 2.0 揭示了 AI 在长期理解用户上的短板:时间越长遗忘越快,且缺乏主动提问的“眼力见”,个性化能力亟待提升。
VitaBench 2.0 是首个面向长期动态用户建模的智能体评测基准,包含 56 名虚拟用户、819 个复杂任务及超 2000 个动态偏好,时间跨度长达 4.3 年。结果显示,最强模型在“开卷”模式下平均分仅 0.5,且 AI 普遍缺乏主动性,个性化已成当前智能体最大瓶颈。
正文摘录
 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆 美团技术团队 2026-06-29 LongCat 开源 大模型 一个经常加班的白领,一个带着孩子出游的父亲,你的 AI 助理能分清他们需要什么样的服务吗? 现实是,它常常分不清。 AI 能执行你明确的指令,却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解,还是“情商”不够高呢? 自去年 10 月发布了 VitaBench 1.0 ,首次定义了生活场景下智能体任务的复杂度,美团 Longcat 团队再次推出 VitaBench 2.0,它不再仅仅关注任务有多难,而是将目光投向了更深层次的挑战。 VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。 VitaBench 2.0 的核心“硬核”看点: - 高难度业界首创:首次将智能体场景与丰富用户生态相结合,打造面向长期动态用户建模的智能体基准。其包含 56 名真实特征用户、819 个复杂任务、超 2000 个动态偏好及 66 个可执行工具。 - 超长跨度动态追踪:平均每位用户包含 2093 个交互事件,平均时间跨度长达 1580 天,严格按时间线向 Agent 暴露,真实还原用户偏好的演进与漂移。 - 统一评测生态:针对长文本上下文学习(In-context learning)与智能体记忆策略(Memory Strategy)的统一评测平台。