论文

VitaBench 2.0:评估长期用户交互中的个性化和主动式智能体

VitaBench 2.0:评估长期用户交互中的个性化和主动式智能体

大型语言模型(LLM)已演变为能够与用户在真实任务中协作的交互式智能体。然而,用户意图常分散在碎片化的日常交互中,要求智能体超越显式陈述,进行个性化建模和主动交互。现有基准主要评估推理和工具使用,忽略了真实场景中推断和利用用户偏好的挑战。 为填补这一空白,我们提出 VitaBench 2.0,一个评估长期用户交互中个性化和主动式智能体行为的基准。任务按时间顺序组织为单个用户的序列,用户偏好嵌入在碎片化、异质的交互中。智能体需持续提取、利用并更新偏好以完成任务。主动性通过需识别缺失信息并主动从用户或环境中获取的任务来评估。我们还提供可扩展的 记忆接口,支持不同记忆架构的受控比较。 我们对多种前沿专有和开源 LLM 进行了基准测试。结果表明,即使在最先进的模型中,真实世界的个性化仍然极具挑战性,揭示了当前能力与实际需求之间的巨大差距。进一步分析揭示了当前智能体在真实个性化决策中的失败模式和能力瓶颈,为未来模型改进提供了见解。

论文精读

TL;DR VitaBench 2.0 评估 LLM 智能体在长期交互中基于碎片化数据持续建模用户偏好并主动补全信息的能力,揭示当前模型在真实场景个性化决策上的显著短板。

问题

问题背景

随着大语言模型(LLM)从对话工具演化为长期协作的自主代理(Agent),业界越来越关注 Agent 在真实场景中能否像人类助手一样理解用户未明示的意图与习惯,实现个性化推理主动交互

现有方法局限

当前主流的 Agent 评测基准(如 SWE-bench、GAIA)主要衡量​工具调用多步推理能力,几乎不涉及从碎片化交互中持续挖掘用户偏好。其局限在于:

  • 忽略时序性:任务多为单轮或短序列,缺少对用户历史行为的长期建模,无法检验 Agent 在数天甚至数周跨度上动态更新认知的能力。
  • 忽视偏好嵌入:用户偏好隐藏在稀疏、异构的交互日志(订单、点击、对话)中,现有基准不要求 Agent 从这类噪声信号中抽取并结构化用户画像。
  • 无主动性要求:真实协作经常需要 Agent 识别信息缺口并主动向用户提问或查询环境,而离线评测默认所有必要信息已给出。

为什么这个问题难/重要

个性化与主动性给 Agent 带来三重技术挑战:

  1. 长程记忆管理:交互序列极长(可能数万 Token),模型必须高效区分关键偏好与噪声,并在上下文窗口受限的情况下合理利用记忆模块。
  2. 动态偏好演化:用户喜好随时间漂移,Agent 须做到持续学习而非一次性静态推理,否则会给出过时建议。
  3. 主动决策成本:错误判断何时需主动询问会导致打扰用户或决策失败,这对模型的元认知能力提出高要求。 业界对个性化通用助手的关注度持续攀升(如 Apple Intelligence、Google Project Mariner),然而现有模型在真实个性化任务上的表现仍存在巨大落差,该问题成为 Agent 落地的关键瓶颈。

行业类比

这类似于推荐系统中用用户终身行为序列建模兴趣演化,但 Agent 还需在此基础上主动干预——像一名优秀助理那样,知道什么时候该开口提问。

核心洞察

  • 个性化能力与推理能力存在显著解耦。VitaBench 2.0 在真实长期交互中评估个性化,发现即使前沿 LLM 推理能力强大,在偏好提取与应用上仍表现不佳。这挑战了“推理强则个性化强”的假设,揭示现有基准忽视的盲点:个性化更依赖记忆机制与偏好持续学习,而非单纯推理深度,因此需要专门设计评估与优化。
  • 记忆机制是当前个性化 agent 的性能关键瓶颈而非辅助组件。VitaBench 2.0 提供可扩展记忆接口进行受控对比,结果显示不同记忆架构(上下文窗口、智能体记忆、RAG 记忆)对性能影响巨大,但该维度尚未被充分探索。这提示工程实践中不能简单堆叠长上下文,必须针对碎片化、跨时段交互设计高效提取与更新偏好的记忆策略。
  • 主动交互能力是走向实用 agent 的核心缺失。VitaBench 2.0 的主动性评估要求 agent 识别信息缺失并主动求助,而当前模型普遍失败,这表明现有 LLM 仍停留在被动响应范式,缺乏对未知的认知与交互意图。突破这一瓶颈需要模型具备不确定性感知和面向目标的询问策略,这对构建真正协作式 agent 至关重要。

方法

基准构建流程

VitaBench 2.0 的设计围绕 输入交互流 → 记忆与偏好建模 → 主动决策与评估 这一链条展开。

输入:每个用户被赋予一组按时间顺序排列的异构交互记录,例如购买记录、查询日志、系统反馈等,这些交互呈碎片化、跨域分布且含噪声。用户属性通过两类结构刻画:

  • 用户画像(User Profiles):静态人口统计、消费层级等背景特征。
  • 用户偏好(User Preferences):动态演化,需从交互中持续提取和更新,包括短期波动和长期漂移。

关键模块

  • 任务集:以个性化决策任务为主,例如在记忆敏感的配送场景中,代理需根据用户历史偏好进行动态调整。任务按时间线串联,迫使模型利用过往信息。
  • 记忆模块(Memory Module):核心创新在于提供可扩展的记忆接口,支持对不同记忆架构进行受控比较。实现上涵盖三种范式:
    1. 上下文记忆(Context Memory):将交互历史直接拼入 prompt。
    2. Agentic Memory:代理自主决定存储和检索偏好。
    3. RAG Memory:基于检索增强生成,从外部知识库提取相关偏好。
  • 主动交互(Proactiveness):任务设计中故意制造信息缺口,代理必须识别缺失信息并主动向用户或环境发起询问,而不是被动等待全部输入。

输出:代理根据当前状态、动态偏好记忆和主动获取的信息做出决策,完成个性化任务。

与同类方法的差异

不同于现有基准仅评估推理或工具调用能力,VitaBench 2.0 首次将长期用户交互中的个性化偏好推断、持续更新与主动信息获取纳入系统化评测,揭示了当前大模型在真实世界个性化决策上的能力瓶颈。

实验

实验设计:VitaBench 2.0 为每个用户构建了时间有序的交互序列,将偏好隐藏于碎片化、异构的日常行为中。任务要求代理从中持续提取、更新并应用偏好,并主动询问缺失信息。通过可扩展内存接口控制不同内存架构(如上下文记忆、Agentic 记忆、RAG 记忆),系统对比多种前沿闭源与开源 LLM。

关键发现:1. 现实世界个性化对当前代理仍极具挑战,SOTA 模型与实用要求差距显著。2. 记忆机制作用关键但尚未被充分探索,不同内存后端性能差异明显。3. 通用推理改进并不能直接转化为个性化能力的提升。4. 长期交互积累的上下文处理与记忆管理构成核心瓶颈,代理难以识别信息缺口并主动交互。5. 即使给定真实偏好,代理有效利用它们的能力依然不足;失败分析表明个性化是首要瓶颈。

基线对比:与同类个性化基准不同,VitaBench 2.0 强调动态、跨域的长程交互中的偏好追踪,并分离出记忆架构的影响。结果显示,仅扩展上下文窗口无法弥补代理在理解与利用隐性偏好上的缺陷,而主动交互能力在现有模型中普遍薄弱。

行业影响

落地场景

VitaBench 2.0 所定义的 个性化 + 主动性 代理范式,直接面向需要长期陪伴、持续理解用户的应用产品:

  • 电商与本地生活:购物助手或外卖 agent 从数周甚至数月的订单、浏览、收藏中推断口味、预算、品牌偏好,主动提醒补货或推荐新品。
  • 内容平台:视频/文章推荐 agent 不再仅靠即时点击,而是基于用户在不同时间段、不同场景下的兴趣漂移,在用户空闲时主动询问“是否想看点新领域的内容”。
  • 个人效率工具:日历/邮件 agent 记住用户的会议时长偏好、常用联系人、安静时段,主动提示冲突或建议重排。
  • 金融顾问:从用户的消费流水、投资行为中提取风险偏好变化,当市场波动时主动推送风险提示,而非被动等待用户询问。

商业价值

该基准指向的核心能力——从碎片化跨会话交互中持续提取并利用偏好——可同时在多条业务线上创造价值:

  • 降本:主动识别信息缺口并询问用户,可显著减少因理解偏差导致的售后纠纷或人工客服介入。
  • 增收:更精准的个性化推荐带来更高的转化率;主动补货或升级建议直接创造交易机会。
  • 体验提升:用户无需重复表达需求,agent 表现出“记忆”和“成长”,从而提升留存与付费意愿。

论文实验揭示,当前领先模型在真实世界个性化任务中仍有巨大 gap,这恰恰意味着率先突破该能力的团队将获得差异化竞争优势。

与现有产品/工作流的接口

VitaBench 2.0 提供的 可扩展记忆接口(支持 Context Memory、RAG Memory、Agentic Memory)可直接对接到业界主流 agent 框架:

  • LangChain / LlamaIndex:替换默认的 ConversationBufferMemoryVectorStoreRetriever,升级为 偏好感知记忆模块,让已有问答/任务型 agent 快速获得长期个性化能力。
  • Coze / Dify 等低代码平台:在知识库之外引入 用户偏好库,与用户画像系统打通,agent 在每次交互时自动检索并更新该库。
  • 任意 LLM 应用后端:通过标准化 API 接入记忆后端,评测流水线(用户模拟器、任务环境、指标计算)可作为 CI/CD 的一部分,持续监测个性化与主动性能力的漂移。

具体落地用例

  1. 音乐流媒体:一名用户早晨通勤常听快节奏电子乐,但周末下午会听古典乐。agent 不应仅按最近播放推荐,而要结合时段和周期性模式制定歌单。某个周一早晨用户突然打开慢歌,agent 可主动询问:“今早看起来很安静,需要切换到放松模式吗?”若用户给予肯定反馈,agent 应更新该时段的偏好分布,而非一次性规则。
  2. 企业差旅助手:agent 记住该员工偏爱靠过道座位、对酒店 Wi-Fi 评分敏感、常选择某连锁品牌。当系统检测到一趟新行程时,agent 主动推送符合条件的航班和酒店,并提示“上次你反馈 X 酒店 Wi-Fi 不佳,已为你排除”。若该员工临时改为携带家属出行,agent 在首次交互中识别到该异常时主动询问是否需要三人房或儿童餐,从而避免一周的错误推荐。

这些场景均需要连续抽取、更新和利用碎片化偏好,并对信息缺口采取主动交互,这正是 VitaBench 2.0 量化评测的关键维度。

局限

  • **评估环境与真实交互的差距**:VitaBench 2.0 使用**用户模拟器**生成交互历史并执行主动询问,虽然模拟器基于用户画像构建,但仍难以完全复现真实人类偏好的**动态漂移、隐性情感因素以及多模态交互**(如语音、表情)。用户主动提供信息的意愿和方式与真实场景存在差异,可能导致评估结果高估或低估实际部署效果。此外,当前任务集集中于**配送与生活服务**类场景,领域多样性不足,跨领域泛化能力未经验证。
  • **记忆机制分析的广度有限**:论文提供了可扩展的记忆接口,并对比了三种记忆架构(Context Memory, Agentic Memory, RAG Memory),但实验仅以数值结果呈现,**缺乏对不同记忆架构在长序列中信息遗漏、误检索等典型失败的深入归因**。同时,基准未考虑**隐私保护与遗忘机制**,而这在长期用户交互中至关重要(例如 GDPR 合规)。记忆模块的设计与评测维度仍需进一步深化,以支撑工业级系统的选型。
  • **评估指标的结构性局限**:主要指标为任务成功率与主动询问准确性,但**未对个性化程度本身(如偏好匹配的精确率/召回率)进行细粒度拆解**。即使任务成功,也可能因为偏好更新滞后或冗余询问导致用户体验下降。与**AgentBench**等通用智能体基准相比,缺少对效率、对话轮次、用户满意度等**过程性指标**的测量,难以全面反映智能体的综合表现。同时,基线模型选择虽覆盖前沿开源与闭源,但未能探索**多智能体协同或具有长期记忆预训练**的模型变体,限制了对比的启示价值。
论文Yuxin Chen2026-05-26原文

相关内容