论文

π-Bench: 长时间跨度工作流中主动式个人助理智能体的评估

π-Bench: 长时间跨度工作流中主动式个人助理智能体的评估

个人助理智能体(如 OpenClaw)的兴起凸显了大语言模型在日常生活和工作中支持用户的潜力。其核心挑战之一是主动式辅助(proactive assistance),因为用户通常以模糊的请求开始,并遗漏重要的需求、约束或偏好。然而,现有基准很少评估智能体能否在用户明确表达之前识别并处理这些隐藏意图,尤其是在多轮交互中用户需求逐渐涌现的场景。 为填补这一空白,我们提出π-Bench,一个面向主动式辅助的基准,包含100个跨5个领域用户画像的多轮任务。通过融入隐藏用户意图、任务间依赖和跨会话连续性,π-Bench 评估智能体在长时间跨度交互中预测和满足用户需求的能力,同时衡量任务完成度与主动性——更贴近真实世界使用。 实验表明:(1) 主动式辅助仍具挑战性;(2) 任务完成度与主动性之间存在明显差异;(3) 先前交互对后续任务中主动意图解析具有重要价值。

论文精读

TL;DR π-Bench 是首个系统性评估个人助理智能体**主动协助**能力的基准,通过 100 个多轮跨会话任务,衡量智能体在用户未明确表述下,识别并满足**隐藏意图**的水平,揭示当前大模型在长程交互中主动预测用户需求的显著短板。

问题

问题背景

大语言模型 驱动的 个人助理代理(如 OpenClaw)正快速发展,其目标是跨越日常生活与工作场景,为用户提供持续支持。这些场景中,用户的初始请求往往是欠指定underspecified)的——用户未说出的需求、偏好与约束常常多于已明确表达的部分。能否在这些隐藏意图hidden intents) 被显式陈述之前就主动识别并满足它们,已成为衡量助理智能化程度的关键标尺。

现有方法局限

当前主流代理基准(如 WebArena、GAIA、OSWorld)主要评估单轮或有限轮次内的指令跟随能力,本质上测试的是被动执行。具体局限包括:

  • 忽略隐藏意图:任务始终给出完整指令,代理无需推断未言明的需求。
  • 缺乏跨任务依赖:不同任务之间相互独立,未模拟真实工作流中上一步输出作为下一步输入的情形。
  • 无跨会话连续性:每次会话重置背景,代理无需从历史交互中提取持久上下文。
  • 主动评估碎片化:少数针对主动性的研究仅覆盖单一封闭场景(如日历调度),缺乏统一的多域、长周期基准。

这些设计导致评测结果与真实用户体验严重脱节:高完成率可能仅意味着代理完成了表面请求,而完全遗漏了深层需求。

为什么这个问题难且重要

识别隐藏意图对代理的多项核心能力提出了复合挑战:

  • 深层推理:需要结合对话历史、领域知识与世界常识,推断用户未明言的约束与目标。
  • 状态记忆与规划:在长周期多任务轨迹中,必须维护跨会话的上下文状态,并理解任务间的因果依赖(例如,先分析数据才能生成报告)。
  • 主动交互:在合适时机通过询问澄清缺口,而非盲目猜测或被动等待。

从产品演进看,业界正从“工具型 AI”(用户明确发令,AI 执行)向伙伴型 AI(AI 预判并主动提议)转变,主动协助能力是提升用户粘性与满意度的核心突破口。缺乏有效评测手段,技术迭代将缺乏清晰方向。

行业类比

这一挑战类似智能客服场景:用户模糊地说“我上个月买的设备坏了”,优秀助理不应仅回复“请提供订单号”,而应主动拉取最近订单、比对保修政策、推荐附近服务点,并预判用户可能需要备用机或发票。

核心洞察

  • - **π-Bench 首次将隐藏意图检测与长期任务依赖融入主动式助手评估**,弥补了现有基准仅关注显式指令完成而忽略用户未言明需求的不足。通过领域特定用户角色、工作流驱动的任务设计以及跨会话依赖,该基准强制 agent 在多轮交互中推断并主动解决用户未直接表述的意图,更真实地模拟了真实个人助理场景。这与既有工作(如只测单轮或显式目标)形成鲜明对比,为主动式 AI 系统提供了一个贴合实际使用模式的评测框架。
  • - **实验揭示任务完成度与主动性之间存在显著差距**,表明仅优化显式任务完成率并不足以打造真正有用的个人助理。π-Bench 分别定义并度量 `proactivity`(是否主动识别并执行隐藏意图)和 `completeness`(对显式请求的完成度),发现即使高完成度模型在主动意图解析上仍表现挣扎。这种双维度评估为模型开发者提供了更细粒度的诊断信号,提醒设计者需刻意构建具备情境推断和主动预判能力的架构,而非止步于指令跟随。
  • - **跨会话先验交互显著提升后期任务的主动意图解析效果**,验证了长期记忆与上下文持续性在个人助理系统中的工程价值。π-Bench 通过依赖结构将多个任务串联,requirement agent 必须利用早期会话中隐式收集的用户偏好或环境信息来推断后续任务中的隐藏意图。实验结果正面回应了“记忆增强是否真能提高主动性”的质疑,为在实践中部署带有持久化用户画像和情境记忆的 agent 系统提供了经验依据。

方法

π-Bench 的构建方法围绕 长期交互中的主动协助 展开,从用户角色与工作流出发,经任务设计、用户代理模拟、评估协议三个核心模块,最终输出 proactivitycompleteness 两个维度的得分。

输入:域特定用户角色与工作流

基准定义了5个领域角色(如研究员、营销人员等),每个角色关联一组真实工作流(workflow)。工作流来源于实际任务流,并经过数据脱敏与筛选,确保任务覆盖跨会话依赖(cross-session dependency)。

关键模块

1. 任务设计
每个任务包含:

  • 初始请求:用户以模糊、不完整的方式发起,模拟真实场景中需求未被充分表达。
  • 隐藏意图:预定义的、未在请求中明确说明的用户需求或约束,需代理在交互中主动推断。
  • 检查清单(checklist):细粒度的完成标准,覆盖显式请求与隐藏意图,用于自动化验证。
  • 评分器(grader):结合程序规则与LLM评判,将代理行为与清单条目对照,给出通过/失败判断。

2. 用户代理
一个脚本化的用户代理模拟多会话交互过程。它根据预定义的用户角色与任务结构,动态响应代理的查询,并管理隐藏意图的状态(如已识别、已解决)。会话终止条件基于交互轮次或意图解决状态。该模块通过跨会话连续性逼真再现长期助理场景,同时引入任务间依赖——前序任务的结果或信息可能成为后续任务中隐藏意图解决的关键。

3. 评估协议

  • Proactivity:衡量代理在用户明确提出前,主动处理隐藏意图的程度。通过统计意图识别与解决的时机计算。
  • Completeness:基于检查清单的通过率,评估任务完成质量,不论是否主动。 两个指标解耦,避免将高完成度误判为高主动性。最终报告权衡了交互代价(如轮次数)的归一化得分。

输出与差异点

输出为每个代理在100个多轮任务上的平均 proactivity 与 completeness 分数,以及按领域、任务类型的细分分析。与现有个人助理基准(如仅关注工具调用或单轮对话)不同,π-Bench 首次系统评估了长视界下对隐藏意图的主动识别与解决,并通过跨会话依赖设计揭示了前期交互对后期意图推断的增益。

实验

实验设计

π‑Bench 构建了 100 个多轮交互任务,覆盖 5 种领域特定的用户画像(如研究员、营销人员等),并内置隐藏意图跨会话依赖来检验模型的主动协助能力。每个任务由初始化请求触发,用户代理根据预制工作流逐步暴露需求,评估对象为 LLM 驱动的个人助手(如 Claude 4.6 Opus、GPT‑5.4、DeepSeek V3.2、Kimi K2.5 等)。系统记录多轮对话轨迹,通过工具调用记录检查清单人工标注联合计算两类核心指标:

  • Proactivity(主动性):在用户未明示时提前识别并满足隐藏需求的能力;
  • Completeness(完成度):是否正确执行所有显式与隐式要求的完整度。

关键发现

  1. 主动协助仍具挑战:所有模型在长周期轨迹中识别隐藏意图的得分普遍偏低,即使基本的任务完成度较高,也不等同于主动性强。
  2. 完成度与主动性明显解耦:许多模型能完成显式请求(高 Completeness),却忽略未表达的约束或偏好(低 Proactivity),证实两类能力需独立评估。
  3. 跨会话上下文的重要性:先前已交互的信息能帮助模型在后续任务中更早推断隐藏意图,利用跨任务依赖的设计使主动行为显著提升,表明记忆与追溯能力是主动协助的关键支撑。
  4. 交互成本与主动性的权衡:增加询问轮次可提升隐藏意图的发现率,但会牺牲效率;最优策略在于平衡主动推断与针对性澄清。

与基线对比的解读

π‑Bench 不同于仅关注单轮显式指令的基准,它首次系统量化了多轮、跨会话、隐藏意图场景下的主动性。实验虽未设置传统“静态基线”版本,但通过对比多种模型的 Proactivity‑Completeness 二维表现,揭示了现有 LLM 在意图推理长期交互规划上的普遍短板。与仅评估对话准确度的基准不同,π‑Bench 强调“用户需求随时间演进”的现实假设,迫使模型在没有完美信息时提前行动。案例研究进一步表明,即使高性能模型也会在看似琐碎的隐藏要求(如文件格式、通知方式)上失败,而具备更强上下文保持能力的模型(如 Claude Opus)在依赖结构设计中恢复迅速,说明面向长期用户的主动记忆机制是下一代个人助手的关键工程方向。

行业影响

落地场景

π-Bench 所定义的主动辅助可直接应用于智能个人助理、客户服务机器人、企业效率工具以及垂直领域(医疗、法律、教育)的专业辅助系统。这些场景的共同特点是存在长周期多轮交互,且用户往往给出模糊请求,隐藏偏好、约束或深层需求。

  • 智能客服:跨会话记住用户偏好,在后续交互中主动建议相关问题或解决方法。
  • 办公助理:根据会议记录与邮件,自动安排差旅、提醒待办,并推测未明说的截止时间。
  • 健康管理:结合历史健康数据,在血糖升高前主动推荐饮食调节,而非等用户询问。

商业价值

  • 体验与留存:主动填补用户意图 reduce 其显式输入负担,可显著提升满意度与粘性,降低流失。
  • 降本与自动化:在长周期任务中减少人工客服或助理的介入,通过代理自动串联多个步骤降低 OPEX。
  • 交叉转化:在电商或金融场景,准确截获隐藏购买倾向(如预算、用途),可于最佳时机触发推荐或优惠,提升 LTV。

与现有产品/工作流的接口

π-Bench 的评估体系(Proactivity 与 Completeness 双维度)可直接集成到对话平台(如 Rasa、Dialogflow、Bot Framework)的回归测试 pipeline,或作为大模型微调的反向反馈。其任务设计富含 inter-task dependencies 和 cross-session continuity,可适配现有记忆增强框架(如 MemGPT、LangChain Memory)的性能基准测试,驱动研发优先解决“隐藏意图识别”和“前序上下文恢复”两个关键能力。

具体落地案例

  1. 电商推荐代理:用户前次浏览了某款相机但未购买,次日再次打开对话时,代理主动推送“该相机已降价 10%”并推荐兼容的存储卡——背后对应 π-Bench 的跨会话连续性隐藏预算约束推理。
  2. 企业法务助理:律所团队使用助理代理跟进案件,用户在第二周仅说“准备起诉材料”,代理应自动拉取上次讨论的核心证据、确定法院管辖并草拟起诉状(依据记忆的管辖约定),而无需用户重新指定。这直接检验代理在先前交互中提取隐藏 intent 的能力。

局限

  • - **领域与任务覆盖范围有限**:π-Bench 围绕 5 个用户角色(如研究员、营销人员等)设计了 100 个长期工作流任务,但真实个人助理场景的多样性远超此规模,不同文化、职业和习惯下的隐含意图与依赖模式可能未被充分探索,基准的泛化性有待更多跨领域验证。
  • - **评估协议依赖 LLM 评判器**:主动性和完整性指标由 LLM 依据人工制定的检查清单打分,虽然论文报告了评判一致性分析,但 LLM 本身的倾向性、对开放端意图的判断偏差仍可能引入系统误差,且长期会话下的人工二次校验成本较高,限制了基准的规模化使用。
  • - **工具与技能集相对简化**:与 WebArena、OSWorld 等涵盖复杂 GUI 和 API 交互的基准相比,π-Bench 的工具定义较为粗粒度(如文件读写、邮件发送等),未能充分考验智能体在真实软件生态中操作细节的能力,可能高估模型的应用表现。
论文Haoran Zhang2026-05-19原文

相关内容