索求从未被要求之物:Agent 中的横向与纵向主动性
使用工具的 agent 通常只回应用户明确提出的事项,但完成任务往往需要用户从未要求过的信息。现有关于主动 agent 的研究,主要关注 agent 是否以及何时该主动行动,而非它应当追求何种信息。 我们研究主动性的另一个维度:内容。横向主动性 追求当前上下文已经指明的未言明信息,纵向主动性 追求只有更早证据才能揭示的需求。need graph 从 benchmark 自身的任务分解中恢复,记录哪些需求依赖于哪些需求,因此两种主动性形式、以及 agent 是否在正确时机停止,都能仅凭 transcript 打分,无需 model judge。 为学习该行为,我们提出 Q&D(questioner and drafter),训练 questioner 偏好那些其续写能检索到更多所需证据的问题,无需 reward model 或 judge。在三个 multi-hop 问答 benchmark 的 held-out split 上,在相同 retrieval 开销下,训练后的 questioner 在两种主动性上均优于同一模型经 prompting 的结果,并在三个中的两个上超过同角色下大 15 倍的 prompted 模型,且该增益在控制提问数量与长度后依然存在。无需额外训练,我们把 questioner 放入带模拟客户的交互式客服 agent,它能完成更多任务同时提问更少;在零售场景中,它以更少的客户追问轮次胜过 15 倍大的模型。 这些结果表明,主动性不只取决于 agent 是否未经要求就行动,还取决于它选择追求什么、以及何时停止。
论文精读
TL;DR Q&D 用“需求图”量化主动提问的水平/垂直内容,训练提问者在不依赖奖励模型时选择能检索最多必需证据的问题;多跳 QA 上小模型超越 15 倍大模型,并可迁移到客服代理。
问题
问题背景
当前 agent 研究主要关注工具调用与任务执行,但多数系统仅响应用户显式请求,忽略完成任务所必需的未声明信息。现有关于 proactive agent 的工作集中在 agent 是否应该主动行动、何时行动,而非主动追寻什么内容。
现有方法局限
- 现有工作缺少对主动性内容的细粒度度量:通常用二元判断(是否主动)或依靠 LLM 评判器评估对话,主观且无法区分信息追求的深度。
- 传统多跳问答 / 检索 agent 按用户问题直接检索,未显式建模信息需求之间的依赖关系,导致遗漏深层证据或过早停止。
- 强化学习或 reward model 方法训练 agent 询问,依赖昂贵的人工标注或评判器,难以扩展到复杂长程任务。
为什么这个问题难 / 重要
主动性内容需要在“当前上下文已识别但未声明的信息”(水平)与“仅由早期证据揭示的新需求”(垂直)之间做动态取舍,同时判断何时停止追问。这要求 agent 对任务依赖结构有隐式理解,而非单纯的意图分类。业界对客服、零售、调研等场景中的 agent 效率有高要求:减少冗余轮次、提升任务完成率直接关系成本与体验。因此,可量化、可训练且无需外部 judge 的主动性机制具有工程价值。
行业类比
类似 AI 客服助手 在处理退货请求时,不仅需要用户明说的订单号,还要主动查询同一订单的支付方式、物流时效和退款政策,才能一次性给出完整方案,而非多轮反复追问。
核心洞察
- 本文将主动性拆解为水平主动性与垂直主动性:水平主动追求当前上下文已识别但未被明确请求的信息,垂直主动追求只有通过早期证据才能揭示的深层需求。这一区分让主动性的“内容”成为可度量、可训练的目标。区别于以往只关注“是否主动”或“何时主动”的工作,该方法从基准自身的任务分解中自动构建需求图,无需 LLM judge 即可对转录评分,避免了主观评判偏差,并将主动内容从模糊概念转化为客观指标。
- Q&D 训练提问者时完全绕开奖励模型和最终答案正确性,转而以“该提问的后续检索能覆盖多少需求图中缺失证据”作为直接监督信号。这种设计避免了稀疏奖励和训练成本高的问题,并让模型学会提出能触发深层依赖检索的问题。与基于答案正确性优化 agentic search 的主流方法相比,Q&D 直接优化信息获取过程本身,因此在同等检索预算下,8B 提问者能在两个基准上超过 15 倍大的提示模型,并泛化到客户服务场景中减少追问次数。
方法
方法概述
Q&D 将主动性内容建模为 need graph 上的证据检索优化问题。输入为多跳任务上下文与已收集证据集合,输出为 questioner 的下一步动作(提问或停止)。
- Need graph 构建:从基准自带的问题分解中恢复有向无环图,节点表示原子信息需求,边表示依赖关系(例如回答某子问题需先获得另一子问题的答案)。该图独立于模型,是无需 LLM 裁判的评分依据。
- Drafter 模拟:对候选问题,drafter 快速模拟其后续交互轨迹(包括可能的工具调用和检索),得到证据集合。
- 证据匹配评分:将检索结果与 need graph 中尚未满足的节点匹配,计算覆盖率(尤其深层依赖节点)。不使用奖励模型或 LLM 裁判,仅用该覆盖率作为偏好信号。
- Questioner 训练:采用偏好学习,使 questioner 倾向于选择“后续能检索更多所需证据”的问题;同时训练停止策略,当继续提问不能显著增加证据覆盖时选择停止。
训练完成后,questioner 可独立部署于客服代理等场景,以更少提问完成更多任务。
与同类方法的差异:现有主动代理研究聚焦“是否行动”(when/if),Q&D 聚焦“行动内容”(what),且用可计算的 need graph 替代模型裁判提供监督。
实验
实验设计
作者从 benchmark 自身的分解中构建 need graph,记录需求之间的依赖关系,从而无需模型评判即可从 transcript 中量化 水平主动性(水平追求当前上下文已识别的未明说信息)和 垂直主动性(追求由早期证据揭示的更深层需求)。训练方法 Q&D 训练一个 questioner,直接优化其追问能检索到的所需证据数量,不依赖奖励模型或 judge。评估在三个多跳 QA 基准的 held-out 划分上进行,对比同模型提示、大 15 倍模型提示,并控制问题数量和长度。此外,将训练后的 questioner 嵌入交互式客服代理,测试任务完成率和提问次数。
关键发现
在相同检索开销下,Q&D 训练的 questioner 在水平和垂直主动性上均优于同模型提示,并在三个基准中的两个上超越大 15 倍的提示模型;控制问题量和长度后增益依然存在。无需进一步训练,该 questioner 在客服代理中完成更多任务且提问更少,零售场景下优于大 15 倍模型,客户需要更少的跟进轮次。
基线对比解读
与传统研究关注“是否主动行动”不同,本文聚焦“主动追求什么内容”和“何时停止”。Q&D 不使用奖励模型,避免了人工评判偏差,直接以检索证据量作为训练信号,训练效率高且可扩展。相比提示工程,训练得到的 questioner 行为更一致、更深入;大 15 倍模型在提示下并未表现更好,说明任务特定的轻量训练可以超越通用大模型的零样本能力。
行业影响
落地场景
Q&D 训练的 questioner 可直接嵌入需要主动信息获取的 agent 场景:
- 电商售后客服:用户描述故障但未提供订单号、设备型号、购买时间时,agent 能横向追问当前上下文缺失的字段,也能纵向追溯此前对话中隐含的保修状态或历史工单。
- 企业知识库 / RAG 助手:处理多跳问题(如“某客户最近一次续约的合同金额是多少”)时,questioner 会主动检索当前上下文未明确、但完成答案必需的证据,而非机械执行用户字面请求。
商业价值
主要收益落在降本与体验提升两条线:
- 降本:论文显示同等检索开销下,8B questioner 在两个 benchmark 上超过 15 倍大的 prompted 模型;更少追问、更高任务完成率直接降低 token 消耗与平均服务时长。
- 体验:用户不必被反复盘问,agent 能自己补齐缺失信息并在合适时机停止,减少交互摩擦。
- 训练成本:无需 reward model 或 LLM judge,仅靠 question 的检索证据恢复情况即可训练,中小企业也能复现。
与现有产品/工作流接口
- 模块化集成:将 questioner 作为 agent pipeline 中独立的一环,与 retriever、answerer 解耦;现有 RAG 或 function-calling 架构只需替换中间提问策略,不需要重构。
- 可观测性:need graph 从任务分解自动构建,允许在 transcript 上直接评分 horizontal/vertical proactivity 和 stopping,无需额外 judge,适合接入 CI 回归测试。
- 领域适配:企业可基于自身任务库导出 need graph,用 Q&D 微调自有小模型,快速获得领域专用的主动提问能力。
局限
- 论文在三个多跳 QA 基准和两个模拟交互场景(客服 / 零售)上验证,但 **need graph** 从数据集的分解规则自动恢复,对标注结构有较强依赖;真实生产环境中的任务通常缺乏显式、可验证的需要依赖链,且用户行为高度动态,模拟器不能完全代表真实主动式 agent 的部署条件。相较使用 LLM judge 的既有主动 agent 评测,本方法虽避免主观评判,但牺牲了场景泛化性。
- Q&D 训练 **questioner** 时以检索到更多所需证据为奖励信号(无 reward model),但该目标并不直接等价于最终答案质量或任务成功率。论文提到 stopping 行为仍滞后,说明模型可能过度提问或未能学会最优停止时机;且证据增益在 answer 之前可能会丢失(附录 G.1 暗示)。此外,训练仅针对提问策略,回答器未联合微调,限制了端到端性能提升。
- 实验所用 backbone 为 Qwen3-8B,对比模型规模约 120B(15×),但未涵盖更多模型家族和规模;方法在训练中依赖 gold firewall 与 benchmark 的 need graph,新领域若无法获得可靠依赖图,需先人工构建或额外抽取,论文未给出自动化构建 need graph 的通用方案,迁移成本未评估。