论文

利用分层过程理解改进主动式 AI 辅助

利用分层过程理解改进主动式 AI 辅助

主动式 AI 助手需要持续观察用户行为,并判断是提供新的指导还是保持沉默。它们应依据任务本身给出恰当指导,根据任务进展决定下一步指导的时机,并按照用户的专业水平与需求调整指导粒度。这些能力依赖能体现过程性结构、并刻画指导如何随任务进度与用户需求变化的数据。然而现有数据集要么只做 检测式 主动理解,要么以 固定粒度 提供过程指导;固定粒度难以反映细粒度进展与更宏观的流程语境,使完成度判断与粒度自适应都变得困难。 为解决上述局限,作者提出 ProactiveCoach 套件,包含用于训练的 ProactiveCoach-Instruct、用于评测的 ProactiveCoachBench,以及一个自适应指导系统(adaptive guidance system)与微调 VLM。ProactiveCoach-Instruct 在 阶段(phase)、步骤(step)、动作(action) 三个层级提供分层结构化的指导,用于学习任务进展与流程语境;ProactiveCoachBench 则评测模型能否在不同指导层级上于恰当时机给出合适指导,并在所需层级变化时作出调整。 实验上,在 ProactiveCoach-Instruct 上微调预训练 VLM 后,该方案在多种 backbone 上均有效。与固定粒度监督 相比,分层监督 使各 backbone 的整体性能最多提升 9.6%p。作者进一步将微调模型与轻量级 guidance router 组合,构建自适应指导系统;无需额外微调,该系统在四种指导层级切换上比 in-context adaptation 基线高出 57.1%p。项目主页:https://jinsuby.github.io/ProactiveCoach/。

论文精读

TL;DR 针对主动 AI 助手缺乏层级程序理解的问题,ProactiveCoach 引入 phase/step/action 三级指导监督与轻量指导路由,让模型在正确时机提供合适粒度指导,层级监督较固定粒度最高提升 9.6%p。

问题

问题背景

主动 AI 助手正从被动响应转向 持续观察与自主决策:系统需要判断用户当前任务进度、决定何时给出下一条指导,以及该指导的详细程度是否匹配用户需求。

现有方法局限

现有数据集主要存在两类不足:

  • 检测式理解:仅关注识别用户是否处于错误状态或是否完成某步骤,不提供程序化指导内容。
  • 固定粒度指导:只提供单一层次(如步骤级)的程序知识,缺少 阶段级宏观上下文 和 动作级细粒度操作,导致模型无法有效判断任务是否完成,也无法在不同指导粒度之间切换。

这带来的直接后果是:模型要么过度提醒、要么信息不足,并且无法根据用户专业水平变化动态调整指导级别。

为什么这个问题难/重要

技术上,需要构建 层次化程序结构(phase / step / action),并生成与任务进度绑定的指导,同时训练模型学习“何时保持沉默、何时给出哪个级别的指导”。评估上也更复杂:需要多粒度基准来测量模型在不同指导级别之间的自适应能力,而不仅是单点准确率。

业界对这类能力关注度高,因为 AR 维修、智能家居、在线教育等场景中,主动助手必须避免频繁打断用户,同时保证信息足够完成任务。

行业类比

这一需求类似于自适应导航系统在驾驶过程中根据实时路况与驾驶员熟练度动态调整提示详细程度:新手得到逐步语音引导,熟练者只收到关键转向提醒。

核心洞察

  • 层次化程序理解(phase/step/action)解决了固定粒度监督的局限,使主动助手能同时建模细粒度进度和宏观任务上下文。现有数据集要么只做检测型主动理解(判断是否干预),要么提供固定粒度的操作指导,无法支持“根据任务进度决定何时提供下一项指导”以及“根据用户水平调整指导级别”。ProactiveCoach 引入三层层级结构,监督模型学习不同粒度的程序表征,实验显示相较仅 step 级监督,层次化监督在不同 VLM 骨干上最多提升 9.6%p 整体表现。
  • 通过轻量 router 实现零额外微调的引导粒度自适应,验证了任务进行中动态切换指导详略的可行性。论文提出的自适应引导系统将微调后的 VLM 与一个轻量 guidance router 结合,不针对 router 做额外微调,就能在四种引导粒度转换场景下超越 in-context adaptation 基线 57.1%p。这为实际部署中的个性化交互提供了低成本方案,区别于以往需要静态设定或重新训练才能改变指导详略的工作。

方法

模型与训练框架

输入为用户连续活动视频帧(多模态 VLM 输入),输出为是否提供指导、指导内容及指导粒度。核心模块包括:

  1. 层次化程序理解:将程序性任务分解为 phase(阶段)→ step(步骤)→ action(动作)三级结构,每级对应不同的指导粒度。VLM 被微调以同时预测当前进度所在的层级位置和应给出的指导内容。

  2. ProactiveCoach-Instruct 构建 pipeline:通过 Procedural Data Curation 收集程序数据,Procedure Hierarchy Construction 将程序组织为层次结构,Proactive Guidance Generation 基于每级结构生成主动指导样本,最后经 Quality Review 过滤。训练时使用层次监督(多粒度标签)替代单一固定粒度监督。

  3. 自适应引导系统:在微调 VLM 之上接入一个轻量级 guidance router,该路由器根据用户请求或反馈动态切换指导粒度(例如从 step 切换到 action),无需额外微调即可实现跨粒度引导转移。

与同类工作的差异:现有方法要么侧重检测式主动理解,要么只提供固定粒度程序指导;本方法通过显式建模阶段-步骤-动作层次结构,使模型同时具备细粒度进度感知与全局上下文理解,并能动态适配用户所需的指导粒度。

实验

实验设计叙述

工作提出 ProactiveCoach 套件,训练集 ProactiveCoach-Instruct 提供 phase / step / action 三层层次化指引,评测集 ProactiveCoachBench 检验模型在不同粒度下的时机与内容适配。微调预训练 VLM,对比固定粒度监督与层次监督,并引入轻量 guidance router 实现粒度自适应。

关键发现

层次监督比固定粒度监督在多个 backbone 上整体性能最高提升 +9.6%p。融合微调模型与路由器的自适应指引系统,在四个粒度转换任务上相比 in-context adaptation baseline 提升 +57.1%p,且无需额外微调路由器。这证明层次化过程理解对主动助手的“何时说”与“说多细”有实质帮助。

与基线对比深度解读

固定粒度监督缺乏细粒度进展和广泛过程上下文,模型难以判断任务完成度与动态调整粒度;in-context adaptation 依赖提示工程,泛化性差。本工作通过结构数据+轻量路由的解耦设计,既提升模型内部表征,又保持推理时灵活性。工程启示:构建层级过程数据是提升主动 AI 助手的有效路径,轻量路由可作为低成本的部署后适配方案。

行业影响

落地场景

ProactiveCoach 的分层程序理解能力可直接用于需要持续观察用户操作并给出适时指导的产品中:

  • 企业级 SaaS 引导:复杂数据分析平台、设计工具或 CRM 的实时操作助手,根据用户当前步骤自动弹出下一阶段提示,新用户获得分步引导,熟练用户仅收到关键节点提醒。
  • AR 远程维护与培训:工业设备维修、医疗设备操作等场景,通过头戴摄像头观察操作流程,在不同阶段提供对应层级的语音或视觉指导。

商业价值

  • 降本:减少人工客服介入,降低新用户 onboarding 的 1:1 支持成本。
  • 增收:提高复杂产品的任务完成率和用户留存,促进订阅转化。
  • 体验提升:根据用户熟练度动态调整指导粒度,避免“过度干扰”或“指导不足”,提升信任感。

与现有产品/工作流的接口

ProactiveCoach 可作为轻量模块嵌入现有 VLM 推理管线:

  • 将微调后的 VLM 接入实时视频流或屏幕录制分析,输出层级化的 phase/step/action 预测。
  • 使用 guidance router 根据用户历史行为或外部指令切换输出粒度,无需额外微调即可适应不同产品需求。
  • 与现有 RAG 知识库 或任务管理系统结合,将预测的下一步动作映射到具体 UI 元素或文档段落,增强可执行性。

具体 use case:

  1. 电商客服辅助:客服人员在处理退货流程时,系统识别当前所处阶段(如“审核申请”),当操作暂停时给出下一步具体操作建议,并根据客服经验调整提示详细程度。
  2. 医疗影像分析工作站:技师在操作扫描设备时,模型根据设备屏幕画面判断当前扫描阶段,适时提示参数调整或下一步序列,降低误操作风险。

局限

  • **数据集构建自动 pipeline 的可靠性风险**:ProactiveCoach-Instruct 依赖 LLM/VLM 自动生成 phase/step/action 三级指导,并辅以人工质量审查。虽然论文报告了审查通过率,但自动生成仍可能引入事实错误、步骤顺序偏差或粒度不一致;尤其跨任务类型(烹饪、组装、维修等)的覆盖有限,完整训练集的任务分布和规模未公开比较。因此,在分布外任务或需要精确安全指导的场景,模型可能产生误导性建议。此外,基于视频的层级标注成本依旧较高,可扩展性受限。
  • **自适应指导系统泛化边界不明**:轻量 guidance router 只在四级指导(phase/step/action/无指导)之间切换,未验证更多粒度或连续自适应;实验对比的 in-context baseline 较弱,无法说明与真正多轮交互或强化学习方法的差距。而且 router 未参与微调,仅依赖冻结 VLM 的隐式表征,可能对 VLM 自身能力高度敏感,更换更强 backbone(如 GPT-4V、Gemini)时优势可能缩小。缺乏真实用户研究,无法衡量真实协助质量和用户满意度。
  • **离线评测与真实 proactive 行为有 gap**:ProactiveCoachBench 主要基于程序化指令和离线视频片段,评估指标(PQS、G-Mean F1 等)衡量与参考指导的相似度,但不直接度量“是否在恰当时刻保持沉默”这一关键 proactive 能力。在真实推理场景,需要模型根据用户实时进度、错误恢复、外部干扰等动态决策,而当前基准无法覆盖这些复杂交互。因此,论文宣称的“proactive”更多是静态步骤预测,而非完整的在线交互策略学习。
论文Jin-Seop Lee2026-10-06原文

相关内容