论文

RESCUE-BENCH:面向关系感知的多方情感支持对话系统

RESCUE-BENCH:面向关系感知的多方情感支持对话系统

现有情感支持对话系统主要聚焦一对一的 seeker-supporter 交互与个体情绪状态,多方场景中的人际关系仍未被充分探索。本文提出 关系感知情感支持对话(relation-aware emotional support conversation),一项新任务,用于评估 LLM 能否捕捉并利用不断演变的关系动态,从而提供更有效的情感支持。 我们基于真实的情侣与家庭访谈对话构建了 RESCUE(Relation-aware Emotional Support Conversation Understanding and Evaluation Benchmark),包含 191 个样本、7,079 个标注轮次和 1,064.8 分钟视频。基于对社会情感与支持相关动态的丰富标注,RESCUE 定义了六项任务,评估关系感知情感支持所需的两种核心能力:关系理解(Relational Understanding)与 关系敏感支持(Relation-Sensitive Support)。 十个 LLM 的实验表明,当前模型在依赖局部情绪或干预线索的任务上表现相对较好,但在关系密集型任务上明显吃力,例如: - 关系模式预测(relation pattern prediction) - 观点预测(viewpoint prediction) - 支持策略预测(support strategy prediction) 这些发现揭示了当前 LLM 在建模人际关系、做出关系敏感支持决策方面的局限。

论文精读

TL;DR RESCUE-Bench 构建了首个关系感知的多方情感支持对话基准,用真实伴侣/家庭访谈评估 LLM 理解人际动态并提供关系敏感支持的能力,发现当前模型在关系模式预测等核心任务上明显不足。

问题

问题背景

当前情感支持对话系统(ESC)大多针对一对一 seeker-supporter 交互,聚焦个体情绪识别与回应生成,但真实支持场景常涉及夫妻、家庭等多方参与者,人际关系的演化未被纳入建模。

现有方法局限

现有 ESC 数据集和模型主要依赖局部情绪线索(如单轮情感标签)或干预行为分类,缺乏对关系模式(relation pattern)、观点对立(viewpoint)及支持目标选择(support target)的联合建模。例如,现有多方对话数据集要么只做情绪分类,要么未标注关系动态;LLM 在关系密集型任务(如 relation pattern prediction、support strategy prediction)上表现明显低于局部情绪/干预线索任务,说明模型仅记忆表面模式,无法推理“谁与谁冲突、何时介入、支持哪一方”等高阶决策。

为什么难且重要

多方案例中,支持者需同时判断:1)当前关系处于何种模式(如 couple 冲突升级 vs. 家庭联盟);2)介入时机是否恰当;3)支持目标与策略是否与关系状态匹配。这些能力要求模型持续建模动态关系图,而非单轮分类。随着 AI 在心理健康、家庭咨询等真实场景的渗透,关系感知的支持决策成为关键缺口,现有 benchmark 无法评估这一能力。

行业类比

类似于多智能体协作系统(如自动驾驶多车交互或客服多方协商),不能只预测单智能体行为,而需理解角色间冲突与联盟关系,才能做出安全/合理的干预决策。

核心洞察

  • **关系感知的多方情感支持基准 RESCUE 将评估重心从个体情绪转向动态人际关系的理解与利用。** 与现有 ESC 系统聚焦一对一求助者-支持者互动、仅输出情绪标签或回复生成不同,RESCUE 从真实夫妻与家庭访谈中提炼六个任务,明确区分 **Relational Understanding** 与 **Relation-Sensitive Support** 两类能力,要求模型同时建模关系模式、观点差异和介入时机。实验表明,主流 LLM 在依赖局部情绪/干预线索的任务上表现尚可,但在关系模式预测、观点预测、支持策略预测等关系密集型任务上明显退化。这揭示了当前 LLM 缺乏对多参与方关系演化的显式表征,提示工程实践需引入关系状态跟踪或图结构先验,而非仅依赖隐式序列建模。
  • **基于真实夫妻/家庭访谈视频的多方情感支持数据,为 relation-aware ESC 提供了高生态效度的评估场景。** 相比常见的合成对话或双人轮换对话数据集,RESCUE 的 191 个样本、7,079 标注轮次、1,064.8 分钟视频保留了自然的多人互动节奏、话语打断与情感传递,其标注维度涵盖 socio-emotional 与 support-related 动力学。这种真实数据驱动的关系动态分析,使得 benchmark 能够暴露 LLM 在长程关系推理中的脆弱性,也促使模型设计从单轮情绪分类转向对关系状态的持续更新与联合优化,为后续引入 **relational state tracker** 或 **memory-augmented LLM** 提供了明确的需求信号。

方法

方法概述

RESCUE-Bench 将关系感知情感支持建模为多任务理解与决策评估框架,而非提出新的对话生成模型。其输入为多参与者的对话轮次、发言者身份及情境标签,输出为六个子任务的预测结果,覆盖关系理解与支持决策两个层面。

关键模块

  1. 数据构建:从真实情侣/家庭访谈视频中提取 191 段对话,以轮次为单位标注情绪、观点、关系模式、干预时机、支持目标和策略,共 7,079 标记轮次。
  2. 任务定义:六项任务包括情感识别、观点预测、关系模式预测、干预时间预测、支持目标预测和支持策略预测。前两项侧重个体状态,后四项要求建模参与者间的动态关系。
  3. 多层关系建模:采用三层抽象——个体层(情感、观点)、关系层(模式、目标)、群体层(支持策略与时序决策)。评估时,LLM 需根据上下文预测各层标签,尤其关注跨轮关系演变,并借鉴序贯决策视角对个体与关系状态进行联合更新。
  4. 评估协议:使用准确率等指标,并按情侣/家庭场景分别考察;提示词明确要求模型同时利用局部情感线索和全局关系历史。

输出与差异

模型输出对应任务的离散标签(如关系模式类别、策略类型)。与同类 benchmarks(如 EmpatheticDialogues、ESC 数据集)仅关注一对一情感状态不同,RESCUE-Bench 引入关系动态作为核心评估维度,要求 LLM 同时追踪个体与关系状态并做出支持决策,显著提升任务难度。

实验

实验设计

  • 基于 RESCUE 数据集(191 个样本、7,079 标注轮次)评估 10 个 LLMs,覆盖 6 个任务:情感识别、观点预测、关系模式预测、干预时机预测、支持目标预测、支持策略预测。
  • 任务分为 关系理解(Relational Understanding)和 关系敏感支持(Relation-Sensitive Support)两类。

关键发现

  • 当前 LLMs 在依赖局部情感线索或干预线索的任务上表现相对较好,例如情感识别和干预时机预测。
  • 但在关系密集型任务上表现明显下降,特别是关系模式预测、观点预测、支持策略预测,表明模型对人际动态建模不足。

对比解读

  • 与一般情感支持对话基准相比,RESCUE 强调关系演化和多主体交互,暴露了 LLMs 从局部线索推断全局关系结构的短板。
  • 这一结果提示,仅依赖 prompt 或上下文学习难以弥补关系推理的缺口,需要显式的关系状态建模或图神经网络等结构化方法。

行业影响

落地场景

RESCUE-Bench 评估的能力可直接用于多角色情感支持场景:

  • 心理健康平台:面向夫妻 / 家庭咨询的 AI 助手,识别关系模式并动态调整支持策略。
  • 企业服务:EAP 员工援助计划中涉及家庭议题的多方对话,或客户投诉中买家-卖家-平台三方情绪安抚。
  • 教育辅导:家长-学生-教师三方沟通支持。

商业价值

  • 降本:减少人工咨询师在低风险对话中的介入频率,自动筛选高风险关系冲突。
  • 体验提升:关系敏感支持可提升用户留存和信任,例如婚姻咨询产品的续费率。
  • 增收:作为模型能力卖点,向垂直服务商输出关系感知 API。

与现有产品 / 工作流接口

  • 作为评估基准:插入 LLM 选型与回归测试流程,专门检查关系密集任务指标。
  • 作为微调数据源:标注的 7,079 轮次可用于合成关系感知支持训练数据。
  • 作为产品设计参考:输出可解释的关系模式标签,辅助咨询师 dashboard 展示。

具体落地 use case

  1. 在线婚姻咨询 SaaS 集成多角色对话,AI 在夫妻双方同时在线时识别“追逐-回避”关系模式,推荐对应支持策略,降低咨询师前期整理成本。
  2. 电商平台纠纷调解机器人 面对买家、卖家、平台客服三方对话,预测干预时机和支持目标,避免冲突升级,减少人工客服介入率。

局限

  • 数据集规模与场景多样性有限:RESCUE-Bench 仅包含 191 个样本,来自真实夫妻与家庭访谈,虽然标注 7,079 轮对话,但覆盖的关系类型和情感支持场景仍较窄。多方情感支持还可能涉及朋友、同事、治疗团体等情境,当前基准难以全面反映关系感知支持在更广泛社交结构中的表现,限制了对模型通用能力的评估。此外,样本量偏小可能导致某些关系模式或支持策略标签分布稀疏,影响细粒度任务上的统计可靠性。
  • 任务建模存在简化:六个离散分类任务虽便于标准化评估,但关系动态本质上是连续、相互耦合且随对话时序演化的过程。使用固定标签(如关系模式、支持策略)进行单点预测,难以捕捉关系状态的变化轨迹和不同维度间的交互影响。标注过程中将复杂的社交-情感信息压缩为离散类别,可能丢失重要的中间状态或模糊边界,导致模型在关系密集型任务上的失败部分源于任务设计本身过于简化,而非单纯能力不足。
  • 实验设置局限:论文仅测试了 10 个 LLM 在零样本或提示条件下的表现,未涉及监督微调、多任务学习或专用关系建模架构,无法回答模型通过适配训练后能否显著改善关系敏感支持。同时,评估依赖自动指标和 LLM-as-judge,缺乏真实用户交互中支持质量的验证。此外,基线模型选择可能偏向较大规模通用模型,缺少对轻量级或开源模型的系统对比,限制了对全行业模型能力谱的透视。
论文Haichuan Hu2026-09-09原文

相关内容