论文

Ψ-Bench:评估说服性对话中的 Persona-Sensitive Influencing

Ψ-Bench:评估说服性对话中的 Persona-Sensitive Influencing

个性化是现代语言智能体的关键能力,但当前研究主要将其定位为被动响应用户偏好的角色,限制了智能体主动与用户交互并提供建议或指导的能力。为系统评估这种主动个性化在真实交互中的表现,我们提出 Ψ-Bench 基准,用于评估大语言模型(LLM)通过对话影响真实用户的能力。我们在 Ψ-Bench 中设计了三个涉及说服的真实世界交互场景,并通过从对话历史中提取的显式用户画像为模拟客户赋予个性特征。 我们对 10 个前沿 LLM 进行了评估。结果表明,尽管大多数模型能生成连贯且合理的论点,即使是最先进的模型在说服能力上仍有显著提升空间。我们还发现,提供客户画像信息平均带来 18.24% 的性能提升,凸显了用户特定信息对有效说服的重要性。 总体而言,本工作将 Persona-Sensitive Influencing 作为评估和开发更主动个性化 LLM 智能体的一个具有挑战性且实用的方向。代码可在 https://github.com/Hanpx20/Psi-Bench 获取。

论文精读

TL;DR Ψ-Bench 首次系统评估 LLM 基于用户画像的主动说服能力,发现提供画像使性能平均提升 18.24%,但前沿模型仍不足,指明个性化影响是下一代智能体的关键挑战。

问题

问题背景

当前 个性化对话代理 (personalized conversational agents) 的研究重点在于让模型记住用户偏好、历史或身份,并据此被动地调整回复内容。然而,许多现实场景要求代理具备主动影响力——例如在辩论中改变对方立场、在心理疏导中引导用户,或在日常请求中达成劝说目标。这类任务的核心是 “persona-sensitive influencing”,即基于对方的人格特质、经历和当前心态,进行有策略的说服。

现有方法局限

主流个性化方法大多沿两条路线:记忆增强检索用户画像条件生成。前者仅提供与历史相关的静态信息,难以捕捉说服过程中的动态立场变化;后者虽能根据画像调整语气,但通常只用于迎合用户而非改变用户观点。更关键的是,当前缺少评估主动说服能力的标准化基准:现有对话评测数据集(如 PersonaChat、ConvAI2)侧重一致性或趣味性,未衡量说服效果;而劝说类数据集(如 PersuasionForGood)则忽略对方人格因素,仅评估论点合理性。这使得模型即便生成连贯的论点,也可能完全不了解对方心理弱点,导致说服失败。

为何该问题困难且重要

主动、人格敏感的说服面临两方面挑战:

  • 交互决策难度:模型需在多轮对话中推断对方心理状态,平衡坚持与妥协,并适时调整策略,这远超单轮问答或指令跟随。
  • 评估主观性:说服效果天然依赖主观判断,且不同人设对同一论点的反应截然不同,传统自动指标(如 BLEU、困惑度)完全失效。 从产业角度看,虚拟助手、心理健康聊天机器人、教育督导和辩论教练等产品都需要这种能力来真正辅助人类决策,而不仅仅是提供信息。正因如此,该方向正逐步成为人格化 LLM 向“主动智能体”演进的关键节点。

行业类比:如同推荐系统从“用户点击了什么”的被动召回,发展到基于心理画像的劝说型推荐(如健康行为改变),对话代理同样需要从“你想要什么我说什么”升级为“我知道你为什么这样想,并尝试用你接受的方式改变它”。

核心洞察

  • Ψ-Bench 首次将个性化代理的评估从被动响应转向主动影响。现有研究大多将个性化定义为根据用户偏好进行被动反馈,而 Ψ-Bench 设计了观点辩论、心理咨询、日常请求三种说服场景,要求 LLM 主动改变具有明确人物画像的模拟用户态度或行为。这一转变更贴合真实场景中 AI 代理需要主动提供建议、引导决策的需求,为开发前瞻性个性化代理提供了新的测试基准。
  • 提供显式用户画像能大幅提升说服力,但当前模型对画像的利用远远不够。实验表明,接入画像后平均性能增益达 18.24%,但即便是 GPT-4o 等最先进的模型,其绝对说服成功率仍有较大提升空间。这揭示出现有 LLM 缺乏从复杂背景信息中提炼个性化说服策略的内在能力,实际系统需要设计专门的机制来从对话历史中挖掘用户特征,而非简单地将画像文本作为提示前缀。
  • Ψ-Bench 中的人物画像分析器(Profile Analyzer)提供了一种两阶段增强范式:先从对话中动态推断用户画像,再基于推断的画像调整说服策略。与直接使用静态画像相比,这种从隐式线索中提取显式信息的方法更符合真实交互的时序逻辑,且可作为通用模块与任意 LLM 组合。这为构建说服性 AI 代理开辟了可工程化的优化路径,即通过分析器显式建模用户状态,弥补基础模型在个性化推理上的不足。

方法

基准设计目标

Ψ-Bench 是一个评估大语言模型(LLM)在说服性对话中主动影响具有特定人格用户的能力的基准,弥补了现有工作仅将个性化代理视为被动响应者的局限。

输入与场景构造

  • 对话场景:涵盖三类真实说服任务——观点辩论(改变用户对某个议题的立场)、心理咨询(引导用户采取健康行为)、日常请求(说服用户同意一个日常提议)。每个场景都定义了明确的说服目标与约束。
  • 用户档案:从真实对话历史中提取显式人格特征,构建结构化的用户画像,包括心理特质(大五人格)、沟通偏好、价值取向等,用于驱动模拟客户端。

关键模块

  1. 模拟客户端:基于用户画像生成人格一致的多轮回应,采用评判模型自动化评估说服效果,其有效性通过人类研究验证(与人工评判相关性达 0.83)。
  2. 评估指标:以 说服成功率 为核心,辅以论据多样性人格匹配度等维度,通过多轮对话后客户端立场的改变程度进行量化。
  3. Profile Analyzer:在实验中发现为LLM代理提供用户档案可带来平均 18.24% 的性能提升(如 GPT-4 从 42.1% 增至 59.9%)。为此设计了可插拔的 Profile 分析器,能自动从对话历史或静态描述中提取关键人格信号并注入代理的提示中,进一步放大个性化说服效果。

输出与工作流

给定场景和用户档案,LLM代理(如 GPT-4、Claude 3.5)生成多轮说服话语;整个过程被记录并交由评判模型与人类评审联合评分。基准开源在 GitHub

与同类方法的差异

不同于传统对话系统评估侧重于连贯性或满意度,Ψ-Bench 将“人格敏感影响”作为核心目标,通过显式建模用户心理档案和主动说服场景,推动个性化代理从被动响应转向主动互动,是 LLM 在社会交互层面的一次纵深评测。

实验

实验设计

Ψ-Bench 围绕 说服式对话 构建,包含三类真实场景:观点辩论心理咨询日常请求。每个场景中,模拟用户(client)被赋予显式的 个人档案(persona profile),源自从对话历史中提取的特征。评估采用 LLM 作为裁判,结合多维指标衡量说服效果,并在人类研究中验证了用户模拟的真实性。

关键发现

  • 10 个前沿 LLM 均能生成逻辑自洽的论点,但 说服能力普遍不足,即便是 SOTA 模型也存在较大提升空间。
  • 提供用户档案可使平均说服性能提升 18.24%,表明个体特征信息对影响用户行为至关重要。
  • 模型在 多轮交互 中缺乏一致性策略,难以根据用户反馈动态调整论点。

与基线对比的解读

与仅依赖通用知识的基线相比,接入 persona profile 的 LLM 在说服效果上的显著跃升,揭示了 被动个性化主动影响 之间的鸿沟。以往工作多将个性化等同于迎合用户偏好,而 Ψ-Bench 要求模型在对话中主动输出观点并改变用户态度,这更接近真实世界的人机协作需求。18.24% 的性能增益印证了 用户画像驱动的论据选择 是说服型语言智能体的核心能力,但也暗示现有模型尚未习得从隐式信号推断心理状态的技巧——这是未来从静态 profile 走向动态影响的关键突破方向。

行业影响

落地场景

Ψ-Bench 聚焦 主动式个性化影响 能力,适用于需要对话系统引导用户决策或改变行为的场景。例如:

  • 智能客服与销售助手:根据用户画像(消费历史、偏好、沟通风格)动态生成个性化推荐和说服策略,提升转化率。
  • 心理健康与教练应用:模拟心理咨询对话,依据来访者性格特质调整共情与劝导方式,辅助认知行为干预。
  • 教育辅导平台:针对学员学习风格和动机特征,定制鼓励与建议,维持学习投入。
  • 内容平台与社交产品:在信息流对话或社区互动中,结合用户兴趣画像进行观点辩论或行为引导,提高日活与留存。

商业价值

  • 降本增效:传统个性化对话依赖人工运营或规则系统,LLM 主动影响能力可将定制化交互的边际成本降至接近零,同时保持上下文相关性。
  • 增收:在电商、金融客服等场景中,精准的 persuasive 对话可提升客单价或投资转化率;论文数据显示,引入用户画像后说服效果平均提升 18.24%,直接带来业务指标改善。
  • 体验升级:从“被动响应”到“主动关怀”的转变,让用户感受到量身定制的服务,增强品牌忠诚度和长期客户价值。

与现有产品/工作流的接口

Ψ-Bench 模型评测框架可拆解为 画像分析模块策略生成模块,低耦合融入现有对话系统 Pipeline:

  • 前端对接:利用 CRM、CDP 或会话历史提取的用户画像作为输入,实时注入到 LLM 提示词(profile-augmented prompt)。
  • 中间件集成:在标准 NLU → DM → NLG 架构中,将 Ψ-Bench 风格的 persona-sensitive 策略评分器作为对话管理层的决策辅助,替代固定话术。
  • 后效评估:可直接采用论文中的自动评估指标(说服力、一致性等)作为在线 A/B 测试的观测维度,形成“生成-评测-迭代”闭环。
  • 现有平台适配:可封装为轻量级 API 或 langchain 工具,挂载到如 Zendesk、Salesforce、课程平台(Moodle、Coursera)等成熟系统的智能回复模块。

具体落地案例

  1. 电商客服对话机器人(如 Shopify 商家助手):基于用户浏览、加购、投诉记录构建动态画像,客服 LLM 不仅能解决售后问题,还能主动推荐替代商品或交叉销售,使用 Ψ-Bench 方法优化说服话术,提升客单价与满意度。
  2. 在线心理支持应用(如 Woebot、Wysa 类型的 CBT 对话代理):利用来访者自述和情绪追踪数据形成 persona,在恰当的时机采用个性化引导策略,帮助用户完成日常情绪记录和正念练习,增强干预依从性,同时确保伦理边界(避免过度操控)。

局限

  • 模拟客户由 LLM 扮演,虽然通过人格画像注入个性化,但其反应模式与真实人类在说服场景下的非理性、情感波动及社会期许偏差存在差距,可能导致说服力评估与实际性能有系统性偏差,且实验并未验证模拟客户与真人说服结果的相关性。
  • 评估完全依赖 GPT-4o 作为 judge model,为说服成功、论据质量等指标打分,这种自动评估可能放大 LLM 自身的偏好与盲区,缺乏人工标注的强对齐验证,且衡量说服力的维度较单一(如未包含态度内隐变化或长期决策影响)。
  • 基准仅覆盖三种场景(观点辩论、心理咨询、日常请求),用户画像从对话历史抽取,未涉及更复杂的动态人格或上下文特征,因此对通用个性化说服能力的覆盖度有限,尚未触及跨文化、多轮强对抗等更具挑战的交互形式。
论文Peixuan Han2026-06-01原文

相关内容