论文

LoSoNA: 群组对话中局部社会规范适应的基准

LoSoNA: 群组对话中局部社会规范适应的基准

在线群组聊天是存在局部对话规范的社交空间,但这些规范很少被明确说明。基于 LLM 的智能体识别并适应这些规范的能力和意愿仍未被充分探索。 为此,我们提出 LoSoNA 基准,用于评估多方聊天中的局部社会规范适应能力。每个场景为目标模型提供一段精心设计的群聊记录,其中非目标参与者展示一个隐藏的局部规范,随后一个最终的 elicitor turn 迫使模型做出回应,从而揭示其是否推断出该规范。 我们在四种提示条件下评估了八个前沿和开放权重模型,这些条件在模型被要求将先前对话作为回答依据的明确程度上有所不同。朴素提示 对大多数模型效果有限;显式规范感知提示 的效果不均,其中 Gemini 3.1 Pro 达到 84.2%,Claude Fable 5 达到 81.6%,而其他几个模型仅有小幅提升或出现倒退。 LoSoNA 通过测试模型是否能够从先例中推断局部对话规范并将其用于单轮群聊回复,回应了近期对评估 LLM 社交能力的呼吁。

论文精读

TL;DR LoSoNA 通过群聊记录中的隐含局部规范,测试 LLM 能否从先例推断并遵循群组特有的社交习惯,揭示当前模型在朴素提示下的社会推理局限。

问题

问题背景

当前大型语言模型(LLM)的社交能力评估日益受到关注,但多数工作集中于通用社交规范或一对一交互,考察基础常识推理与礼貌策略,对群体对话中动态涌现的局部规范(local norms) 缺乏系统测试。

现有方法局限

  • 现有社交推理基准(如 SocialIQA、Social Chemistry)侧重广泛的社会道德和常识,并非测试模型能否从少数对话回合中推断出特定群体的隐性行为准则。
  • 对话评估范式多围绕任务完成、情感支持或毒性检测,忽视群体特有的“微文化”(micro-culture)——例如某个小组习惯用分析型回应代替共情。
  • 少量多轮交互评估仍假设规范是外部给定的全局规则,未涉及观察→归纳→应用这一认知链条,导致评估无法反映模型在真实群聊中面临的不确定性。

为什么这个问题难且重要

  • 技术挑战:局部规范很少被显式声明,模型需要从有限的聊天历史中捕捉微妙的模式化行为(如所有人回避情感确认而转向务实建议),并在最终回应中同步模仿,这对小样本推理与风格适配提出很高要求。
  • 应用价值:越来越多的 AI 代理部署在协作平台、游戏社区或虚拟伙伴系统中,若无法适配群体内未明说的规范,将导致社交破裂或用户排斥,直接关系到LLM 在开放社交环境中的可用性
  • 学界呼声:近期研究呼吁从孤立对话转向生态化的社交评估,LoSoNA 填补了这一空白,通过引发轮(elicitor turn) 强制模型暴露其是否真的内化了规范,而非泛泛输出安全回应。

行业类比

如同对话式推荐系统需要实时感知用户群的兴趣共识而非依赖全局偏好,AI 代理在群聊中必须像“读空气”一样迅速捕捉并适应小组的隐性规则,否则反馈会显得不合时宜。

核心洞察

  • **间接评估范式捕捉了局部社交推理的真实挑战** LoSoNA 不直接询问模型“这里的规范是什么”,而是通过群聊上下文和最终的引出轮次,测试模型是否能在回复中体现对隐藏规范的推理。这种设计比显式知识问答更贴近现实场景,因为真实世界中的局部规范几乎从不被明说。与以往基于显式指令或常识推理的基准相比,它考察的是“从对话先例中学习”的能力,这对于在社交平台上部署的AI代理至关重要。
  • **规范感知提示的有效性高度依赖模型,揭示推理路径差异** 实验显示,显式告知模型将先前对话作为证据(norm-aware prompting)对某些模型(如Gemini 3.1 Pro)大幅提升准确率,但对另一些模型提升微弱甚至倒退。这表明不同模型在“提示后激活”社交推理通路上的成熟度不同,部分模型可能更依赖内化权重而非上下文提取,或者其指令遵循能力不足以将对话历史转化为行为准则。这提示工程中需要针对模型特性设计提示策略,而非一刀切。

方法

场景构建与输入

LoSoNA 的每个测试实例均由一份群聊记录构成,其中包含多个非受试参与者(non-subject participants)的连续发言,他们通过互动自然演示一种从未明说的局部社交规范(local social norm),例如“用诊断式提问代替情感安慰”。记录末尾设置一个诱导话轮(elicitor turn),模拟新加入者向受试模型提问,强制模型给出即时回复,从而暴露它是否从历史对话中推断并遵循了该规范。

关键模块:提示条件与评估

为系统性检验模型的感知与适应能力,LoSoNA 设计了四种提示条件(prompting conditions),逐步控制模型是否被明确告知要以先验对话为依据调整回答:

  • naive:仅给出完整对话与最后提问,无任何额外指示,测量默认行为。
  • elicitor_only:仅暴露诱导话轮,不提供历史对话,用于捕获模型在无上下文时的先验偏好。
  • norm_informed:在提示中显式声明“该群聊存在隐式规范”,并要求模型推断并遵循。
  • style_adaptation:要求模型根据前文的对话风格来回复,但未提及“规范”概念,测试模糊风格指令的效力。

评估采用 LLM-as-Judge 协议,由评判模型从规范一致性、语境恰当性等维度打分,最终聚合为二元成功率。场景经人工筛选与验证,确保规范自然可区分。

输出与评判

受试模型在每种条件下生成一段单轮群聊回复,评判器将回复与真实隐式规范对比,给出通过/不通过的二值判断,汇总得到适应准确率。初步结果显示 norm_informed 对高阶模型提升显著(如 Gemini 3.1 Pro 达 84.2%),但部分模型产生退化,凸显隐式规范推理需特定指引。

相较于侧重静态安全对齐或角色扮演的社会基准,LoSoNA 聚焦于从多轮对话先例中动态推断暂行、未声明的局部规范,并通过诱导话轮迫使模型在单次互动中展现适应能力,更贴近真实群聊的语境感知需求。

实验

实验设计

LoSoNA 基准由精心策划的群聊场景组成。每个场景向受试模型提供一个群聊转录,其中非受试参与者展示一条未明说的局部社会规范(如用实用建议替代情感支持),最后以一个启发轮次(elicitor turn)结束,强制模型生成响应,从而暴露其是否推断出该规范。评估覆盖 8 个前沿与开放权重模型,在 4 种提示条件下运行,这些条件在“告知模型应参照先前对话作为响应依据”的显式程度上有所不同。

关键发现

  • 朴素提示下,多数模型表现受限,无法可靠适应局部规范。
  • 显式的规范感知提示(norm-aware prompting)提升了部分模型的表现,但效果不均衡:Gemini 3.1 Pro 达到 84.2% 准确率,Claude Fable 5 达到 81.6%,而其他模型仅获得微小增益甚至倒退。
  • 模型间的差距表明,推断并遵循隐性社会规范仍是当前 LLM 的薄弱环节。

与基线对比解读

尽管未报告具体基线数值,论文以“朴素提示”作为对照,揭示显式指令并非万能解药。提升不均匀的现象暗示,模型对局部语境线索(local contextual cues)的敏感性存在根本差异。这提醒从业者:在部署群聊智能体时,不能仅依赖通用指令,可能需要专门的微调或架构设计来捕捉群体规范。LoSoNA 为测试社会推理能力提供了标准化基准,推动了对 LLM “社交智商”的系统评估。

行业影响

落地场景

LoSoNA 评估的能力——从对话历史中推断并遵循本地社交规范(local social norms)——直接指向多类产品中 AI 智能体的核心适应性问题。典型应用包括:

  • 社群运营机器人:在 Discord、Slack 等群聊中,不同频道/群组常演化出独特的回复风格(如技术频道偏好简洁代码段,情感频道期待先共情再建议)。模型若无法识别此类隐藏规范,易被用户视为“不合群”。
  • 企业内部 AI 助手:如问答机器人或会议纪要工具,需适应团队约定的沟通惯例(如是否允许打断、是否使用表情符号或特定缩略语),否则会降低采纳率。
  • 游戏 NPC 与虚拟角色:在多人联机游戏中,NPC 需跟随玩家群体的临时规范(如是否用角色扮演语言、是否接受玩笑)以维持沉浸感。
  • 多智能体协作系统:在多个 AI agent 共同参与的工作流中,未预先约定的交互规范可能通过上下文涌现,模型需在不显式编程的情况下动态对齐。

商业价值

用户留存与体验提升是核心收益。当 AI 能够平滑融入各类群体的交流规范时:

  • 减少摩擦性流失:违反群组内隐规范的回复会导致用户疏离甚至直接移除机器人,隐藏的社交不适直接影响日活和留存。
  • 降低人工运营成本:对于需要人工定制回复风格的社群,自适应规范能力可大幅减少针对每个频道的手动 prompt 调整和风格规则编写。在客户支持场景中,适应本地规范能提升问题一次解决率(FCR),因为用户更可能给出上下文连贯的信息。
  • 开拓新型交互产品:具备规范适应能力的模型可作为“社交集成器”嵌入垂直社区,提供定制的问答、摘要或互动服务,形成竞争壁垒。例如教育协作平台中,AI 助教若不能适应每门课特有的讨论规范,会被学生认为僵化。

与现有工作流的集成

LoSoNA 既是一个评估基准,也为改进流程提供了明确路径:

  • 评估选型:企业可在部署对话式 AI 前,用 LoSoNA 类场景测试候选模型(特别是open-weight 模型),筛选出具备隐式规范适应的模型,避免上线后出现社交失误。
  • 提示工程增强:论文中的norm-aware prompting 可直接转化为生产环境的元提示:先让模型分析对话历史中的规范特征,再生成回复。这种“先分析后回答”的思维链策略可封装为中间件,对现有流程改动极小。
  • 微调数据生成:基于 LoSoNA 生成多样化群体规范场景,用于领域微调,使模型在特定业务中更鲁棒地捕捉本地规范。例如,对客服场景生成不同行业术语、回复结构(先道歉再解释 vs. 直接给链接)的变体,在 RLHF 或 SFT 中加入规范适应性奖励。

具体用例

  1. 直播电商社群机器人:直播间粉丝群常形成独特的“发优惠券口令”网络习语,机器人需识别这种一次性的规范(如“扣 1 上车”),并在回复中无缝使用,否则会被视为广告号。通过 LoSoNA 风格的隐式规范推理,机器人可动态对齐,提升促销互动率。
  2. 跨国团队协作工具的 AI 摘要:多文化团队在代码评审回帖中可能形成直接指出错误而不加修饰的规范,而另一个团队则习惯先肯定再提建议。自动摘要或建议回复的模型若未能自适应,可能输出破坏团队氛围的评议。引入规范适应机制后,摘要工具的输出会被团队视为更“懂规矩”,从而提升依赖度。

局限

  • **场景生态效度不足**:基准中的群聊对话由人工设计生成,虽然试图模拟真实隐含规范,但可能与自然群聊中的动态规范演变、多模态线索(如表情符号、回复时间间隔)存在差距,模型的表现可能无法直接迁移到真实社交agent场景,需要进一步在更自然的群聊数据集上验证。
  • **评估维度单薄**:只通过最终一次“引发轮次”的回复是否符合规范来判断适应能力,无法评估模型是否真正理解了规范的内在逻辑,还是仅依靠表面词汇模式匹配。缺少对规范推理过程、长期一致性或规范冲突处理能力的考察,可能导致高分模型在实际应用中表现脆弱。
  • **prompt 工程依赖性高**:结果显示,显式告知模型参考对话历史的“norm-aware prompting”对不同模型增益不均,说明模型对社交规范的适应能力高度依赖prompt设计,而非内在理解。这种prompt敏感性使得基准很难区分模型本身的社交推理能力与prompt引导的效果,限制了评估的鲁棒性和可比性。
论文Mateusz Winiarek2026-06-12原文

相关内容