论文

QUACK: 在多模态社交推理代理中质疑、理解和审计交流知识

QUACK: 在多模态社交推理代理中质疑、理解和审计交流知识

社交推理游戏已成为探测大语言模型(LLM)代理在推理、欺骗、协调和信念建模方面能力的流行测试平台。然而,多数环境仅以胜率等游戏结果评分,且主要局限于纯文本交互,难以判断代理的语言是否真正基于其感知和行动,也无法识别其行为背后的失败模式。为填补这一空白,我们提出 QUACK,一个用于审计多模态社交推理中代理语言基础的开源环境与评估框架。 QUACK 在三个层面评估代理:游戏结果、行为轨迹和话语级一致性。其核心 Statement Verification Pipeline 从引擎日志重建每个代理的真实轨迹,并逐一核对所有讨论声明,自动标记空间幻觉、无根据指控、欺骗崩溃和语言-行动不一致。在均匀及跨模型对抗设置下评估三种前沿 VLM,我们发现即使最强的代理也有 15.1% 的可验证空间声明出现幻觉,且超过一半的指控缺乏证据支撑。我们已在 https://github.com/AAAAA-Academia-Attractions/QUACK 发布完整引擎、评估框架、工具包和日志。

论文精读

TL;DR QUACK 是一个**多模态社交推理评估框架**,通过**声明验证管道**自动审计智能体语言是否基于真实感知与行动,揭示即使最强 VLM 也存在 15% 空间幻觉和超过一半的无根据指控,首次从话语层面暴露推理与欺骗的失败模式。

问题

问题背景

基于 LLM 的智能体在社交推理游戏(如狼人杀、Among Us)中成为测试推理、欺骗和信念建模能力的热门平台,但评估方式仍主要依赖文本交互与胜率,难以区分智能体是否真正将语言扎根 于多模态感知与行动。

现有方法局限

  • 感知模态单一:多数环境仅提供文本描述,缺少视觉-空间信息,导致智能体无法利用位置、物体等物理线索,也无法验证其描述是否与所见一致。
  • 评估指标粗糙:仅用 win rate 等结局指标,忽略了中间行为与语言的一致性,无法定位失败原因(是感知错误、推理错误还是欺骗失控)。
  • 缺乏语言 grounding 检查:现有框架无法自动检测 空间幻觉(描述不存在的场景)、无证据指控(未亲眼所见却指认)、欺骗崩溃(伪装身份时语言前后矛盾)等系统性问题。

为何该问题重要且具有挑战性

在真实人-AI 协作场景(如智能驾驶、机器人交互)中,智能体的语言输出必须忠实于 其感知与行动,否则会导致信任崩塌或安全风险。社交推理游戏恰好提供了需要欺骗-协调平衡的高压环境,但挑战在于:

  1. 多模态异质性:视觉、文本、行动轨迹需跨模态对齐,自动校验困难。
  2. 开放域语言:讨论中的自由文本难以结构化提取 claim。
  3. 评价客观性:何为“谎言成功”或“欺骗合理”需要结合角色与游戏状态定义。 业界正从纯文本 benchmark 转向具身性交互真实性更强的评估,该问题直接推动 可信 AI 底层能力的进步。

行业类比

类似于自动驾驶仿真中需要确保感知模块输出与决策逻辑一致,不能仅凭最终碰撞率评价系统;多模态社交推理的 grounding 审计,实质是对 AI 语言可信度与可解释性的压力测试。

核心洞察

  • QUACK 将社交推理智能体的评估从只看游戏输赢升级到三维度(结果、行为轨迹、言论一致性),尤其首创性地审计语言基础。传统环境仅以胜率衡量智能体,但胜率高不等于推理可靠——一个频繁幻觉或撒谎的智能体同样可能获胜。QUACK 通过 Statement Verification Pipeline 重建每条真实轨迹并逐句核验,第一次量化了“胜者的话是否可信”,直接揭示了最强模型仍有 15.1% 的空间幻觉和过半无依据指控,为可信 AI 提供了比胜率更本质的评估基准。
  • Statement Verification Pipeline 是提升可解释性与可信度的自动化工程利器。它将多模态智能体在游戏中的每一个声明与引擎记录的真实事件进行对比,自动标记出空间幻觉、无据指控、欺骗崩塌和言行不一致等四类基础失败。相比人工分析或仅靠胜率,这一流水线能够低成本、规模化地审计智能体的推理缺陷,并为模型开发者提供细粒度的失败模式诊断。在交叉对抗设定下,它还能暴露模型面对异质对手时的欺骗适应性差异,为多智能体安全与鲁棒性优化提供了可工程化的反馈回路。

方法

QUACK 是一个面向多模态社会推理代理的审计环境与评估框架,其核心在于系统性地检测代理语言的实际接地面。

环境输入与代理设置

QUACK 模拟类似《鹅鸭杀》的社会推理游戏,代理被分为(需要完成任务并找出鸭子)和(需破坏/淘汰鹅并隐藏身份)。输入包括多模态观察:

  • 渲染视图:代理第一人称视觉输入,反映周围地图与角色。
  • 结构化摘要:由引擎提供的状态文本描述,如位置、可见队友与任务进度。

代理通过 VLM 处理观察,在自由漫游阶段执行移动、交互、破坏等动作,并在会议阶段进行自由文本讨论与投票。

关键评估模块

QUACK 的评估分为三层,Tier 3 声明验证管道是核心创新:

  1. Tier 1:游戏结果
    统计胜率、任务完成率等宏观指标,但不足以揭示失败原因。
  2. Tier 2:行为轨迹
    记录代理的完整动作序列与状态变化,提供行为级审计基础。
  3. Tier 3:声明验证管道
    • 输入:代理在会议中的所有发言(如“我在图书馆看到红鹅被杀”)。
    • 处理流程
      1. 声明提取:从发言中解析出可验证的事实性声明。
      2. 真实轨迹重构:利用引擎日志重建代理所经历的真实状态序列(位置、所见物体、动作)。
      3. 声明比对:将每条声明与重构轨迹逐项核对,判断其真实性。
    • 输出:自动标记四种接地面失败:
      • 空间幻觉:对位置、物体存在的虚假描述。
      • 无支撑指控:提出无证据的指责。
      • 欺骗崩溃:鸭子代理的言行违背其隐藏身份的意图。
      • 语言-动作不一致:声称执行过的动作在日志中未发生。

与同类方法的差异

不同于仅依赖最终胜负的文本环境,QUACK 首次在多模态设置下,自动化地追踪代理每一条声明的感知与行为证据,将评估粒度从对局结果推进到语句级忠实度审计

实验在三种前沿 VLM 的同构与跨模型对抗设置下发现,即使最优模型仍有 15.1% 的可验证空间声明属幻觉,超过一半的指控缺乏事实支撑,凸显了该框架对诊断代理理性中枢的重要价值。

实验

实验设计

QUACK 环境内置多种角色与地图,三种前沿 VLM 被部署为智能体,在同构(所有智能体使用同一模型)和跨模型对抗(不同模型混用)两种设置下进行多轮社交推理。评估体系由浅入深分为三层:游戏结局(胜率等)、行为轨迹(动作序列对齐)和言论验证(通过 Statement Verification Pipeline 自动比对引擎日志与智能体发言)。每条讨论声明均被提取并作事实核查,系统性地标记空间幻觉、无据指控、欺骗瓦解和言行不一致四类接地失效。

关键发现

  • 即使在最强的 VLM 智能体中,仍有 15.1% 的可验证空间陈述是幻觉,即智能体说出与自身观测不符的位置或物品信息。
  • 超过 半数 的指控缺乏可追踪的证据,指向无据指控这一严重失效模式。
  • 在对抗混模设置下,欺骗行为容易退化为简单掩饰或沉默,出现欺骗瓦解
  • 言行不一致广泛存在,智能体常声称采取某动作但引擎日志显示未执行。

与基线对比的解读

目前实验未与明确基线对比,更多是对前沿模型自身的解剖。然而,这些结果揭示了当前基于文本对话的评估局限性:若只看胜率,可能高估智能体的推理能力。通过引入多模态感知与声明验证,QUACK 暴露了从感知到语言生成的接地差距。这一发现与相关工作(如 Generative Agents 只重文本交互)形成互补,强调了对物理/视觉环境的一致性校验。在工程上,这提示设计代理系统时必须内置轨迹回放与声明校验模块,避免“一本正经胡说八道”的智能体在真实交互中被误用。

行业影响

落地场景

QUACK 框架直接适用于对智能体语言接地性有强需求的场景,尤其适合多模态交互产品:

  • 社交推理游戏与虚拟社交平台:可作为 NPC 或 AI 队友的质量看门工具,自动检测对话中的空间幻觉(如错误描述虚拟物品位置)与无证据指控,提升游戏体验的理性感与沉浸度。
  • 多智能体协作系统(如客服分流、供应链协商):支持自动化审计智能体间的通信内容是否基于真实环境状态,防止“欺骗坍塌”——即智能体以虚构事由误导协作者,导致决策链崩塌。
  • 对话式 AI 评估服务:可作为 LLM/VLM 应用的质量评级补充,为 chatbot、虚拟角色提供话语级一致性评分,而不仅限于对话胜率或用户满意度。

商业价值

  • 降本:将原先需人工逐句核对的行为轨迹审计自动化,减少人工审核成本。QUACK 的 Statement Verification Pipeline 能从引擎日志重建真实轨迹并自动对比,单次游戏即可标记数百条无关陈述。
  • 增收:提升 AI 产品可信度,直接转化对可靠性敏感的客户(如教育模拟、医疗培训中的虚拟患者),降低因幻觉导致的商业风险与法律纠纷。
  • 体验提升:通过显式量化的 grounding 失败类型(空间幻觉无支持指控等),产品团队可定向优化模型或 prompt 设计,加速迭代,而非模糊地“提升胜率”。

与现有产品/工作流的接口

QUACK 提供开源的 游戏引擎 + 评估工具包 + 日志,集成路径清晰:

  1. 作为 CI/CD 质量关卡:嵌入 LLMOps pipeline,在模型部署前对多智能体对话日志进行自动 grounding 检查,不通过则回滚或告警。
  2. 标注/微调数据生成:利用其自动标记的失败案例构建高价值反馈数据集,用于 RLHF 或偏好对齐,直接与现有 fine-tuning 栈(如标注平台、模型仓库)对接。
  3. 多模态环境接口:其观察空间支持渲染视图结构化摘要,可适配现有基于视觉或文本的 VLM 系统,无需重构原有智能体架构。

具体落地用例

  • 电商智能导购:假设某电商平台使用 VLM 驱动的虚拟导购员,它能“看到”商品图片和库存状态。QUACK 可自动核验导购员的每一句推荐是否基于真实视觉信息(如“这件蓝色衬衫的扣子是贝壳材质”),标记出空间幻觉,防止误导消费者,降低退货率。
  • 企业级虚拟培训:在针对管理人员的谈判模拟中,多个 AI 角色扮演不同立场的同事。使用 QUACK 审计每个 AI 员工的发言是否与模拟场景中的文件、数字等状态一致,避免出现语言-行动不一致(如声称已读过报告但实际未访问对应虚拟文档),确保培训环境的有效性。

局限

  • **模型选择与可复现性局限**:实验仅评估了 GPT-4o、Gemini-1.5-pro、Claude-3.5 三种商业 VLM,未包含任何开源多模态模型(如 LLaVA、InternVL2 等),无法验证框架对不同架构的鲁棒性,也限制了社区对流水线的复现与改进。同时,商业 API 的行为可能随时间变化,导致结果无法稳定重现。
  • **视觉环境的简单性**:QUACK 的视觉信息主要为标记地图与角色位置,缺乏真实场景的复杂纹理、光照、遮挡等视觉挑战。这种简化虽利于可控评估,但可能高估模型在真正多模态社会推理场景中的 grounding 能力,其结论难以直接迁移到需要丰富视觉理解的应用(如机器人协作、增强现实社交游戏)。
  • **Statement Verification Pipeline 对日志完整性的依赖**:流水线假设引擎日志能无损重建智能体的 ground-truth 状态序列,若日志存在缺失或时间戳对齐误差,将引入虚假的“幻觉”或“不一致”标记。论文未讨论此类噪声的可能影响及缓解机制,也未验证流水线在部分可观测或异步日志下的健壮性。
论文Ye Yuan2026-05-26原文

相关内容