论文

CaRGo-T: Causal Reasoning Graph-of-Thought 提升多模态幽默理解

CaRGo-T: Causal Reasoning Graph-of-Thought 提升多模态幽默理解

大规模视觉语言模型(VLMs)已在众多多模态任务中展现出非凡的通用性,但幽默理解仍是一大挑战。幽默内容往往依赖于实体、事件、上下文以及跨图像与文本模态的隐式关系之间的细微交互,这些交互涉及复杂的推理链条,难以通过常规提示或线性思维链推理来捕捉。 为此,本文提出 CaRGo-T(Causal Reasoning Graph-of-Thought),一种将多模态幽默背后的因果与上下文关系表示为轻量级图结构推理框架。该图被序列化为基于代码的表示,由 VLM 生成,并可由同一或另一个 VLM 解释,从而在零样本或上下文学习(in-context learning)设置下产生最终预测。 实验在覆盖讽刺、挖苦和梗图等多样喜剧形式的四个数据集上进行,评估幽默理解与幽默检测任务。与现有基于推理的基线相比,CaRGo-T 在商用与开源 SOTA VLM 上均实现了稳定提升:幽默理解提升约 1–20%,幽默检测提升约 1–3%。进一步的互信息分析表明,CaRGo-T 产生的推理表示比基线方法包含更多与目标输出相关的信息。代码已开源。

论文精读

TL;DR CaRGo-T 将多模态幽默中的因果与上下文关系建模为图结构并序列化为代码,由 VLM 解释推理,在幽默理解与检测任务上较现有推理基线提升 1–20%。

问题

问题背景

多模态大模型(VLM)在视觉问答、图像描述等任务上已取得显著进展,但幽默理解(humor comprehension)仍然是突出短板。幽默内容依赖图像与文本模态中实体、事件、上下文及隐含关系的微妙交互,形成复杂推理链条。

现有方法局限

  • 直接提示(standard prompting)只要求模型输出答案,缺少中间推理,模型难以捕捉幽默线索。
  • 线性 Chain-of-Thought (CoT) 虽然增加推理步骤,但幽默信号通常不是线性因果链,而是多实体、多事件间的网状依赖,线性展开会丢失结构信息。
  • 已有 graph-of-thought 方法多针对纯文本或结构化知识,未针对多模态幽默的因果特性设计图结构,且推理图常由外部工具构建,与 VLM 内部表征脱节。

为什么难/重要

  • 技术挑战:幽默涉及讽刺、反讽、双关等,要求模型同时理解视觉元素、文本语境和社会常识,并推断隐含因果或意图关系,超出当前 VLM 单步关联能力。
  • 业界关注:幽默理解能力直接关系到人机交互自然度、内容审核稳健性、社交机器人趣味性及创意生成质量,是提升多模态智能的关键环节。

行业类比

类似推荐系统中的多模态内容理解:若仅依赖线性特征拼接,会忽略图文实体间的复杂关联;引入因果图建模可显著提升对用户兴趣的捕捉能力。

核心洞察

  • CaRGo-T 用显式因果图结构替代线性思维链,捕捉幽默理解中实体、事件、上下文之间非顺序的隐含依赖。与常见 CoT 让模型逐句展开推理不同,图结构的节点和边直接对应因果前提与结论,使模型不必从冗长自由文本中重新解析关系,从而在零样本和 few-shot 下减少推理偏差。这为需要多跳因果关系且线性表达易失真的任务提供了一条更紧凑、可复用的中间表示路径。
  • CaRGo-T 将因果图序列化为代码风格表示(如 JSON/伪代码),让 VLM 以结构化格式生成和消费推理结果,而非自然语言段落。这种设计降低了模型在生成长推理文本时的语法漂移和无关细节,同时保持跨模型兼容——同一代码图可由不同 VLM 解读并给出答案。实验显示该表示携带更多与目标标签相关的互信息,说明结构化中间输出比自由文本思维链更利于保留任务关键信号。

方法

输入与表示

输入为图像与文本对,例如 meme 图片和配文。VLM 首先解析其中的实体、事件、上下文以及隐含关系,并构建一个因果推理图(Causal Reasoning Graph)。该图以轻量级代码序列化形式生成,例如使用类 Python 语法描述节点与边,便于 VLM 直接消费。

关键模块与流程

  1. 图生成:在零样本设定下,VLM 根据任务提示直接输出因果图代码;在上下文学习设定下,先基于验证集筛选信息量高的示例,再由 VLM 模仿生成图。
  2. 图解释与预测:将生成的图代码与原始问题一并输入同一或不同 VLM,VLM 依据图结构进行推理,输出幽默理解(解释笑点)或幽默检测(二分类)的结果。
  3. 信息度量:实验表明,CaRGo-T 生成的推理表示与目标输出之间的互信息高于基线,说明图结构保留了更多任务相关信息。

输出

最终输出为幽默理解或幽默检测的预测标签或文本解释。

核心创新在于用因果图替代线性 CoT 的推理链,捕捉多模态幽默中实体间的非线性交互。

跟同类方法的差异点:与 Chain-of-Thought 的线性推理不同,CaRGo-T 引入Graph-of-Thought 以建模非线性因果结构,并通过代码序列化让 VLM 直接解释图表示,无需额外训练图神经网络或依赖外部知识库。

实验

实验设计概述

CaRGo-T 在四个多模态幽默数据集上评估,覆盖 讽刺、挖苦 和 表情包 等不同喜剧形式。任务分为幽默理解与幽默检测,分别在 zero-shot 和 in-context learning 两种设置下测试,使用当前最先进的商用与开源 VLM(如 GPT-4o 等)。基线包括传统 prompt 方法和线性 CoT 推理。

关键发现

  • 在幽默理解任务上,CaRGo-T 相比 reasoning-based baselines 提升约 1-20%,在幽默检测上提升约 1-3%。
  • 通过互信息分析,CaRGo-T 生成的推理表示包含更多与目标输出相关的信息,表明因果图结构有效捕获了幽默中的复杂关系。
  • 该方法 zero-shot 下也能工作,无需微调,仅依赖 VLM 生成的轻量代码化图表示。

基线对比深度解读

相比线性 CoT,CaRGo-T 将隐式因果链显式构建为图,更利于捕捉多模态实体间的非线性交互,因此在需要深度推理的幽默理解任务上提升显著(最高达 20%)。幽默检测任务本身较为直接,图结构带来的优势有限,提升幅度较小(1-3%),但仍一致为正,说明图表示没有引入噪声。推理表示的高互信息进一步验证了其可解释性潜力,为后续调试和信任建立提供依据。

行业影响

落地场景

CaRGo-T 的因果图推理框架可直接用于需要理解多模态幽默或隐含语义的工业场景,例如:

  • 内容平台审核与推荐:识别图文短视频、表情包、政治讽刺漫画中的 satire / sarcasm,辅助内容安全与幽默标签自动标注。
  • 电商营销分析:评估广告素材中的幽默元素是否有效传达品牌意图,避免误解或冒犯,提升创意迭代效率。
  • 社媒舆情监控:对含视觉梗的帖子进行幽默/反讽分类,区分真实负面与幽默调侃,提高情感分析精度。

商业价值

  • 降本:减少人工审核与标注成本,尤其在需要理解视觉隐喻和跨模态反讽的内容场景;零样本/少样本推理降低对大量标注数据的依赖。
  • 增收:在广告创意优化、精准内容推荐中提升点击率和用户停留时长,直接拉动广告收入。
  • 体验提升:让对话式 AI 或虚拟助手具备更强的幽默感知能力,避免“不合时宜的严肃”或误判,增强交互自然度。

与现有产品/工作流的接口

CaRGo-T 输出的是轻量级代码化因果图,可直接作为中间表示嵌入现有 VLM 推理流程:

  1. 在 prompt 阶段引入 graph-of-thought 生成,替代或叠加于 chain-of-thought;
  2. 将生成的 graph 作为结构化上下文传给同一 VLM 或下游分类器;
  3. 与现有 LLM-as-a-judge、mutual information 评估管线结合,用于推理质量监控。

一个具体 use case:在社媒内容审核平台中,对含视觉元素的帖子先由 CaRGo-T 生成因果图(识别图文中实体关系与反转逻辑),再交由审核模型判断讽刺意图,可将误标率降低 1-3%(对应论文幽默检测提升幅度)。另一个场景:广告创意分析系统利用 CaRGo-T 在零样本下分析视频帧与广告文案的幽默一致性,协助创意团队快速筛选高风险素材。

局限

  • 评估范围局限于幽默理解和幽默检测任务,所用四个数据集虽涵盖讽刺、挖苦和梗图,但均为英文多模态内容,未验证在其它语言或文化背景下的幽默理解能力;也缺少在更广泛推理任务上的泛化实验,因果图结构是否适用于非幽默场景尚不清楚。
  • 方法高度依赖 VLM 生成因果图和代码表示的能力,若底层 VLM 对幽默场景的理解有偏差或代码生成质量不高,图中可能引入错误的因果关联,反而误导后续推理。论文未对不同 VLM 下图的错误率进行人工评估或定量分析,也未讨论图生成失败的案例。
  • 仅在零样本和少样本上下文学习设置下评估,未与微调或其它训练范式进行对比;且生成图再解析的流程增加了额外的推理步骤,带来更高的延迟和 token 成本,可能不适合对实时性要求较高的部署场景。
论文Abhilash Nandy2026-08-24原文

相关内容