SpanCalib-VLM: 视觉语言模型中的校准幻觉跨度检测
在大视觉语言模型 (LVLMs) 中检测幻觉需要准确的跨度定位和良好校准的置信度分数。微调后的生成式视觉语言模型擅长识别幻觉文本跨度,但存在过度自信和高推理延迟的问题。判别式序列标注器提供确定性速度和优越的校准,但表现出保守的跨度召回率。 我们提出 SpanCalib-VLM,一个用于 SHROOM-Visions 共享任务的双系统混合方案,结合了一个多模态序列标注器(通过交叉注意力将 XLM-RoBERTa-Large 与 SigLIP 视觉编码器融合)与微调后的生成式视觉语言模型 (Qwen3.5-4B-SHROOM-SFT)。通过 Union-Calibrated Fusion 策略,生成模型的候选跨度使用序列标注器的校准概率重新评分。 在 SHROOM-Visions 英语评测集上,我们的集成模型实现了 0.41 的 Pearson 校准相关性和 0.39 的整体 IoU,其中干净响应的 IoU 为 0.91,整体检测准确率为 70.7%。我们公开发布模型权重和代码。
论文精读
TL;DR SpanCalib-VLM 结合多模态序列标注器与生成式 VLM,通过 Union-Calibrated Fusion 对候选幻觉片段重打分,提升检测校准度与边界精度,在 SHROOM-Visions 上取得高 IoU 与低过自信。
问题
问题背景
Large Vision-Language Models (LVLMs) 在视觉问答与多模态推理中广泛应用,但视觉幻觉问题(错误描述、虚构物体)严重制约可信部署。当前研究正从单纯检测“是否存在幻觉”转向更细粒度的幻觉片段定位与置信度校准,SHROOM-Visions 共享任务即要求输出字符级 span 边界及校准概率。
现有方法局限
- 生成式 VLM 微调:能较准确地找到幻觉文本片段,但存在两个关键缺陷:其一,输出概率过度自信,校准相关性差;其二,自回归解码导致推理延迟较高,不适合实时检测场景。
- 判别式序列标注器:如基于 XLM-RoBERTa-Large 的 token 级分类,推理确定性快、校准质量较好,但 span 召回偏保守,容易漏掉边界模糊或较长的幻觉片段,整体 IoU 偏低。
为什么这个问题难/重要
难点在于 span 定位精度、概率校准与推理效率三者难以同时满足。校准指标(Pearson correlation)要求模型输出的置信度与真实正确概率严格相关,而生成模型常常高置信度但错误;序列标注器虽校准好,但保守召回拖累 span 覆盖。业界对 LVLM 可信输出有强需求,尤其在医疗、金融、自动驾驶等高风险场景,幻觉的漏检或误报都会造成严重后果,因此需要一种低延迟且校准可靠的检测器。
行业类比
类似自动驾驶中障碍物检测:不仅需要准确画出 bounding box(span),还要求每个检测框的置信度可靠,以便系统做出安全的后续决策。
核心洞察
- 校准概率重打分机制有效融合生成与判别系统:生成式 VLM 通常会输出过高的置信度,而判别式序列标注器虽然校准良好但 span 召回保守。SpanCalib-VLM 通过 Union-Calibrated Fusion 先取生成模型候选 span 的并集,再用序列标注器的校准概率对每个候选 span 重新打分,而非简单平均或投票。这一后处理策略在保留生成模型召回能力的同时,显著提升了校准相关性(Pearson 0.413)和 clean-response IoU(0.913),说明校准信息可以作为生成结果的后验修正信号,为其他多模态幻觉检测任务提供了新的融合范式。
- 混合双系统在速度与精度之间取得实用平衡:单独微调生成式 VLM 虽然 span 定位准确但推理延迟高、且容易过自信;纯判别式序列标注器速度快、校准好但容易漏报。SpanCalib-VLM 将两者解耦:生成模型只负责产出候选 span,序列标注器负责校准打分,推理时只需一次生成前向和一次判别前向,相比纯生成方案大幅降低延迟,同时避免了判别模型独立推理时召回不足的问题。这种“生成提候选、判别做校准”的架构设计,为需要低延迟且高可靠性的工业级 LVLM 幻觉检测部署提供了可参考的工程方案。
方法
输入与任务定义
输入为图像-文本对,文本来自 LVLM 对图像的响应;任务要求对文本中幻觉片段进行字符级 span 定位,并给出校准置信度(用于 Pearson 相关性和 IoU 评估)。
关键模块
System 1: Multimodal Sequence Tagger
使用 XLM-RoBERTa-Large 作为文本编码器,SigLIP 作为视觉编码器,通过 cross-attention 将视觉特征注入文本表示。多任务头同时预测 token 级幻觉标签与校准分数,训练目标兼顾序列标注损失与置信度校准,使判别式输出天然具有良好校准性。System 2: Generative VLM
基于 Qwen3.5-4B 进行 SFT 微调(Qwen3.5-4B-SHROOM-SFT),以生成方式输出候选幻觉 spans 及初始置信度。该子系统 span 召回较高,但存在过自信问题且推理延迟较大。Union-Calibrated Fusion
对两个系统的 span 候选取并集,然后用 System 1 的 token 级校准概率对每个候选 span 重新评分(例如取边界或内部 token 概率的统计量),得到最终 span 集合及校准置信度。该策略同时利用生成模型的高召回和序列标注器的可靠校准。
输出
输出为每个样本的幻觉 span 边界及对应的校准概率,直接服务于 SHROOM-Visions 的校准相关性(Pearson)与 span 重叠(IoU)指标。
与纯生成式或纯判别式方法不同,SpanCalib-VLM 通过判别式概率重打分抑制生成模型过自信,又用并集融合弥补标注器 span 召回保守的缺陷。
实验
实验设计
- 评估基于 SHROOM-Visions 官方数据,聚焦 English evaluation split,并额外考察多语言提交。
- 对比单系统:multimodal sequence tagger(XLM-RoBERTa-Large + SigLIP 交叉注意力)与微调生成式 VLM(Qwen3.5-4B-SHROOM-SFT)。
- 融合策略为 Union-Calibrated Fusion:生成式候选跨度由序列标注器的校准概率重打分。
关键发现
- 集成系统在 English split 达到 Pearson calibration correlation 0.413,优于单一生成式或判别式系统。
- Overall IoU 0.391,而 clean-response IoU 0.913,说明对无幻觉样本的边界判定非常准。
- 检测准确率 70.7%,在精度与召回间取得平衡(序列标注器保守召回,生成式过自信)。
- 多语言评估显示一定的泛化性,具体指标未在摘录中给出。
基线对比
生成式 VLM 擅长召回幻觉 span 但置信度过度自信;序列标注器校准好但召回保守。Union-Calibrated Fusion 取两者优势:候选跨度来自生成式,重打分用序列标注器的校准概率,从而同时提高 IoU 与校准相关性。相比单一系统,集成版在 clean-response 场景下 IoU 提升显著(0.913),表明融合策略并未引入过多假阳性。
行业影响
落地场景
SpanCalib-VLM 面向 LVLM 幻觉检测 的 span 级定位与置信度校准,适用于所有依赖视觉语言模型生成文本的业务。典型场景:
- 电商平台:自动校验商品图片与生成描述的一致性,标记错误属性或虚构细节,降低退货和客诉。
- 内容平台:对 AI 生成的图片说明、视频字幕进行幻觉审核,防止错误信息扩散。
- 医疗影像:审核自动生成的影像报告,识别可能被模型臆造的病灶描述,辅助医生审查。
- 自动驾驶:对车载 VLM 输出的场景描述进行在线校验,及时发现错误交通标志等幻觉,提升安全冗余。
商业价值
- 降本:判别式序列标注器提供确定性速度,推理延迟低,可替代或辅助人工审核,降低人工复核成本。
- 风险控制:精准的 span 定位配合校准的置信度,业务方可设定阈值自动放行或人工介入,减少误报/漏报代价。
- 体验提升:减少用户看到的错误信息,提升产品可信度,尤其在内容生成和电商场景直接影响转化与留存。
- 与同类工作差异:相比纯生成式方案,校准相关性更高(Pearson 0.413),避免过度自信;相比纯判别式,召回率改进,减少漏检。
接口与集成
- 作为独立幻觉检测服务,通过 REST/gRPC 接入现有 LVLM 生成管道,对输出进行后验校准。
- 部署为 gateway 插件:在模型输出后自动调用,返回幻觉 span 和置信度,业务按需处理。
- 支持离线批处理:对历史生成内容做审计,标记高风险样本。
- 模型权重开源(GitHub),便于本地化部署,满足数据隐私要求。
局限
- - **推理延迟与计算开销**:SpanCalib-VLM 采用双系统架构,推理时仍需先运行生成式 VLM 生成候选跨度,再交由序列标注器校准。尽管序列标注器本身速度较快,但生成式 VLM 的前向过程是高延迟瓶颈,整体集成系统难以满足实时或低资源场景需求。论文摘要承认生成式 VLM 有高延迟,但并未展示集成后的端到端延迟是否优于纯生成式方案,这可能限制其在生产环境中的实用性。
- - **泛化能力有限**:实验主要集中在 SHROOM-Visions 英语评估集上,该数据集可能涵盖特定领域或特定类型的视觉问答。论文虽提及多语言评估,但摘要未给出多语言结果,且未在其他公开基准(如 POPE、CHAIR)上验证。因此,方法对分布外数据、不同图像类型或不同 LVLM 生成文本的泛化性存疑,实际部署时可能需要额外微调或校准。
- - **融合策略对子系统性能敏感**:Union-Calibrated Fusion 依赖序列标注器的校准概率对生成式候选进行重评分,若序列标注器在某些幻觉类型(如长跨度、细粒度属性错误)上校准不佳或召回保守,可能导致生成式 VLM 提供的正确候选被错误降低置信度,进而影响整体 IoU 和校准相关性。论文未分析两个子系统性能不平衡时的鲁棒性,也未给出融合权重或阈值选择的详细敏感性分析(尽管有 Threshold Sensitivity 一节,但未深入讨论不平衡情况)。