UniProbe: 一种基于多结构内部表示的可学习令牌级幻觉检测器,用于大型视觉语言模型
大型视觉语言模型 (LVLMs) 展现了惊人的视觉推理与对话能力,但常产生与视觉输入不符的幻觉内容。有效缓解需令牌级定位,从而在不丢弃整个回答的情况下进行定向干预。现有检测器要么要求昂贵的全模型微调,要么依赖忽略模型生成过程的外部验证器,要么将内部信号简化为孤立特征与手工统计,丢弃了空间、序列及关系结构。 我们提出 UniProbe,一种轻量级、统一、可学习的检测器,通过单次前向传播对冻结 LVLM 的异构计算轨迹进行建模。UniProbe 在图像块、查询令牌与生成令牌之间构建有向图,并以注意力权重编码其关系。它通过交替的结构感知模块处理该轨迹:用于关系证据的 GNN、用于二维视觉几何的 ViT,以及用于回答顺序的 GRU。交错排列使空间、关系与序列证据在检测器中持续交互。 我们进一步开发了流式变体用于幻觉感知解码,在生成过程中检测并重采样幻觉令牌;以及自适应策略使检测器与 LVLM 自身生成对齐。在多种 LVLM 主干上,UniProbe 在令牌级与对象级幻觉检测上达到最先进水平。解码时,它在标准生成延迟的 1.06 倍下将对象幻觉减少高达 55%。
论文精读
TL;DR **UniProbe** 将冻结 LVLM 的内部表征构建为有向图,用交替 GNN/ViT/GRU 融合空间、关系与序列证据,实现 token 级幻觉定位与流式重采样,解码仅 1.06× 延迟降低 55% 对象幻觉。
问题
问题定义
LVLM 在视觉问答、图像描述等任务中普遍存在幻觉,即生成内容缺乏视觉输入支撑。实际部署中,需要token 级定位幻觉位置,以便仅重采样或修改可疑 token,而非丢弃整段响应。
现有方法局限
现有检测方案各有明显短板:
- 全模型微调:需更新主干参数,训练成本高,难以适配多种冻结 LVLM backbone。
- 外部验证器:如基于图像-文本对齐的评分模型,只在生成后判断整体一致性,无视 LVLM 内部解码过程,无法定位到具体生成步骤。
- 内部信号简化:将注意力或 hidden states 压缩为孤立特征或手工统计(如平均熵、最大注意力),丢失了图像 patch 的 2D 空间结构、生成 token 的时序顺序,以及它们之间的图结构关系,检测细粒度不足。
为何困难且重要
幻觉检测的难点在于 LVLM 一次前向传播中产生异构计算轨迹:图像 patch 有 2D 几何关系,query 与生成 token 构成时序链,注意力权重又编码了跨模态 relational 信息。单一模型结构(如纯 MLP 或统计规则)无法同时捕获空间、关系和序列三种结构。业界对幻觉问题高度关注,因为它在医疗影像解读、自动驾驶场景描述等高风险应用中直接降低系统可信度。token 级检测是定向干预的前提,能保持生成流畅性同时大幅降低幻觉率。
行业类比
类似端到端自动驾驶中,需要融合摄像头时序帧和车辆动力学信息来在线判断目标是否真的存在,而非仅靠单帧检测置信度;幻觉检测也需要在生成过程中实时融合多结构内部证据。
核心洞察
- UniProbe 将幻觉检测从“单点特征统计”升级为“多结构轨迹建模”。现有方法常把内部表征压缩为孤立向量或手工统计量,丢失空间布局、生成顺序和跨模态关系。UniProbe 构建有向图并在 GNN、ViT、GRU 之间交替传递信息,让图像几何、token 关系和序列位置证据在检测器内部反复交互,从而保留冻结 LVLM 单次前向中的异构计算结构。
- 流式检测与解码干预形成闭环,且保持极低延迟开销。UniProbe 的 streaming 变体在生成过程中逐 token 判断并重采样幻觉输出,将检测从离线评估转为在线干预;相比需要重新生成或丢弃整句的粗粒度方案,这种 token 级重采样以 1.06 倍标准生成延迟换得最高 55% 的对象幻觉下降,证明轻量外部检测器可对冻结大模型做实时校正。
- 自适配策略针对检测器与模型自身生成分布之间的偏移。以往检测器常用外部数据训练,面对 LVLM 实际采样时的风格漂移容易失效;UniProbe 通过自我生成样本对齐检测器,让判别边界贴近模型真实输出空间,提升对长尾幻觉模式的召回,直接增强部署稳定性。
方法
输入与计算轨迹图构建
- 冻结的 LVLM 单次前向生成响应,同时记录中间计算轨迹:图像 patches、文本 query tokens、生成 token 的隐藏状态。
- 将这些 token 作为节点,构建 有向图;边权重由 Transformer 注意力权重给出,编码 token 间的关系。
关键模块:多结构交替处理
- GNN 模块聚合图上的关系证据,捕捉 token 间的长程依赖。
- ViT 模块恢复图像 patches 的二维空间几何,保持视觉结构。
- GRU 模块按响应顺序建模生成过程的时序依赖。
- 三个模块交替堆叠,使空间、关系、顺序证据在检测器中反复交互。
输出与在线解码
- 输出每个生成 token 的 幻觉概率,实现 token 级定位。
- 流式变体在解码时实时检测,对高幻觉 token 触发重采样,减少对象幻觉。
- 自适配策略对齐检测器与 LVLM 自身分布,缓解分布偏移。
与同类方法差异
- 不依赖全模型微调或外部验证器,也不将信号压缩为孤立特征;UniProbe 直接从完整计算轨迹学习多结构表征,同时保留空间、关系和顺序信息。
实验
实验设计
UniProbe 在多个 LVLM 骨干上评估,冻结骨干参数,仅训练轻量级探测器。任务覆盖 token 级幻觉检测与对象级幻觉检测,输入为单次前向计算得到的异构计算轨迹(注意力图、隐藏状态等)。同时评估流式解码模式下的在线检测与重采样,验证其在生成过程中的实时干预能力。
关键发现
幻觉检测:UniProbe 在 token 级与对象级检测上均达到 SOTA,证明交替建模关系结构(GNN)、空间几何(ViT)与序列顺序(GRU)能有效互补,捕捉更丰富的幻觉证据。
解码干预:在生成过程中对检测为幻觉的 token 进行重采样,可将对象幻觉减少 55%,而延迟仅增加至标准生成的 1.06 倍,接近实时性能。
与基线对比解读
相比需要全模型微调的探测器,UniProbe 采用冻结骨干 + 小型模块,参数高效且避免昂贵训练成本。相比依赖外部验证器的方法,UniProbe 完全利用模型自身计算痕迹,不引入额外知识库或模型,部署简洁。相比仅用孤立特征或人工统计的启发式方法,UniProbe 显式建模 token 间关系、图像空间位置和生成顺序,捕捉到更完整的幻觉信号。在流式解码中,延迟仅 6% 的增长展现出实用潜力,适合在线部署场景。
行业影响
落地场景
UniProbe 作为与 LVLM 解耦的轻量幻觉检测器,可直接嵌入生成式视觉应用:电商商品描述自动生成 中检测错标属性(颜色、材质、数量);内容平台自动图片摘要 避免捏造不存在的物体或事件;医疗影像报告生成 防止幻觉病灶描述;自动驾驶场景理解 中对错误目标检测进行拦截。核心价值在于 token 级定位 而非整段拒绝,允许局部重采样修正。
商业价值
- 降本:无需对大型 LVLM 全量微调,检测器本身轻量(延迟仅 1.06×),推理成本增幅极低,可替代人工审核或外部验证 API,减少把关环节开销。
- 增收/体验提升:实时纠正幻觉可使自动生成内容达到可发布质量,提升用户信任和转化率;在高风险场景(如医疗、金融报告)避免错误信息造成的合规与声誉损失。
- 对比现有方案,UniProbe 不需要外部 LLM 验证器或全模型微调,部署门槛低,适合快速迭代。
与现有产品/工作流的接口
UniProbe 设计为 frozen LVLM 的外挂模块:在正常前向传播中构建计算图,并利用已有的 attention 权重作为关系特征,无需额外前向。集成方式包括:
- 在线检测模式:将检测器附在生成循环中,每次采样前判断新 token 是否幻觉,若疑似则触发重新采样(论文的 streaming 变体),对用户零感知。
- 离线批处理模式:对已生成文本进行事后 token 级标注,用于内容审核 pipeline 或训练数据清洗。
- 自适应策略:论文提出的 self-adaptation 可用目标领域少量无标注生成数据微调检测器,适配特定 LVLM 分布漂移。
典型技术栈适配:可直接作为 Python 推理服务中间件,或在 vLLM / TensorRT-LLM 中添加 custom sampling hook。项目主页:https://research.nvidia.com/labs/par/uniprobe/
局限
- **泛化性限制**:UniProbe 的评估主要集中在对象存在性幻觉(如 **POPE** / **CHAIR** 基准)上,对于更细粒度的幻觉类型(如属性错误、关系错误、动作误判)的检测能力尚未充分验证。虽然声称 token 级定位,但训练时使用的标注可能偏向物体类别,导致在其他语义维度上的误检或漏检。实际应用中,开放域生成中的幻觉模式更复杂,该检测器能否稳定迁移仍需进一步实验。
- **架构依赖与内部状态访问**:该方法需要从冻结 LVLM 中提取每一层的注意力权重和隐藏状态来构建计算图,这要求对模型内部有完全访问权限。对于商业闭源 API(如 GPT-4V 等)或不暴露内部结构的模型,UniProbe 无法直接应用。此外,虽然检测器轻量,但交替堆叠 GNN、ViT、GRU 模块的训练和推理开销尚未与更简单的基线(如线性探针)进行严格对比,实际部署中可能带来额外复杂度。
- **流式解码的重采样开销**:尽管论文报告延迟仅为标准生成的 1.06 倍,但流式解码需要在每个生成步骤运行检测器,并对检测到的幻觉 token 进行重采样。当连续多个 token 被判定为幻觉时,重采样次数可能增加,导致实际延迟高于平均。此外,自适应策略虽然缓解了分布偏移,但需要在线更新检测器,可能引入不稳定因素,在长序列生成中的累计误差也未被充分讨论。