ProLaViT提出渐进式隐式视觉推理,解决多模态大模型空间认知瓶颈
ProLaViT通过隐空间内多步推理,解决多模态模型视觉定位不精准问题,无需外部工具,训练高效。
多模态大模型看得到但想不对?腾讯BAC提出ProLaViT框架,在隐空间中遵循“定位→聚焦→分离”的因果链,逐步收紧注意力。通过内生自蒸馏,无需外部标注即可训练多步推理,精度优于显式生成和一步预测。已被ECCV 2026接收。
正文摘录
.jpg)  在多模态大模型(MLLM)时代,让模型看懂一张图早已不是难事,但要让它真正想清楚一张图,做多步的空间感知、几何分析与逻辑推断,却依然存在困难。 为了解决这种「看得到却想不对」的现象,研究界给推理链里塞进了视觉信息:一种是 显式生成 中间图像(如 Anole、ThinkMorph),效果理想,但算力开销高;另一种是 隐式隐空间推理 (如 Mirage、LVR),试图直接在特征空间里「一步」定位出目标区域,结果常常精度崩塌、注意力关注在无关的背景上。 针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是: 别急着下结论,先在连续隐空间里像人一样「步步推导」 。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。 该论文已被 ECCV 2026 接收。