行业新闻

ProLaViT提出渐进式隐式视觉推理,解决多模态大模型空间认知瓶颈

ProLaViT通过隐空间内多步推理,解决多模态模型视觉定位不精准问题,无需外部工具,训练高效。

多模态大模型看得到但想不对?腾讯BAC提出ProLaViT框架,在隐空间中遵循“定位→聚焦→分离”的因果链,逐步收紧注意力。通过内生自蒸馏,无需外部标注即可训练多步推理,精度优于显式生成和一步预测。已被ECCV 2026接收。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/5b83738e-6c66-4843-9d0a-6380b9a7e2ab/03(2).jpg) ![图片](/r/blog/23ce1eefe1f8702ec8f0bce134e0ba8e467eb4a5c129a3df35d8bfdc2e2b97dd.webp) 在多模态大模型(MLLM)时代,让模型看懂一张图早已不是难事,但要让它真正想清楚一张图,做多步的空间感知、几何分析与逻辑推断,却依然存在困难。 为了解决这种「看得到却想不对」的现象,研究界给推理链里塞进了视觉信息:一种是 显式生成 中间图像(如 Anole、ThinkMorph),效果理想,但算力开销高;另一种是 隐式隐空间推理 (如 Mirage、LVR),试图直接在特征空间里「一步」定位出目标区域,结果常常精度崩塌、注意力关注在无关的背景上。 针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是: 别急着下结论,先在连续隐空间里像人一样「步步推导」 。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。 该论文已被 ECCV 2026 接收。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-21原文

相关内容