研究揭示多模态模型内部存在空间地图结构
多模态模型内部有空间坐标地图,能影响判断但用得不稳,为提升空间推理提供新方向。
MirroS 团队分析多模态模型的中间激活,发现物体位置被线性编码在一个低维子空间 S-Space 中。这张“内部地图”不仅记录可见物体,还能推断画面外的位置,甚至受语言隐喻影响。但模型有时会混淆坐标系,或无法随视角准确旋转,说明空间表征虽已形成,尚不能可靠使用。
正文摘录
GPT-6 Astra 为何如此惊艳?S-Space 透视多模态模型内部的空间智能 .jpg) [](https://mp.weixin.qq.com/s/gHkDFBsw0tfTUwsK7UfmDA) 最近,GPT-6 Astra 的三维建模与空间理解 demo 引发关注。它能在 Blender 中搭建带家具和庭院的住宅,再将场景转入 Unreal Engine 5,让人能走进房间、打开柜门,甚至操作咖啡机。  GPT-6 Astra 能根据房源照片创建逼真的 3D 房屋模型 看着模型构建出这些可以走入、可以交互的三维场景,一个问题也随之浮现:模型的内部究竟如何表示物体之间的空间关系? 现在,研究者在多模态模型中发现了类似空间地图的结构。MirroS 团队分析多个多模态模型的中间激活后发现,模型会把物体的左右、上下和远近位置,写入一个稳定的低维表征空间。