微软 MindTopo 基准揭示多模态模型拓扑推理短板
新基准 MindTopo 发现多模态大模型能识别静态拓扑结构,但规划时难以保持一致性。
微软研究院发布 MindTopo 新基准,用于测试多模态大模型对拓扑结构的理解——比如路径是否连通、物体是否被围住、绳子是真打结还是只是缠在一起。基准分推理和规划两类,结果发现模型静态识别尚可,但在动态操作中容易丢失结构关系,这给机器人等交互场景带来挑战。
正文摘录
 概览 - MindTopo 是一个用于测试 AI 拓扑推理的新基准,评估多模态模型是否能理解连通性、包围、顺序、分离和绳结等概念。 - 该基准同时衡量推理与规划能力,不仅测试模型能否识别静态图像中的拓扑关系,还测试它能否通过一系列动作保持和操控这些关系。 - 当前多模态模型在静态识别上的表现远优于交互式任务,这表明它们在时间上难以维持对拓扑的一致理解。 - 失败通常出现在规划阶段而非感知阶段,模型会在场景变化时失去对结构关系的追踪,或提出违反物理约束的动作。 - 研究结果凸显了推进面向机器人和交互环境的 AI 系统的重要机会,在这些场景中,理解哪些东西保持连通、包围、有序或打结,对可靠决策至关重要。 AI 能否判断添加一面墙后两个房间是否仍然连通?能否识别动物是否在围栏内,区分真绳结与缠绕的环,或在不允许绳索相互穿过的情况下重新排列几根绳子? 这些问题关乎 3D 拓扑,一种不依赖精确距离、角度或形状,而基于物体弯曲、拉伸或变形时持续存在的结构关系的空间理解。连通性、包围、排序和打结都是拓扑属性的例子。在认知科学中,这些属性是人类空间理解的基础层,但在多模态 AI 系统的评估中却基本缺失。