行业新闻

微软 MindTopo 基准揭示多模态模型拓扑推理短板

微软 MindTopo 基准揭示多模态模型拓扑推理短板

新基准 MindTopo 发现多模态大模型能识别静态拓扑结构,但规划时难以保持一致性。

微软研究院发布 MindTopo 新基准,用于测试多模态大模型对拓扑结构的理解——比如路径是否连通、物体是否被围住、绳子是真打结还是只是缠在一起。基准分推理和规划两类,结果发现模型静态识别尚可,但在动态操作中容易丢失结构关系,这给机器人等交互场景带来挑战。

正文摘录

![基准概览,展示了十项空间推理与规划任务,分为两行。上方行标注为“推理”,包含迷宫、组装、珠子、绵羊和绳结。下方行标注为“规划”,包含管道、一笔画、交换、黑猫和解绳。MindTopo 标志和标题位于两个类别中央。](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/08/MindTopo-BlogHeroFeature-1400x788-1-scaled.jpg) 概览 - MindTopo 是一个用于测试 AI 拓扑推理的新基准,评估多模态模型是否能理解连通性、包围、顺序、分离和绳结等概念。 - 该基准同时衡量推理与规划能力,不仅测试模型能否识别静态图像中的拓扑关系,还测试它能否通过一系列动作保持和操控这些关系。 - 当前多模态模型在静态识别上的表现远优于交互式任务,这表明它们在时间上难以维持对拓扑的一致理解。 - 失败通常出现在规划阶段而非感知阶段,模型会在场景变化时失去对结构关系的追踪,或提出违反物理约束的动作。 - 研究结果凸显了推进面向机器人和交互环境的 AI 系统的重要机会,在这些场景中,理解哪些东西保持连通、包围、有序或打结,对可靠决策至关重要。 AI 能否判断添加一面墙后两个房间是否仍然连通?能否识别动物是否在围栏内,区分真绳结与缠绕的环,或在不允许绳索相互穿过的情况下重新排列几根绳子? 这些问题关乎 3D 拓扑,一种不依赖精确距离、角度或形状,而基于物体弯曲、拉伸或变形时持续存在的结构关系的空间理解。连通性、包围、排序和打结都是拓扑属性的例子。在认知科学中,这些属性是人类空间理解的基础层,但在多模态 AI 系统的评估中却基本缺失。

阅读原文(microsoft.com)→

行业新闻Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li2026-08-12原文

相关内容