APEIRIA 框架破解 3D 多模态大模型黑盒推理
将神经符号程序的透明推理轨迹蒸馏进 3D 多模态大模型,实现可解释的开放词汇空间推理。
现有 3D 空间推理方法要么是黑盒的 3D 多模态大模型(能理解自然语言但推理过程不透明),要么是只能处理固定词汇的神经符号方法。北大团队提出 APEIRIA,通过三阶段课程学习,把神经符号程序的可验证推理轨迹转化为自然语言思维链,让模型能一步步透明地验证空间关系,同时保留开放词汇理解能力。实验在多个基准上超过主流方法,且支持即插即用模块升级。
正文摘录
.jpg)  本文的第一作者为北京大学王选计算机研究所博士生莫文韬,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、CVPR、ICCV、ICML 等顶会上有多项代表性成果发表,多次荣获多模态感知和生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。 本文提出了一个面向 3D 空间推理的新框架 —— APEIRIA 。 现有 3D 空间推理方法长期面临一个核心矛盾:3D 多模态大模型(3D MLLM)能够理解复杂自然语言和开放词汇概念,但推理过程往往是黑盒的,缺乏可解释的空间验证;神经符号 3D 方法虽然能够通过程序化步骤进行透明推理,却受限于封闭词表、固定概念模块和难以获取的过程监督,难以扩展到真实世界的复杂指令 因此,本文关注的问题可以概括为: 能否让 3D MLLM 继承神经符号方法的透明推理,又保留大模型的开放语义能力? 为弥合这一鸿沟,APEIRIA 提出将神经符号程序中的 系统化空间推理模式 蒸馏进 3D MLLM。本文设计了一个三阶段课程学习框架:首先通过 3D 感知对齐 对齐物体视觉 - 几何特征与语言空间,使模型具备基本的物体识别、属性理解和定位能力;