SpaceDG: 视觉退化下的空间智能基准测试
多模态大语言模型(MLLMs)在空间智能方面取得了快速进展,但现有空间推理基准大多假设输入图像完美无缺,忽略了现实部署中常见的视觉退化,如运动模糊、低光照、恶劣天气、镜头畸变和压缩伪影。这引发了一个根本问题:当视觉观测不完美时,当前MLLMs的空间智能有多鲁棒? 为解决此问题,我们提出了SpaceDG,首个面向退化感知空间理解的大规模数据集。它基于物理可解释的退化合成引擎构建,将退化形成过程嵌入3D高斯泼溅(3DGS)渲染中,能够真实模拟9种退化类型。数据集包含来自近1000个室内场景的约100万QA对。此外,我们引入了SpaceDG-Bench,一个人工验证的基准,涵盖11个推理类别和9种视觉退化类型,共1102个问题,生成超过1万VQA实例。 实验评估了25个开源和闭源MLLMs,结果表明视觉退化一致且显著地损害了空间推理能力,暴露了关键的鲁棒性差距。最后,我们证明,在SpaceDG上进行微调能显著提升退化鲁棒性,甚至在退化条件下超越人类表现,同时在干净图像上没有任何性能下降,凸显了退化感知训练对于鲁棒空间智能的潜力。
论文精读
TL;DR SpaceDG 构建了首个大规模退化感知的空间理解基准,揭示现有 MLLMs 在真实视觉退化下空间推理的脆弱性,并通过针对性微调显著提升鲁棒性,甚至超越人类水平。
问题
问题背景: 随着多模态大模型(MLLMs)在空间推理任务上的能力提升,业界开始关注其在真实世界视觉退化条件下的鲁棒性,这直接关系到自动驾驶、机器人等安全攸关应用的可靠性。
现有方法局限: 当前主流空间推理基准(如ScanQA、SQA3D)依赖清晰、无退化的室内扫描数据,忽略了运动模糊、低光、天气等常见退化。这些基准评估的模型在理想输入下表现良好,但在真实部署中,一旦遇到视觉退化,准确率急剧下降。已有的退化合成方法(如简单添加噪声或降采样)缺乏物理真实性,无法模拟复杂的退化形成过程(如3DGS渲染中的光学畸变、动态模糊),导致评估与真实场景存在分布偏移,难以反映模型的实际鲁棒性。
为何重要且困难: 空间推理要求模型从2D图像中理解3D几何关系(距离、方向、遮挡等),视觉退化会破坏纹理、边缘和深度线索,迫使模型同时进行退化恢复与空间推理,二者高度耦合。退化类型多样且程度可变,构建覆盖全面且物理真实的评估体系难度极大。工业界对全天候、全工况下可靠运行的空间智能系统需求迫切,但现有MLLMs在此方面暴露出显著脆弱性,阻碍了落地进程。
行业类比: 类似自动驾驶系统在浓雾或暴雨中因为传感器退化导致物体检测与距离估计失灵,多模态模型的退化敏感空间推理能力也是其走向开放世界部署必须跨越的门槛。
核心洞察
- **首次系统性量化视觉降质对 MLLM 空间推理的损害**:现有空间基准假设理想视觉输入,SpaceDG 填补了这一空白,通过物理驱动的 3DGS 降解合成引擎,生成九种逼真降质下的百万级 QA 对。评估 25 个模型后发现,降质使空间推理性能一致且显著下降,暴露了当前模型在真实部署中的严重鲁棒性缺陷。这为鲁棒空间智能评测提供了关键基准。
- **降解感知微调实现鲁棒性突破且无损通用性能**:在 SpaceDG 上微调后,模型在降质条件下的空间推理大幅提升,甚至超越人类水平,同时清晰图像性能无下降。这一发现表明,通过针对性训练可将鲁棒性显式编码进模型,而无需牺牲通用能力,为在自动驾驶、机器人等易受视觉降质影响的场景中部署 MLLM 提供了切实可行的路径。
方法
核心流程:输入 → 退化合成 → QA 生成 → 验证
SpaceDG 的构建遵循一条自动化 pipeline,从 3D 室内场景出发,经物理退化渲染和程序化 QA 初始化,最终产出大规模退化感知的 VQA 数据。
输入:来自 Habitat-Matterport 3D (HM3D) 等数据集的近 1000 个真实室内场景的 3D 重建,包含网格、相机位姿和语义注释。
关键模块 1:3DGS 退化合成引擎
基于 3D Gaussian Splatting (3DGS) 的可微渲染管线,将 9 种视觉退化类型直接嵌入到光线追踪或光栅化阶段,而非对 2D 图像进行后处理。具体包括:
- 光学与动态退化:在投影变换中引入散焦(高斯核调制)、镜头畸变和运动模糊(累积帧合成)
- 气象退化:利用体积散射模型合成雾霾,基于物理折射模拟水滴
- 光度退化:调整光照参数生成低光、过曝
- 数字退化:模拟 JPEG 压缩(DCT 量化噪声)和降分辨率
引擎输出多视角的退化-清洁图像对,同时保留精确的 3D 几何和语义真值,可直接用于监督式 QA 生成。
关键模块 2:程序化 QA 初始化
从场景中自动生成问答对,涵盖 11 种空间推理类别(如相机平移/旋转估计、物体间距离/方向判断、物体大小比较、计数等)。生成过程包括:
- 基于物体边界框和相机参数构造问题模板
- 为每个问题生成多个候选选项,并通过几何约束和模糊过滤(例如剔除歧义方向)保证答案唯一性
- 最终产出约 1M QA 对,覆盖 9 种退化类型
输出与验证
对自动生成的 QA 进行两阶段验证:先用中等规模 MLLM 进行一致性过滤,再通过人类标注员审查并修正,形成 SpaceDG-Bench——含 1,102 个高质量问题的基准,通过 9 种退化 × 11 类推理交叉得到超过 10K VQA 实例。空间真值源自 3DGS 渲染时的相机与物体坐标,因此答案在退化条件下仍保持准确。
与同类方法的差异
现有空间推理基准(如 SpatialVQA, EmbSpatial)均假定图像无退化,SpaceDG 首次将退化物理建模嵌入 3D 渲染流程,提供了大规模、真值可靠且覆盖多种退化类型的空间理解测试平台。
实验
实验设计
在 SpaceDG-Bench 上,系统评估了 25 个开源与闭源 MLLMs(如 GPT-4o、Gemini Pro Vision、LLaVA 系列等)在 9 种视觉退化条件下的空间推理能力。基准涵盖 11 类空间任务(相机位姿推理、目标距离 / 方向判断、目标计数等),共计超过 10K VQA 实例。进一步,利用 SpaceDG 数据集(~1M QA 对)对部分模型进行退化感知监督微调(SFT),并验证在干净样本上的性能保持。同时引入人类受试者作为参照,在相同退化条件下完成测试。
关键发现
- 退化显著削弱空间推理:所有 MLLMs 在视觉退化下准确率一致大幅下降,暴露出严重的鲁棒性缺口。极端退化场景下,即使最强模型也接近随机猜测,人类表现同样大幅下降。
- 退化感知微调有效提升鲁棒性:在 SpaceDG 上微调后,模型在退化场景下的性能显著恢复,甚至在某些退化条件下超越未经微调的人类表现,且未损伤干净图像上的原始能力。
- 空间微调与退化理解的权衡:仅进行空间任务微调虽能增强视觉鲁棒性,却可能削弱模型对退化本身的理解(如判断退化类型),表明显式的退化感知训练对于综合稳健性至关重要。
与基线对比的深层解读
基线为各模型在无退化(干净)条件下的空间推理精度。引入退化后,性能平均下降数十个百分点,表明当前 MLLMs 隐含依赖高质量视觉输入,缺乏对真实世界退化模式的泛化。相比之下,经过退化感知 SFT 的模型在 9 种退化上的平均准确率可追平甚至超过干净图像上的基线,显示了通过数据增强合成来弥补感知鲁棒性缺口的巨大潜力。与人类对比,微调模型在多数退化条件下的优势表明,纯粹的基于数据的学习可以超越人类视觉系统在特定退化下的限制,但人类对未见过的极端退化组合仍有一定优势。这种对比凸出了构建更贴近真实物理过程的退化模拟对于通往鲁棒空间智能的意义。
行业影响
落地场景
SpaceDG 构建的退化感知空间理解基准与训练数据,直接瞄准自动驾驶感知系统、机器人导航、AR/VR 空间交互以及无人机巡检等依赖视觉空间推理的领域。例如:在雨雾天气或低光照下,车载 MLLM 需要准确判断前车距离与车道线方向;仓储机器人在镜头沾染水渍或运动模糊时,仍需可靠完成抓取与避障。此外,安防监控在夜间或压缩传输下的目标定位、无人机在强光或 JPEG 压缩下的高度估算,均可从退化鲁棒性提升中受益。
商业价值
退化鲁棒性直接关联系统可用度与事故率:极端条件下的一次误判可能导致自动驾驶事故或机器人碰撞,造成高昂的经济损失与法律风险。通过在 SpaceDG 上进行退化感知微调,模型可在不牺牲清晰图像性能的前提下,大幅提升恶劣条件下的空间推理准确率(论文显示微调后甚至可超越人类表现)。这能够:
- 降低安全关键场景的介入频率,减少人工兜底成本
- 提高全天候、全场景服务的覆盖率,扩大商业运营窗口
- 加快产品在复杂环境下的部署速度,压缩长尾场景的研发迭代周期
与现有工作流的接口
SpaceDG 可以无缝嵌入 MLLM 的训练管线:
- 数据增强阶段:利用其退化合成引擎(基于 3DGS)生成多样退化图片,直接作为训练样本或评测集
- 微调阶段:在通用空间推理模型基础上,使用
SpaceDG的 1M QA 对进行退化感知 SFT,或采用论文提出的两阶段 CoT 推理策略 - 评估阶段:以
SpaceDG-Bench作为离线评测基准,替代或补充现有清晰输入下的空间推理测试
该 pipeline 与当前主流框架(如 LLaVA、InternVL 等)兼容,不引入额外推理延迟,适合在已有产品代码中快速集成。
具体落地方案
- 自动驾驶感知系统:在端到端驾驶模型的训练中加入 SpaceDG 生成的雨、雾、眩光退化样本,提升弯道测距与交通标志方向判断的鲁棒性。夜间或隧道场景下的
camera_object_distance_estimation任务可直接受益。 - 智慧仓储 AGV:叉车式 AGV 依赖视觉定位与货架检测。引入镜头污损(水滴)与运动模糊模拟后,通过 SpaceDG 的微调可降低由视觉退化导致的抓取失败率,减少人工复检成本,实现7×24小时无间断作业。
局限
- 场景覆盖以室内为主:数据集基于近1000个室内场景,缺少室外、动态、大规模环境,限制了模型在自动驾驶、户外导航等场景下的退化鲁棒性评估。空间推理在室外开放世界中面临更复杂的几何关系和尺度,室内场景的转移性存疑。
- 合成退化与现实分布存在差距:虽然采用基于物理的3DGS退化引擎,但合成退化类型和参数分布可能无法全面覆盖真实世界中的罕见或复合退化模式(如传感器噪声、污损等),导致在真实退化图像上评估结果可能偏乐观。此外,退化组合实验(附录A.2)仅为初步探索,未能系统研究多退化协同作用。
- 空间推理任务设计相对结构化:基准问题多为相对距离、方向、尺寸等低阶空间属性,缺乏对高阶空间关系推理(如路径规划、遮挡推理)的考察。选项设置也限制了模型自由生成答案的能力,可能高估模型在开放空间问答中的实际表现。