强化空间视觉语言模型中的双路径推理
空间视觉语言模型(Spatial VLMs)在几何感知方面取得了显著进展,但处理需要跨深度、距离和场景关系进行多步推理的复杂空间任务仍具挑战性。此外,不同类型的空间查询需要截然不同的策略:有的适合纯语言逐步演绎,有的则需要先进行显式3D定位再进行定量推理。 本文提出SR-REAL(通过强化学习实现空间VLM的双路径空间推理),一个统一框架,为空间VLM配备两条互补推理路径:语言推理路径(LOR) 执行逐步语言演绎,以及检测-然后推理路径(DTR) 通过区域标记(region tokens)检测3D几何线索(如中心或边界框)后进行显式几何推理。SR-REAL首先进行冷启动监督微调,构建LOR和DTR的思维链监督,并暴露区域到3D接口;随后使用强化学习优化策略模型,奖励函数包括准确率和格式奖励;对于DTR,额外的离散中心检测奖励进一步细化几何对齐。 在多个空间基准上,SR-REAL显著优于现有空间VLM基线:(i) 单个RL训练模型同时支持两条路径,DTR在区域感知任务中通过精确3D定位表现优异,LOR则增强通用空间推理;(ii) 联合训练两条路径实现相互增强;(iii) 高质量混合冷启动数据对稳定RL优化至关重要;(iv) 模型无需逐任务调整即可跨数据集和领域泛化,展示LOR与DTR之间的正向迁移。
论文精读
TL;DR SR-REAL 用强化学习为空间 VLM 统一了语言推理与 3D 检测推理双路径,两者协同增强,在不需逐任务微调的前提下显著提升了复杂空间推理性能。
问题
问题背景
空间视觉语言模型(Spatial VLMs)在几何感知上已取得显著进展,但复杂空间推理仍需多步深度、距离与场景关系的链式推理。不同空间查询呼唤本质上不同的策略:有的适合纯语言推理,有的则需先显式 3D 定位再做定量推断。现有框架未能统一这两条路径。
现有方法局限
- 单一推理模式:多数 Spatial VLMs 仅依赖语言链式思维(CoT)进行推理,缺乏对显式 3D 几何线索(如物体中心、包围盒)的利用,导致在需要精确 3D 定位的任务(如“哪个物体更远?”“A 在 B 左边吗?”)上表现不佳。
- 检测与推理脱节:部分工作使用外部 3D 检测器提取几何信息,但检测与推理过程分离,未能端到端联合优化,误差会累积。
- 训练范式局限:已有的监督微调(SFT)方法依赖静态数据,无法在推理过程中自适应纠错;缺乏对推理路径的有效奖励信号,难以平衡语言推理与几何对齐的双重需求。
技术挑战与重要性
空间推理要求模型同时具备语义理解(对象关系、场景逻辑)和精确几何量化(坐标、距离、方向),二者通常是矛盾的:语义推理依赖抽象特征,几何量化则需要低层视觉细节。此外,多步推理中的错误传播严重,传统 SFT 无法提供中间步骤的反馈。业界对具身智能、增强现实等应用的需求日益增长,这些场景要求模型在真实 3D 环境中进行可靠的空间推理,单一模式已无法满足要求,因此如何设计一种统一框架,使模型能动态选择推理路径并相互增强,成为关键问题。
类似自动驾驶中,规划模块既需要符号化的交通规则推理,又需要精确的车辆位姿估计,两者缺一不可且必须协调。
核心洞察
- 双路径推理的协同强化学习:现有空间 VLM 通常只在单一推理范式上优化,例如纯语言链式推理(如 LLaVA)或依赖外部 3D 检测器的后处理,难以兼顾灵活语义推断与精确几何定位。SR-REAL 首次将 Language-Only Reasoning (LOR) 和 Detect-Then-Reason (DTR) 融入同一策略模型,并通过 GRPO 强化学习联合优化:准确率奖励驱动推理质量,格式奖励保证输出结构,而离散中心检测奖励让 DTR 的 3D 定位与语言推理同步提升。这种协同训练使两种路径相互增强,在区域感知任务中 DTR 依赖 LOR 的语义先验,而在一般空间推理中 LOR 受益于 DTR 的几何正则化,实现了单模型跨任务的正向迁移。
- 3D 目标检测的离散 token 化与强化学习优化:传统的 3D 定位需要额外的回归头或深度估计模块,与 VLM 的生成式 token 序列割裂。SR-REAL 的 DTR 路径将 3D 中心点坐标量化为离散 token,由区域 token 直接预测,并将坐标精度转化为可优化的检测奖励,从而使不可微的几何对齐变成强化学习的自然奖励信号。这种设计不仅避免了单独训练回归分支带来的架构臃肿,也让 3D 定位成为推理链的一环,在冷启动 SFT 提供初始坐标先验后,RL 能进一步精调定位,最终在空间 VQA 和 3D 推理基准上显著超越纯语言推理或检测后推理的基线。
方法
输入与基础模型
空间 VLM 接收图像 ( I ) 与自然语言空间查询 ( Q )(如“物体 A 比物体 B 更远吗?”)。基础模型为基于视觉-语言架构(如 LLaVA 拓展)的空间 VLM,内置视觉编码器和语言解码器,并支持区域级别的视觉 token 表示。
双路径推理机制
SR-REAL 在响应查询时同时维护两条互补推理路径:
- 语言独推理(LOR):完全在语言空间内进行逐步演绎,利用语义关系、常识等推导空间结论,无需显式 3D 定位。
- 检测后推理(DTR):先通过区域 token 检测出 3D 几何线索(如物体中心、边界框坐标),再基于这些显式几何量进行数值推理,最终给出答案。
两阶段训练流程
冷启动监督微调 阶段为两条路径分别构造结构化的思维链监督数据,并将区域 token 与预测的 3D 坐标通过一个区域到 3D 的接口关联;同时混入 2D/3D 定位和通用 VQA 数据,以稳定模型初始化。
强化学习阶段 采用 GRPO 联合优化两个策略,奖励信号包含:
- 准确性奖励:对比预测答案与 ground truth 的语义匹配程度;
- 格式奖励:保证输出符合指定格式(如 CoT 结构);
- 离散中心检测奖励(仅限 DTR 路径):将物体中心的连续坐标离散化为网格,通过检测准确度提供细粒度几何对齐信号。
RL 训练中,LOR 和 DTR 共享模型参数,梯度交替或混合更新,使两条路径互相增强。
输出
推理时,模型根据查询特性自选或由用户指定一条路径,生成结构化的 CoT 答案,必要时包含显式 3D 坐标或纯粹的文字推导。
与同类方法的差异
不同于以往仅依赖语言推理(如纯文本 CoT)或仅使用 3D 定位(如端到端检测)的单一策略,SR-REAL 首次在稀疏奖励的 RL 框架下联合优化两种推理模态,并证明跨路径的正向迁移优于独立训练。
实验
实验设计
SR-REAL 在统一的空间 VLM 基础上,通过两阶段训练实现双路径推理:
- 冷启动 SFT:构建 LOR(语言推理)与 DTR(检测后推理)的结构化 CoT 监督,并引入 region-to-3D 接口,混合 2D/3D 定位与通用 VQA 数据。
- 强化学习:使用 GRPO 联合优化两条路径,奖励包括准确率奖励和格式奖励,DTR 额外加入离散中心检测奖励以精调几何对齐。
实验覆盖多种空间基准,对比主流空间 VLM,并系统消融:(1) 单路径 vs 双路径,(2) 冷启动数据质量,(3) 跨数据集泛化。
关键发现
- 双路径互补:单一 RL 模型同时支持 LOR 与 DTR,DTR 在需要精确定位的区域感知任务中性能突出,LOR 提升通用空间推理。
- 互强化效应:联合训练两条路径比单独训练各自均更好,LOR 的推理与 DTR 的几何线索互相增强。
- 冷启动关键性:高质量、混合型的冷启动 SFT 数据对后续 RL 稳定优化不可或缺,低质数据易导致训练崩溃。
- 零样本泛化:无需逐任务微调,模型即可泛化到不同数据集和领域,LOR 与 DTR 间存在正向迁移。
基线对比解读
与现有空间 VLM 相比,SR-REAL 的核心优势在于通过 RL 动态选择最优推理路径,而非依赖固定策略。基线模型多采用单一推理模式,难以适应多样化空间查询。DTR 的显式 3D 几何原语检测弥补了纯语言推理在定量空间关系上的不足,而 LOR 则避免了不必要定位带来的开销。这种一体化设计在保持模型参数高效的同时,显著提升跨任务平均性能,并在长尾查询上表现出更强的鲁棒性。
行业影响
落地场景
SR-REAL 的双路径空间推理能力可嵌入任何需要精确 3D 空间理解的视觉 AI 产品。
- 自动驾驶:多步空间推理(如“右前方车辆是否正在逼近”)要求先检测物体 3D 位置再推理关系,DTR 路径直接提供几何对齐,减少误判。
- 增强现实(AR)/虚拟现实(VR):用户指令“把虚拟台灯放在桌子左后方 20cm”需精准 3D 定位,LOR 与 DTR 协同可提升交互自然度。
- 机器人操作:抓取任务中对空间关系的复杂问答(“杯子在盒子左侧还是右侧”),双路径推理确保指令跟随可靠性。
- 智能安防:监控视频中基于空间关系的检索(“找出所有靠近消防栓的可疑人员”),DTR 的 3D 检测奖励可强化几何对齐。
商业价值
- 降低标注成本:冷启动只需少量的思维链(CoT)监督数据,后续通过 RL 利用奖励信号自我提升,无需海量人工标注复杂空间推理对。
- 提升关键任务准确率:在自动驾驶和 AR 等场景中,精准 3D 定位直接降低事故或交互失败风险,带来安全与体验溢价。
- 统一架构减少工程维护:单模型同时支持纯语言推理与 3D 检测推理,避免为不同任务维护多个分支,降低部署复杂度。
与现有工作流接口
- VLM 问答系统:可作为插件替换现有空间 VLM(如 LLaVA-3D),通过
LoRA微调与 GRPO 训练集成进问答管线。 - 3D 感知流水线:DTR 路径依赖外部检测器(如
CenterFormer),可直接桥接现有 2D/3D 检测器输出,形成端到端空间推理框架。 - 强化学习训练栈:GRPO 算法与 PEFT 兼容,可轻量化集成,无需全参数重训,适合在已有 MLLM 系统上升级。
具体用例
- 自动驾驶场景问答:车载 VLM 接收环视图像,回答“我左侧的白色轿车是否正在加速?”系统先通过 DTR 检测轿车 3D 中心与速度向量,再以 LOR 推理加速意图,召回率与安全性显著高于纯文本推理基线。
- 电商家具虚拟摆件:用户上传房间照片并说“在沙发右扶手旁 30cm 放一盏落地灯”,后端 VLM 调用 DTR 检测沙发 3D 扶手坐标,计算放置位置,实时渲染 AR 叠加层,大幅减少手动拖拽调整时间,提升转化率。
局限
- - **冷启动数据依赖性强,域偏移下可能退化**:SR-REAL 强调高质量、混合配比的冷启动监督数据是稳定 RL 优化的关键,这意味着方法的性能对初始 CoT 数据分布和 2D/3D 接地标注质量高度敏感。当实际推理场景与冷启动覆盖的语义、几何模式不一致时,RL 阶段的探索可能因奖励稀疏而崩溃,或策略陷入局部最优,难以通过少量新域样本快速恢复,增加了跨任务部署的标注负担。
- - **离散中心检测奖励的几何假设限制泛化**:DTR 路径通过区域 token 预测离散化的 3D 中心坐标,并以此设计检测奖励来促进几何对齐。这一机制建立在对象具有稳定、清晰 3D 中心的假设之上,对严重遮挡、透明物体、可变形体(如动物、布料)或精细小目标的推理能力受限;中心预测的不确定性可能被奖励函数放大,且离散化方案的选择(如量化间隔)会直接影响最终精度,模型可能对真实世界的几何歧义性鲁棒不足。
- - **动态与交互式空间推理评估缺失**:实验仅在静态图像的空间问答基准上进行,未涵盖视频、多视角或具身交互场景。LOR 与 DTR 的联合强化学习虽然展示了在静态上下文中相互增强的效果,但时序一致性、移动遮挡下的长期推理以及主动感知策略等实际需求未被验证,模型能否有效处理动态空间关系仍需进一步研究。