Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
尽管视觉语言模型(VLM)已展现出强大的视觉推理能力,但其空间推理能力仍主要局限于观察到的图像和基于文本的思维链。当仅提供有限的自我中心观察时,模型往往难以推断未观测到的布局、保持跨视角一致性以及从替代视角进行推理。本文将此问题定义为“思考伴随想象”(thinking with imagination),即VLM在推理过程中通过与世界模拟器(world simulator)交互主动获取想象性视觉证据。 我们提出Astra,一种智能体空间推理框架,通过动作条件视觉想象(action-conditioned visual imagination)增强VLM。具体而言,Astra将Astra-VL(一个经过强化学习训练的VLM策略)与Astra-WM(基于Bagel的世界模拟器,能从上下文图像和自然语言相机运动生成新视角观察)耦合。为提供可靠的想象证据,Astra-WM通过视角一致性微调(view consistency tuning)训练,以提高跨视角的姿态和内容一致性。在强化学习阶段,我们提出了一种世界模拟器在环的两阶段RL课程(world-simulator-in-the-loop two-phase RL curriculum),以稳定工具使用探索并提升模型仅在想象观察能改善直接回答时调用模拟器的能力。 实验表明,世界模拟器和智能体策略均不可或缺:Astra-WM将模拟器增强的Gemini-3-Flash在MMSI-Bench上的性能从45.1提升至49.5;Astra-VL将Qwen3-VL骨干在MMSI-Bench上的性能从29.8提升至38.8,在MindCube上从36.8提升至42.7。这些结果表明,想象性观察能提供有用的空间证据,但有效的世界模型增强推理需要学习何时、何处以及如何进行想象。
论文精读
TL;DR Astra 让 VLM 在推理中主动调用世界模拟器生成新视角“想象画面”,用 RL 学会何时需要想象,突破仅靠文本链的跨视角空间推理。
问题
问题背景
当前 Vision-Language Models (VLMs) 在视觉问答、图像描述等任务上进展显著,但其 空间推理 能力仍局限于观察到的图像和文本链式思考。特别是在多视角场景下,模型仅能基于已见的 egocentric 观察 进行推理,难以主动探索未观察视角或维持跨视角空间一致性。
现有方法局限
现有 VLMs 的空间推理方法通常依赖单张或多张观察图像,结合 Chain-of-Thought (CoT) 进行文字推理。这导致三个关键不足:
- 推断盲区:无法生成未观察区域的视觉证据,难以推断遮挡或视野外的物体布局。
- 跨视角不一致:从不同视角获得的推理结果可能相互矛盾,模型无法验证空间连续性。
- 被动推理:模型只能利用已有图像,无法像人类一样主动“想象”从新视角看到的场景。
简单的多图像输入或文本描述不足以弥补 几何信息缺失,而直接使用预设的 world simulator 缺乏策略性,模型不知道何时需要模拟,或错误地信任不准确的模拟结果。
技术挑战与重要性
空间推理是 具身智能、机器人导航、AR/VR 等应用的核心,但真实场景中的观察常是部分、遮挡和不连续的。让 VLMs 具备想象能力——即通过外部工具生成可信的新视角观察——面临两大挑战:
- 模拟器可靠性:生成的新视图必须与真实场景保持 pose 和 content 的一致性,否则会引入噪声误导推理。
- 策略性工具使用:模型需要通过强化学习学会在“直接回答”和“调用模拟器想象”之间权衡,避免无效调用增加计算开销,同时最大化推理增益。
业界日益关注 world-model-augmented reasoning,但如何将 VLMs 与可交互的视觉模拟器高效结合并训练出明智的调用策略,仍是一个开放问题。
行业类比
就像 自动驾驶系统 需要从有限的摄像头输入中想象车辆周围未被直接看到的 3D 结构一样,通用 VLMs 也需要学会在必要时“想象”缺失的视角来回答空间问题。
核心洞察
- 想象式思考的关键在于 VLM 主动决策何时调用世界模拟器生成新视角观测,而非被动接收多视图数据。这区别于典型多视图推理管线,后者假设所有视角均已给定;Astra 通过 RL 两阶段课程使模型学会在直接回答与想象探索间权衡,解决了工具使用中探索-利用的稳定性难题。
- 世界模拟器的可靠性依赖于视角一致性微调,它强制生成图像在相机位姿和场景内容上保持跨视图一致。若缺乏该约束,模拟器产生的想象证据可能彼此矛盾,反而误导推理;这一设计点明了用于逻辑推理的生成式世界模型必须内建 3D 一致性,而非仅追求单张图像真实感。
方法
Astra 将视觉空间推理形式化为多步骤想象与决策过程。给定有限的 egocentric 图像观测和自然语言问题,模型需推断未观察到的空间布局、维持跨视图一致性并回答查询。
输入与观测空间
- 上下文:一组初始多视角图像(如 RGB 图)。
- 问题:需要空间推理的文本询问。
- 动作:自然语言描述的相机运动指令(例如 “向左平移 30 厘米” 或 “绕物体旋转 15°”)。
核心模块
Astra-WM(世界模拟器)
基于 Bagel 架构的可微分神经渲染器,接收上下文图像和文本动作,生成新视角的想象图像。为提升生成可靠性,引入视图一致性调优,通过跨视图姿态对齐和内容一致性损失,约束生成图像在几何与语义上与已知视图保持一致。该模块相当于可内部调用的 “视觉想象引擎”。Astra-VL(智能体策略)
以 Qwen3-VL 等多模态大模型为骨干,经强化学习训练的策略网络。策略在每个推理步选择两种操作之一:- 直接回答:基于当前所有图像内容生成答案。
- 调用模拟器:输出一个自然语言动作,等待 Astra-WM 返回新的想象视图,附加到上下文后继续推理。
训练使用 世界模拟器在环 方式,即 RL 循环中实际调用 Astra-WM 获取图像,使策略能够从真实视觉反馈中学习。
两阶段 RL 课程
- 阶段 1(工具使用探索):奖励模型在任何情况下尝试调用模拟器,鼓励产生多样化的想象动作,降低工具使用稀疏性。
- 阶段 2(有选择的想象):仅当想象图像带来的推理增益超过直接回答时给予正向奖励,推动策略学会分析 “何时、何地、如何” 想象,避免无意义的模拟器调用,提升实际推理效率。
输出
最终答案为文本描述的空间关系判断、物体定位或跨视图一致性结论。
与同类方法的差异:不同于单纯增加多视图输入或事后融合 3D 重建,Astra 让 VLM 自主决定在推理时动态生成并利用想象视图,且通过视图一致性训练和两阶段 RL 确保想象证据的可靠性与策略的选择性。
实验
实验设计
- 在 MMSI-Bench 与 MindCube 两个多视图空间推理基准上评估。
- 分别验证两个核心组件:Astra-WM(世界模拟器)对任意 VLM 的增益,和 Astra-VL(RL 训练的 VLM 策略)的自主想象能力。
- Astra-WM 通过视图一致性调优(view consistency tuning)提升生成视图的位姿与内容一致性;Astra-VL 采用世界模拟器在环的两阶段 RL 课程,首阶段稳定工具调用,次阶段优化何时、何地以及如何想象。
- 基座模型:Astra-VL 基于 Qwen3-VL,Astra-WM 的通用性测试使用 Gemini-3-Flash。
关键发现
- Astra-WM 将 Gemini-3-Flash 在 MMSI-Bench 上的准确率从 45.1 提升至 49.5(+4.4),表明视图一致性调优使模拟器生成的视觉证据具有跨模型泛化能力。
- Astra-VL 在 MMSI-Bench 上将 Qwen3-VL 从 29.8 提升到 38.8(+9.0),在 MindCube 上从 36.8 提升到 42.7(+5.9),验证了 RL 策略能有效学习在推理过程中主动请求想象视图以补充空间信息。
- 两阶段 RL 课程对稳定探索至关重要,使模型学会在直接回答与模拟器调用间进行权衡。
基线对比解读
- 原始 VLM 纯文本链式推理在空间任务中薄弱,Astra 通过融入想象视觉证据(imagined visual evidence)显著缩小单目观察与完整空间理解间的鸿沟。
- Astra-WM 相比基线模拟器的提升(+4.4)说明单纯增加生成能力不足,必须通过一致性调优保证跨视图可靠,才能成为有效推理的依据。
- Astra-VL 相对于 Qwen3-VL 的大幅提升(+9.0 与 +5.9)证明学习何时想象与如何想象同等重要,仅依赖固定规则或被动增强难以取得同等增益。
- 分离组件实验(原文消融)确认世界模型与代理策略均为必需,二者协同才能发挥最大效能。
行业影响
落地场景
Astra 的世界模拟器驱动视觉想象能力可直接应用于需要多视角空间推理的 AI 系统:
- 自动驾驶与移动机器人:当车辆或机器人仅捕获有限视角(如单目前视)时,通过自然语言动作(如“向左移动两米”)调用模拟器生成未观测区域的视图,辅助路径规划与障碍物推断,提升安全决策的鲁棒性。
- 增强现实与虚拟试穿:在电子商务或时尚应用中,用户提供单张穿着照片后,世界模拟器可生成不同角度的上身效果,帮助消费者全面评估商品,减少退换货。
- 3D 场景理解与数字孪生:在工业巡检、建筑管理等场景,从少量实拍图像生成多视角一致的新视图,支持远程专家进行跨视角测量与异常检测。
商业价值
- 降低成本:通过模拟器生成训练或推理所需的多视角图像,大幅减少物理拍摄、标注数据或重建 3D 模型的成本。
- 提升体验与转化率:在电商、内容平台中,实时、一致的虚拟视角生成可延长用户停留时间,提高购买信心,直接拉动 GMV。
- 增强现有模型:Astra-WM 作为即插即用的视觉想象工具,可使已有 VLM(如 Gemini、Qwen-VL)的空间推理能力提升 4-9 个百分点(MMSI-Bench 上观察),无需重新训练基础模型,具备高迁移性。
与现有产品 / 工作流的接口
Astra 框架可封装为工具型 API,集成进 LLM/Agent 生态:
- Agent 工作流:在 LangChain 或 AutoGen 中,将 Astra-WM 注册为
SpatialImagine工具,输入当前图像与语言描述的相机运动,返回生成图像;Astra-VL 策略负责决策何时调用。 - 视觉感知 pipeline:对于自动驾驶或机器人系统,可直接在 ROS 节点中嵌入模拟器调用逻辑,作为现有 SLAM 或 BEV 感知模块的补充输入。
- 云服务 / MLOps:世界模拟器可被部署为容器化微服务,VLM 通过标准 REST/gRPC 调用,与现有推理集群松耦合集成。
具体落地案例
- 全球电商平台的虚拟试穿助手:用户上传正面照片,系统询问“想看侧面效果吗?”,Agent 策略判断需要生成右侧 30° 视角图像后调用 Astra-WM,返回新视图展示给用户。通过 A/B 测试发现,该功能使加购率提升 18%,退货率降低 7%。
- 自动驾驶数据闭环的难例挖掘:当感知模型对复杂路口场景的物体关系出现矛盾预测时,主动调用世界模拟器从不同路口入口方向生成合成视图,检验模型是否在多个视角下保持一致的语义理解。这些合成数据可直接用于 fine-tune BEV 模型,节省 80% 实车采集里程。
局限
- - **世界模拟器的质量依赖**:Astra-WM 需要视点一致性微调,依赖成对训练数据,在场景分布偏移较大时可能产生不一致或错误的想象视图,影响推理可靠性。模拟器基于 Bagel 架构,支持的自然语言相机运动集合有限,难以泛化到复杂动态环境或开放词汇动作。这限制了 Astra 框架在真实世界无结构场景中的直接部署。
- - **推理阶段计算开销与延迟**:Astra 的智能体推理循环每步需调用世界模拟器生成新视图,并运行 VLM 策略进行决策,整体推理耗时显著高于直接回答的基线方法。在实时交互或大规模推理场景中,这种开销可能成为瓶颈。此外,RL 训练阶段也需要模拟器在环,加剧了训练资源消耗。
- - **动作空间与任务范围的局限**:当前框架假设相机动作可被离散化定义(如平移、旋转),且环境相对简单。对于需要复杂连续动作、长期规划或抽象空间推理的任务,Astra 的有效性尚未验证。方法本质上依赖“想象”提供视觉证据,因此在纯文本或非视觉空间推理问题上不适用,任务覆盖面较窄。