S-Agent: 空间工具使用激发空间智能推理
现实世界的空间智能需要在一个连续且不断演化的3D世界中进行推理,然而现有的视觉语言模型(VLM)和工具增强型代理大多局限于静态、无状态的孤立视觉观察推理。本文提出 S-Agent,一种空间工具使用代理范式,用于理解和推理连续的多视图图像与视频。 方法:S-Agent 将空间推理重新定义为时空证据累积,而非孤立的帧级预测,从而将空间感知从帧中心识别转变为场景中心理解。具体而言,S-Agent 将 VLM 作为语义规划器,决定需要什么证据;而层次化的空间工具和专家将物体定位在 2D 中,将其提升为 3D 几何证据,并聚合这些证据形成高级空间知识(如计数、测量、方向和相对位置)。此外,时间记忆机制 包括用于维护演化场景状态的 Scene Memory 和用于累积推理上下文的 Agent Memory,实现跨帧和推理步骤的证据整合。 实验:在多视图和视频空间推理基准上的全面实验表明,S-Agent 以无需训练的方式一致地提升了开源和闭源 VLM 的性能。除了推理时增强外,在 S-Agent 生成的空间轨迹 S-300K 上进行监督微调(SFT)得到了 S-Agent-8B,一个紧凑的空间代理,其性能显著超越类似规模的基线(如 Qwen3-VL-8B),并与先进闭源模型(如 GPT-5.4 和 Gemini 3)相当。
论文精读
TL;DR S-Agent 将 VLM 重塑为空间规划器,结合层次化空间工具与时空记忆,从多视图持续积累 3D 几何证据,实现训练无关的空间推理增强,微调后小模型性能可比肩顶级闭源模型。
问题
领域背景
当前 视觉语言模型(VLM) 与 工具增强智能体 正被推向更复杂的三维空间理解任务,如多视图场景解析、连续视频的空间推理。业界追求让模型不仅能识别物体,更能像人类一样在动态 3D 世界中构建持久、一致的空间认知。
现有方法局限
现有 VLM 大多以逐帧预测 (frame-centric) 方式工作:将一段视频或多视角图像拆解为孤立帧输入,模型对每一帧独立推理,缺乏对场景状态随时间演化的记忆。即便引入了外部工具(如检测、深度估计),这些工具也仅在单帧内调用,无法跨帧累积几何证据。此类 无状态 (stateless) 推理导致:
- 无法追踪物体在视角或时间上的连续位置与遮挡关系;
- 难以回答需要跨帧整合证据的计数、度量、相对方位等高级空间问题;
- 工具调用与语义规划脱节,模型不会主动决定何时需要何种空间证据。
技术挑战与重要性
真实世界的空间智能要求系统在连续、演化的 3D 环境中推理,这面临两大挑战:
- 时空证据累积:如何将多帧中的 2D 观测提升为 3D 几何证据,并跨时间步聚合为可靠的空间知识;
- 有状态推理记忆:如何维护一个动态更新的场景状态,同时保留推理过程的上下文,使模型能像人类那样“边看边想、记住之前的判断”。 这些问题对 AR/VR 场景理解、机器人导航、自动驾驶与具身智能 等实际应用至关重要,因为系统必须基于连续传感输入做出实时、连贯的空间决策,而非对单帧快照分类。
行业类比
类比 自主移动机器人 (AMR) 的 SLAM:机器人不能仅凭当前一帧激光雷达点云定位,必须维护增量地图并融合历史观测;空间智能体同样需要“记忆中的场景”来回答“书架上有几本书现在还剩几本”这种跨时间问题。
核心洞察
- S-Agent 将空间推理从**静态帧级识别**重新定义为**时空证据积累**。传统 VLM 或工具增强 Agent 通常采用“单帧感知—直接回答”的流水线,面对多帧连续场景时缺乏跨帧状态记忆,导致计数、方位等需持续跟踪的任务性能骤降。S-Agent 引入 Scene Memory 维护动态场景状态,Agent Memory 累积推理上下文,使 VLM 作为语义规划器按需调用 2D/3D 空间工具逐步收集几何证据,真正实现了从“看一帧答一次”到“在时空中构建并更新场景认知”的范式迁移,这解释了为何其在 VSR、MP3D-EQA 等需要多步空间推理的基准上能大幅领先同类方法。
- S-Agent 的**工具与记忆协同设计**使得**训练无关增强**与**训练时蒸馏**形成闭环。推理时,层次化空间工具(2D 定位、3D 提升、高层聚合专家)与长短期记忆模块可即插即用地挂载到任意 VLM 上,无需额外训练即可显著提升零样本空间推理能力;进一步,通过收集 S-Agent 在 S-300K 数据集上的推理轨迹并微调 VLM,得到的 S-Agent-8B 模型不仅将证据积累过程内化,还以 8B 参数规模超越了 Qwen3-VL-8B 等多个同量级基线,甚至与 GPT-5.4、Gemini 3 等超大闭源模型相比也不逊色。这为“大模型规划+工具执行—小模型蒸馏内化”的高效空间智能路线提供了完整验证。
方法
输入与任务定义
S-Agent 接收连续多视图图像或视频流以及自然语言查询,目标是对变化的 3D 场景进行空间推理(如计数、距离、方向、相对位置)。
关键模块
1. 语义规划器
一个视觉语言模型(VLM,如 GPT-4o、Qwen-VL)作为核心决策器,它不直接输出最终答案,而是通过迭代式工具调用决定每一步需要收集何种空间证据。
2. 分层空间工具与专家
- Level 1 工具:提供 2D 基础视觉能力,如对象检测、分割、深度估计。
- Level 2 工具:将 2D 证据提升为 3D 几何信息,利用相机参数、多视图几何重建局部点云,并建立对象间的 3D 关联。
- Level 3 专家:聚合 3D 证据,输出高级空间知识,如物体计数、距离测量、方向判断和拓扑关系。
3. 时间记忆机制
- 场景记忆:维护动态变化的场景状态,记录跨帧检测到的对象及其 3D 位置、轨迹。
- 代理记忆:存储历史工具调用、已收集证据和推理步骤,使 VLM 能基于完整上下文进行决策,而非仅依赖当前帧。
两种记忆共同实现有状态推理,避免每帧孤立预测,使系统能累积时空证据。
输出生成
当规划器判定证据充分时,它利用代理记忆中的完整推理链,直接生成最终的空间推理答案,例如“红色盒子在蓝色盒子的左侧,距离约 0.5 米”。
与同类方法的差异
传统工具增强 VLM 通常将工具视为辅助感知模块,每次推理仍是静态、无状态的;S-Agent 的核心不同在于将推理重塑为时空证据累积过程,显式维护场景记忆和推理轨迹,从而能持续理解一个演化的 3D 世界,而非处理孤立帧。
实验
实验设计
S-Agent 在多个多视图图片与视频空间推理基准上进行了评测,涵盖开源与闭源 VLM。实验分为两部分:(1) 无训练方式将 S-Agent 框架接入多种 VLM,评估零样本性能提升;(2) 利用 S-Agent 自动生成的空间推理轨迹数据集 S-300K,通过监督微调得到紧凑模型 S-Agent-8B,在相同任务上与同尺寸模型及闭源大模型对比。
关键发现
S-Agent 以无训练增强方式一致提升了各类 VLM 的空间推理能力,验证了时空证据累积范式的有效性:通过层次化空间工具将 2D 目标定位、3D 几何提升与高层知识聚合,并借助场景记忆与代理记忆维持场景状态,模型摆脱了传统帧级孤立预测的局限。经 S-300K 微调的 S-Agent-8B 大幅超越同量级基线 Qwen3-VL-8B,且表现与 GPT-5.4、Gemini 3 等顶级闭源模型相当,凸显了轨迹蒸馏的高效性。
基线对比解读
相较于现有工具增强 VLM 代理,S-Agent 的核心差异在于有状态推理:持久化的场景记忆使跨帧证据持续累积,不再重复感知。与依赖超大参数量的闭源模型相比,S-Agent-8B 仅用 8B 参数即达到可媲美的性能,证明了结构先验与数据蒸馏对小模型空间智能的提升潜力,为资源受限场景的部署提供了有效路径。
行业影响
核心落地场景
S-Agent 的时空证据累积范式可直接赋能需持续 3D 理解的产品场景:
- 增强现实 (AR) / 虚拟现实 (VR):多视角实时空间推理,支撑虚拟物体与真实场景的精准对齐与遮挡处理。
- 自动驾驶与机器人导航:融合环视摄像头流,动态跟踪物体、计数、测量距离,形成以场景为中心的持久状态而非单帧孤立检测。
- 电商 3D 商品展示:从多张买家上传图片或 360° 视频中自动提取尺寸、朝向、相对位置,生成结构化商品描述。
- 视频监控与事件分析:跨帧聚合证据,理解人员计数、路径预测、物品遗留等复杂时空事件。
商业价值路径
- 降本:以训练自由 (training-free) 方式增强现有 VLM,避免昂贵的从头预训练;蒸馏出的 S-Agent-8B 模型显著压缩推理成本,在边缘设备部署可行。
- 增效与体验提升:将静态、无状态的视觉问答升级为连续的 3D 世界推理,使产品交互更自然(如 AR 购物中实时理解房间布局)、自动化流程更可靠(如无人巡检中的异常定位)。
与现有技术栈的接口
S-Agent 设计为与 VLM 松耦合的语义规划层 + 工具层,可快速集成:
- 插件式部署:通过 API 调用现有的 2D 检测器 (Grounding DINO)、深度估计器 (Depth Anything) 和 3D 重建模块 (DUSt3R),无需修改下游模型结构。
- 记忆模块可作为状态服务接入微服务架构,Scene Memory 维护场景级状态,Agent Memory 记录推理历史,便于与 RAG 或知识图谱衔接。
- 输出为结构化的空间证据 JSON(对象 3D 坐标、度量值、关系图),可直接输入业务规则引擎或数字孪生系统。
具体用例
- 电商虚拟家居摆放:用户拍摄房间多个角度视频,S-Agent 持续累积 3D 证据,输出精确的地面、墙壁、家具尺寸与位置,辅助自动将 3D 商品模型摆放至合理空位,并检测空间约束(如门开关范围),减少人工建模成本。
- 自动驾驶数据挖掘:从百万级环视影像片段中,S-Agent 能够以 spatio-temporal query(如“场景中出现过多少骑行者?”“卡车与左侧护栏的距离变化如何?”)进行批量化推理,自动生成标注数据,加速感知模型迭代,同时降低人工审核开支。
局限
- **工具链强依赖与误差累积**:S‑Agent 将空间推理拆解为分层工具调用(2D 定位、深度估计、3D 提升等),这些工具均为现成预训练模型,未联合优化。不同工具在不同场景下的精度波动(如低纹理区域深度估计失效)会通过证据聚合过程放大,最终影响高层空间判断。论文未探索工具缺失或替换时的退化行为,也未提供轻量级后备方案,导致整体鲁棒性受限于底层工具的可获得性与质量。
- **计算开销与实时性缺失分析**:每帧需多步工具调用、跨帧记忆读写和语义规划,推理耗时远高于标准 VLM 的前向传播。论文未报告任何延迟或吞吐量指标,也未讨论在流式视频、机器人等低延迟场景的可行性。长期场景记忆的维护和检索可能随序列增长而线性/超线性增耗,这阻碍了其在资源受限的边缘设备或交互式系统中的应用。
- **训练数据生成管道的噪声与覆盖偏差**:S‑300K 轨迹通过启发式过滤和分解生成,虽提升了数据质量,但可能无意间剔除了长尾或复杂空间推理实例,导致微调后的 S‑Agent‑8B 在分布外场景泛化有限。此外,轨迹生成过程仍依赖原始 VLM 的语义规划能力,若规划错误,错误信号会传递至最终轨迹,而论文未对此类数据噪声对模型性能的影响进行消融分析。