南洋理工等提出 S-Agent 空间智能转向行动推理
S-Agent 让 VLM 像智能体一样调用工具逐步推理空间问题,用行动链替代直接作答,性能超越前沿模型。
南洋理工大学等机构提出 S-Agent,将空间理解从一次性回答改为可执行的行动链。VLM 负责规划,专用模型处理深度、位姿和 3D 对齐,空间专家把几何输出转化为可用证据。在 zero-shot 下,S-Agent 在 MMSI-Bench 达 46.4%,优于 Gemini 3 Pro。
正文摘录
行动即推理:南洋理工大学等提出 S-Agent,空间智能迈入 Agent 时代 - source: 机器之心 .jpg)  南洋理工大学 S-Lab 联合 Ropedia 提出 S-Agent,把空间理解从一次性回答改写为一条可执行的行动链:VLM(视觉语言模型)负责读懂问题、规划下一步,DA3 等专用模型负责深度、位姿和 3D 对齐,空间专家再把几何输出转化为可用证据。论文结果显示,S-Agent 在 zero-shot 设置下取得 MMSI-Bench 46.4%、ViewSpatial-Bench 60.0% 的成绩;通过 S-300K 轨迹蒸馏,8B 模型进一步在 MMSI / ViewSpatial 上达到 41.6 / 46.8。