论文

Skill-3D:面向智能体3D空间推理的自演进场景感知技能

Skill-3D:面向智能体3D空间推理的自演进场景感知技能

现有方法在处理3D场景时往往误用工具,并展现出有偏的工具偏好,使得智能体范式相比非智能体策略收益甚微。本文揭示,3D空间推理任务在不同场景下具有异质性,而现有智能体对所有场景采用统一的工具使用策略,而非根据具体场景和任务选择工具。 为解决此问题,本文提出Skill-3D框架,该框架学习自演进的场景感知技能。具体而言,Skill-3D识别任务场景,并将智能体的工具使用轨迹记录到Scene Memory中。来自相似场景的成功轨迹被聚合和蒸馏为可重用的场景感知技能,失败轨迹则作为教训附加到该技能中。在训练过程中,当类似场景再次出现时,注入相应技能以指导智能体,产生新的轨迹。这些轨迹的成功与失败进一步优化该技能,形成记忆与技能库共同演进的循环。 实验表明,Skill-3D显著提升了3D空间推理中的工具利用率(在VSI-Bench上从39%提升至78%),推动智能体向正确且充分的工具使用发展。例如,它在MMSI-Bench上将Gemini-3-Flash提升了67%。此外,我们在技能引导的轨迹上进行智能体后训练,使Qwen3-VL-8B在VSI-Bench上提升了43%。

论文精读

TL;DR Skill-3D 提出自进化场景感知技能,引导 MLLM 代理在 3D 空间推理中按场景选择工具,将工具利用率从 39% 提升到 78%。

问题

问题背景

基于多模态大语言模型(MLLM)的 agentic 3D 空间理解 正成为研究热点,即让 agent 通过调用视觉工具(如深度估计、分割、目标检测)对 3D 场景进行推理与问答。

现有方法局限

当前 agentic 方案普遍对所有 3D 场景施加统一的工具使用策略,忽略场景间的巨大差异。实验表明,这类 agent 经常误用工具或陷入工具偏好偏差(如过度依赖单一工具),导致实际收益甚微——在 VSI-Bench 上工具利用率仅 39%,agentic 范式相比无 agent 策略仅能取得微弱提升。根本原因在于现有方法未建立场景-工具的适应机制:3D 任务(如距离估计、空间关系判断、视角变换)在不同场景中所需工具组合截然不同,但 agent 缺乏根据场景动态调整工具链的能力。

技术挑战与重要性

3D 空间推理任务的异构性极高:室内/室外、稀疏/密集物体、不同几何结构等都要求不同的感知顺序和工具组合。让 agent 自主习得这种场景感知能力需要解决两个难题:

  • 如何从离散的工具调用轨迹中提取可复用的成功模式,并记住失败教训;
  • 如何在持续学习中积累技能,避免遗忘或灾难性干扰。 这类能力直接决定 agentic 系统能否在实际应用中(如机器人导航、AR 场景理解)真正超越端到端模型,业界对其可靠性和自适应能力高度关注。

行业类比

这类似自动驾驶系统根据天气和路况动态选择感知模块(如雨雾天启动去噪、夜间增强曝光),若 3D 推理 agent 始终保持固定工具链,就像用晴天模型处理暴雨场景,必然会频繁失效。

核心洞察

  • 3D 空间推理任务的场景异质性远被低估,统一的工具调用策略会导致大量误用。Skill-3D 通过 Scene Memory 按场景相似度聚类轨迹,并从中蒸馏出 scene-aware skills,让 agent 在面对新场景时能自适应地选择“何时调用哪个工具”。这种从全局策略到场景感知策略的转变,直接解释了为何 agentic 范式的增益在过去微乎其微——因为忽略了任务-场景的耦合性,使工具利用从固定模式升级为动态推理。
  • Skill-3D 构建了一个记忆与技能库共同演化的闭环:成功的轨迹被聚合并提炼为可复用技能,失败的轨迹作为“教训”附在技能上,指导 agent 避免相同的错误。这种自进化机制不同于传统的静态 few-shot 示例或一次性微调,它让模型在交互中持续从错误中学习,类似人类积累经验的过程。对于工程部署,这意味着一个随着使用不断变聪明的 agent,尤其适合需要长期运行、场景不断扩展的 3D 应用。

方法

输入

给定三维场景的多视图图像文本任务指令,由 MLLM agent 自主调用预定义工具(如相机旋转、物体检测)进行空间推理。

关键模块

Skill-3D 的核心是将 agent 的工具使用轨迹转化为可演化的场景感知技能,包含三个阶段:

  1. 场景感知技能提取

    • 对每个新场景,agent 先识别场景类型(布局、物体密度等),在执行任务时记录完整的工具调用序列。
    • 成功的轨迹按场景相似性聚合,通过蒸馏(例如提取通用工具选择模式)形成一条可复用技能;失败的轨迹作为负例教训附加在技能上,标记为“应避免的操作”。
    • 技能与对应场景索引共同存入 Scene Memory
  2. 技能引导推理

    • 遇到与记忆库中相似的新场景时,系统检索相关技能,将其转化为提示或约束注入 agent 的推理过程(如限制可用工具子集、建议顺序)。
    • Agent 在引导下生成新轨迹,其成功/失败结果反馈给技能库,更新技能质量评分或微调蒸馏策略,形成“轨迹产生→记忆更新→技能进化”的闭环。
  3. 技能引导的 Agentic 后训练

    • 利用技能引导产生的高质量轨迹数据(正确工具调用 + 场景特征)对 MLLM 进行强化学习(例如基于 GRPO 的奖励优化),让模型内化场景感知的工具使用策略。
    • 后训练后的模型即使无技能注入,也能在非训练场景表现出更好的工具选择泛化性。

输出

Agent 生成最终空间推理答案,同时伴随更准确且充分的工具调用序列,在 VSI-Bench 上工具正确利用率从 39% 提升至 78%,对 Gemini-3-Flash 等模型改善显著。

与同类差异:不同于现有方法对所有场景采用统一工具策略(导致误用与偏好偏差),Skill-3D 利用自演化场景记忆与技能库,将场景异质性显式编码为可迁移的经验,驱动 agent 动态适应不同场景的工具需求。

实验

实验设计

Skill-3D 在两个具有代表性的 3D 空间推理基准上评估:VSI-Bench(聚焦工具使用质量)和 MMSI-Bench(多模态空间理解)。实验对比了统一工具策略的 Agent 基线,并引入场景感知技能库自演化记忆机制。此外,通过收集技能引导的推理轨迹,对 MLLM(如 Qwen3-VL-8B)进行 agentic post-training,验证技能内化效果。

关键发现

  • 在 VSI-Bench 上,工具利用率从 39% 跃升至 78%,证明场景感知技能显著减少工具误用和偏好偏差。
  • 在 MMSI-Bench 上,Gemini-3-Flash 性能提升 67%,说明跨模型迁移的有效性。
  • Post-training 让 Qwen3-VL-8B 在 VSI-Bench 上提升 43%,表明技能引导的轨迹可用于提升模型本身的空间推理能力。

与基线对比解读

传统 Agent 对所有场景采用同一工具调用策略,忽略了 3D 任务的场景异质性,导致工具选择次优。Skill-3D 通过相似场景记忆匹配动态注入技能,使 Agent 能借鉴历史成功经验,同时从失败中学习。这种记忆-技能协同演化的闭环,使工具调用更精准、更充分。与统一策略基线相比,Skill-3D 不仅在常用工具上减少误用,还能发现罕见但必要的工具组合。Post-training 进一步将外部技能转化为模型内在知识,避免了推理时对记忆库的过度依赖,提升了泛化性与推理效率。

行业影响

落地场景

Skill-3D 的核心能力是让 MLLM 代理在 3D 空间推理任务中自适应地选择工具,这直接作用于一系列需要空间感知的智能产品:

  • 增强现实/虚拟现实(AR/VR):头戴设备中的空间锚点识别、虚实遮挡推理,代理可根据场景动态调用深度估计或 SLAM 工具。
  • 自动驾驶与机器人:端到端的 3D 感知管线中,代理需融合激光雷达(LiDAR)、相机等传感器信息进行场景理解;Skill-3D 可帮助代理按需调度目标检测、占据网格预测(occupancy prediction)等工具。
  • 智能家居/工业数字孪生:基于 RGB-D 的室内重建、物品搜索等,代理可利用场景记忆快速匹配相似环境,减少无效工具调用。

商业价值

  • 降本:工具使用效率提升直接降低计算开销——从 VSI-Bench 上看,工具利用率从 39% 提升到 78%,意味着大量误用工具带来的算力浪费被消除;代理后训练(post-training)还能以较少数据使小模型(如 Qwen3-VL-8B)获得大幅增益(+43%),降低部署成本。
  • 增收与体验提升:在 B 端产品(如 3D 内容创作平台、工业检测)中,准确的工具调用可提升自动化率,减少人工干预,加快生产节拍;在 C 端(如 AR 导航、智能拍照手机),更可靠的空间理解直接改善用户交互流畅度与功能可用性。

与现有产品/工作流的接口

Skill-3D 框架可轻量化集成进现有 MLLM Agent 栈

  1. 场景记忆提取模块Scene Memory + skill library)可作为中间件部署在推理管道中,记录工具调用轨迹并在线蒸馏技能。
  2. 与现有 Agent 框架(LangChain、AutoGen 等)兼容:技能库可通过外部记忆插件形式注入,不修改基础 MLLM 结构。
  3. 代理后训练流程:利用 skill-guided trajectories 进行监督微调(SFT)或强化学习(如 GRPO),可与已有的模型微调流水线(如 LLaMA-Factory)无缝衔接。

具体落地 Use Case

  • 电商 3D 商品展示与搜索:用户上传房间照片或视频,代理需理解空间尺寸并推荐家具摆放方案。Skill-3D 使代理根据场景类型(卧室、客厅)自选深度估计、物体检测、布局推理工具,避免对每一帧都调用全部昂贵模型,提升实时交互体验和推荐准确度。
  • 教育领域的 AR 实验模拟:学生通过平板或 AR 眼镜观察虚拟物理实验装置,代理需解释组件之间的 3D 位置关系。Skill-3D 可记录典型课堂场景(如电路板、力学模型),当相似场景出现时快速匹配技能,显著减少工具调用延迟,使解释更流畅、准确。

局限

  • **场景记忆的冷启动与数据依赖**:Skill-3D 需要积累足够的成功与失败轨迹来构建有效的技能库与场景记忆。在训练初期或面对全新场景时,可用的技能数量有限,可能导致引导效果不显著,性能退化到与无技能基线相近。虽然论文展示了跨 benchmark 的技能迁移(附录 B.2),但大规模部署仍需多样化且充分标注的 3D 场景数据,否则场景覆盖不足会使技能库泛化受限。
  • **计算与存储开销**:技能提取需要从记忆库中聚类相似场景并蒸馏轨迹,推理时需检索并注入技能,自进化循环进一步增加了在线更新成本。附录 B.1 的效率分析可能表明延迟上升,但在实时 3D 推理或资源受限的设备上,频繁的记忆存取和技能匹配可能成为瓶颈,限制了其在实际工程中的可扩展性。
  • **对预定义工具和场景相似度度量的依赖**:方法假设工具集固定,并通过预训练的 3D 特征(如点云编码器)或任务描述来计算场景相似度。这种硬编码的相似度可能无法捕捉高层次语义差异,导致技能错配。同时,失败教训的利用方式(作为技能备注)较粗粒度,尚未探索更结构化的纠错或反思机制,在复杂动态环境中可能鲁棒性不足。
论文Haoyuan Li2026-06-05原文

相关内容