Skill-3D:面向智能体3D空间推理的自演进场景感知技能
现有方法在处理3D场景时往往误用工具,并展现出有偏的工具偏好,使得智能体范式相比非智能体策略收益甚微。本文揭示,3D空间推理任务在不同场景下具有异质性,而现有智能体对所有场景采用统一的工具使用策略,而非根据具体场景和任务选择工具。 为解决此问题,本文提出Skill-3D框架,该框架学习自演进的场景感知技能。具体而言,Skill-3D识别任务场景,并将智能体的工具使用轨迹记录到Scene Memory中。来自相似场景的成功轨迹被聚合和蒸馏为可重用的场景感知技能,失败轨迹则作为教训附加到该技能中。在训练过程中,当类似场景再次出现时,注入相应技能以指导智能体,产生新的轨迹。这些轨迹的成功与失败进一步优化该技能,形成记忆与技能库共同演进的循环。 实验表明,Skill-3D显著提升了3D空间推理中的工具利用率(在VSI-Bench上从39%提升至78%),推动智能体向正确且充分的工具使用发展。例如,它在MMSI-Bench上将Gemini-3-Flash提升了67%。此外,我们在技能引导的轨迹上进行智能体后训练,使Qwen3-VL-8B在VSI-Bench上提升了43%。
论文精读
TL;DR Skill-3D 提出自进化场景感知技能,引导 MLLM 代理在 3D 空间推理中按场景选择工具,将工具利用率从 39% 提升到 78%。
问题
问题背景
基于多模态大语言模型(MLLM)的 agentic 3D 空间理解 正成为研究热点,即让 agent 通过调用视觉工具(如深度估计、分割、目标检测)对 3D 场景进行推理与问答。
现有方法局限
当前 agentic 方案普遍对所有 3D 场景施加统一的工具使用策略,忽略场景间的巨大差异。实验表明,这类 agent 经常误用工具或陷入工具偏好偏差(如过度依赖单一工具),导致实际收益甚微——在 VSI-Bench 上工具利用率仅 39%,agentic 范式相比无 agent 策略仅能取得微弱提升。根本原因在于现有方法未建立场景-工具的适应机制:3D 任务(如距离估计、空间关系判断、视角变换)在不同场景中所需工具组合截然不同,但 agent 缺乏根据场景动态调整工具链的能力。
技术挑战与重要性
3D 空间推理任务的异构性极高:室内/室外、稀疏/密集物体、不同几何结构等都要求不同的感知顺序和工具组合。让 agent 自主习得这种场景感知能力需要解决两个难题:
- 如何从离散的工具调用轨迹中提取可复用的成功模式,并记住失败教训;
- 如何在持续学习中积累技能,避免遗忘或灾难性干扰。 这类能力直接决定 agentic 系统能否在实际应用中(如机器人导航、AR 场景理解)真正超越端到端模型,业界对其可靠性和自适应能力高度关注。
行业类比
这类似自动驾驶系统根据天气和路况动态选择感知模块(如雨雾天启动去噪、夜间增强曝光),若 3D 推理 agent 始终保持固定工具链,就像用晴天模型处理暴雨场景,必然会频繁失效。
核心洞察
- 3D 空间推理任务的场景异质性远被低估,统一的工具调用策略会导致大量误用。Skill-3D 通过 Scene Memory 按场景相似度聚类轨迹,并从中蒸馏出 scene-aware skills,让 agent 在面对新场景时能自适应地选择“何时调用哪个工具”。这种从全局策略到场景感知策略的转变,直接解释了为何 agentic 范式的增益在过去微乎其微——因为忽略了任务-场景的耦合性,使工具利用从固定模式升级为动态推理。
- Skill-3D 构建了一个记忆与技能库共同演化的闭环:成功的轨迹被聚合并提炼为可复用技能,失败的轨迹作为“教训”附在技能上,指导 agent 避免相同的错误。这种自进化机制不同于传统的静态 few-shot 示例或一次性微调,它让模型在交互中持续从错误中学习,类似人类积累经验的过程。对于工程部署,这意味着一个随着使用不断变聪明的 agent,尤其适合需要长期运行、场景不断扩展的 3D 应用。
方法
输入
给定三维场景的多视图图像与文本任务指令,由 MLLM agent 自主调用预定义工具(如相机旋转、物体检测)进行空间推理。
关键模块
Skill-3D 的核心是将 agent 的工具使用轨迹转化为可演化的场景感知技能,包含三个阶段:
场景感知技能提取
- 对每个新场景,agent 先识别场景类型(布局、物体密度等),在执行任务时记录完整的工具调用序列。
- 成功的轨迹按场景相似性聚合,通过蒸馏(例如提取通用工具选择模式)形成一条可复用技能;失败的轨迹作为负例教训附加在技能上,标记为“应避免的操作”。
- 技能与对应场景索引共同存入 Scene Memory。
技能引导推理
- 遇到与记忆库中相似的新场景时,系统检索相关技能,将其转化为提示或约束注入 agent 的推理过程(如限制可用工具子集、建议顺序)。
- Agent 在引导下生成新轨迹,其成功/失败结果反馈给技能库,更新技能质量评分或微调蒸馏策略,形成“轨迹产生→记忆更新→技能进化”的闭环。
技能引导的 Agentic 后训练
- 利用技能引导产生的高质量轨迹数据(正确工具调用 + 场景特征)对 MLLM 进行强化学习(例如基于 GRPO 的奖励优化),让模型内化场景感知的工具使用策略。
- 后训练后的模型即使无技能注入,也能在非训练场景表现出更好的工具选择泛化性。
输出
Agent 生成最终空间推理答案,同时伴随更准确且充分的工具调用序列,在 VSI-Bench 上工具正确利用率从 39% 提升至 78%,对 Gemini-3-Flash 等模型改善显著。
与同类差异:不同于现有方法对所有场景采用统一工具策略(导致误用与偏好偏差),Skill-3D 利用自演化场景记忆与技能库,将场景异质性显式编码为可迁移的经验,驱动 agent 动态适应不同场景的工具需求。
实验
实验设计
Skill-3D 在两个具有代表性的 3D 空间推理基准上评估:VSI-Bench(聚焦工具使用质量)和 MMSI-Bench(多模态空间理解)。实验对比了统一工具策略的 Agent 基线,并引入场景感知技能库与自演化记忆机制。此外,通过收集技能引导的推理轨迹,对 MLLM(如 Qwen3-VL-8B)进行 agentic post-training,验证技能内化效果。
关键发现
- 在 VSI-Bench 上,工具利用率从 39% 跃升至 78%,证明场景感知技能显著减少工具误用和偏好偏差。
- 在 MMSI-Bench 上,Gemini-3-Flash 性能提升 67%,说明跨模型迁移的有效性。
- Post-training 让 Qwen3-VL-8B 在 VSI-Bench 上提升 43%,表明技能引导的轨迹可用于提升模型本身的空间推理能力。
与基线对比解读
传统 Agent 对所有场景采用同一工具调用策略,忽略了 3D 任务的场景异质性,导致工具选择次优。Skill-3D 通过相似场景记忆匹配动态注入技能,使 Agent 能借鉴历史成功经验,同时从失败中学习。这种记忆-技能协同演化的闭环,使工具调用更精准、更充分。与统一策略基线相比,Skill-3D 不仅在常用工具上减少误用,还能发现罕见但必要的工具组合。Post-training 进一步将外部技能转化为模型内在知识,避免了推理时对记忆库的过度依赖,提升了泛化性与推理效率。
行业影响
落地场景
Skill-3D 的核心能力是让 MLLM 代理在 3D 空间推理任务中自适应地选择工具,这直接作用于一系列需要空间感知的智能产品:
- 增强现实/虚拟现实(AR/VR):头戴设备中的空间锚点识别、虚实遮挡推理,代理可根据场景动态调用深度估计或 SLAM 工具。
- 自动驾驶与机器人:端到端的 3D 感知管线中,代理需融合激光雷达(LiDAR)、相机等传感器信息进行场景理解;Skill-3D 可帮助代理按需调度目标检测、占据网格预测(occupancy prediction)等工具。
- 智能家居/工业数字孪生:基于 RGB-D 的室内重建、物品搜索等,代理可利用场景记忆快速匹配相似环境,减少无效工具调用。
商业价值
- 降本:工具使用效率提升直接降低计算开销——从 VSI-Bench 上看,工具利用率从 39% 提升到 78%,意味着大量误用工具带来的算力浪费被消除;代理后训练(post-training)还能以较少数据使小模型(如 Qwen3-VL-8B)获得大幅增益(+43%),降低部署成本。
- 增收与体验提升:在 B 端产品(如 3D 内容创作平台、工业检测)中,准确的工具调用可提升自动化率,减少人工干预,加快生产节拍;在 C 端(如 AR 导航、智能拍照手机),更可靠的空间理解直接改善用户交互流畅度与功能可用性。
与现有产品/工作流的接口
Skill-3D 框架可轻量化集成进现有 MLLM Agent 栈:
- 场景记忆提取模块(
Scene Memory+skill library)可作为中间件部署在推理管道中,记录工具调用轨迹并在线蒸馏技能。 - 与现有 Agent 框架(LangChain、AutoGen 等)兼容:技能库可通过外部记忆插件形式注入,不修改基础 MLLM 结构。
- 代理后训练流程:利用 skill-guided trajectories 进行监督微调(SFT)或强化学习(如 GRPO),可与已有的模型微调流水线(如 LLaMA-Factory)无缝衔接。
具体落地 Use Case
- 电商 3D 商品展示与搜索:用户上传房间照片或视频,代理需理解空间尺寸并推荐家具摆放方案。Skill-3D 使代理根据场景类型(卧室、客厅)自选深度估计、物体检测、布局推理工具,避免对每一帧都调用全部昂贵模型,提升实时交互体验和推荐准确度。
- 教育领域的 AR 实验模拟:学生通过平板或 AR 眼镜观察虚拟物理实验装置,代理需解释组件之间的 3D 位置关系。Skill-3D 可记录典型课堂场景(如电路板、力学模型),当相似场景出现时快速匹配技能,显著减少工具调用延迟,使解释更流畅、准确。
局限
- **场景记忆的冷启动与数据依赖**:Skill-3D 需要积累足够的成功与失败轨迹来构建有效的技能库与场景记忆。在训练初期或面对全新场景时,可用的技能数量有限,可能导致引导效果不显著,性能退化到与无技能基线相近。虽然论文展示了跨 benchmark 的技能迁移(附录 B.2),但大规模部署仍需多样化且充分标注的 3D 场景数据,否则场景覆盖不足会使技能库泛化受限。
- **计算与存储开销**:技能提取需要从记忆库中聚类相似场景并蒸馏轨迹,推理时需检索并注入技能,自进化循环进一步增加了在线更新成本。附录 B.1 的效率分析可能表明延迟上升,但在实时 3D 推理或资源受限的设备上,频繁的记忆存取和技能匹配可能成为瓶颈,限制了其在实际工程中的可扩展性。
- **对预定义工具和场景相似度度量的依赖**:方法假设工具集固定,并通过预训练的 3D 特征(如点云编码器)或任务描述来计算场景相似度。这种硬编码的相似度可能无法捕捉高层次语义差异,导致技能错配。同时,失败教训的利用方式(作为技能备注)较粗粒度,尚未探索更结构化的纠错或反思机制,在复杂动态环境中可能鲁棒性不足。