InSight: 通过可操控 VLA 的自引导技能获取
视觉-语言-动作模型(VLA)能够从演示中学习操作技能,但其能力受限于训练数据中的技能范围。本文提出 InSight 框架,通过在原始动作层(如“将夹爪移至碗边”、“向上举”、“倒瓶子”)使 VLA 具备可操控性,从而解锁自主技能获取能力。 InSight 包含两个主要阶段:(1) 自动化分割管道:利用 VLM 计划分解 和末端执行器位姿将演示分割为带标签的原始动作,赋予 VLA 原始动作可操控性;(2) VLM 引导的数据飞轮:识别完成新任务所需的缺失原始动作,自主尝试演示(使用 VLM 提出的低级控制),并对成功演示自动标注、存储并集成到训练集中。 我们在仿真和真实机器人操作任务中评估 InSight,包括翻转积木、关闭抽屉、清扫、拧动和倒水,无需任何这些目标技能的人类演示。学习到的原始动作可组合执行新的长时任务,无需额外人类演示。结果表明,原始动作可操控性为 VLA 策略的持续技能获取提供了实用基础。
论文精读
TL;DR InSight 赋予 VLA 模型基础动作层面的可操控性,使其能自主识别技能缺口、自动生成演示并持续学习新技能,无需额外人工示教即可组合完成长程任务。
问题
问题背景
当前机器人操作领域正探索利用 视觉-语言-动作 (VLA) 模型从少量演示中习得泛化技能。VLA 通过联合建模视觉、语言指令和动作序列,展现跨任务迁移潜力,但其能力仍严重受限于训练数据中固有的技能集合。
现有方法局限
传统 VLA 训练范式假设所有目标技能都已在人类演示中覆盖,导致两大瓶颈:
- 技能扩展成本高:每次新增技能都需要收集全新演示数据集,并进行全量或部分微调,耗费大量人工标注与采集时间。
- 无自主新技能习得机制:模型无法主动识别任务执行中缺失的原子动作(如“倾倒瓶子”、“翻面方块”),更缺乏自主尝试并生成训练样本的能力。 一旦遇到未见的子技能,VLA 策略便束手无策,无法通过自我探索来填补能力空白。
为什么这个问题难/重要
让机器人自主习得新技能面临三重技术挑战:
- 原子动作粒度定义:如何将复杂演示自动分割为可组合、可重用的原语(primitive),并保持语义一致性?
- 缺失技能识别与生成:模型如何利用视觉-语言模型(VLM)理解任务计划,在发现能力缺口时提出新的低层控制序列并自主执行验证?
- 持续扩展闭环:如何构建一个数据飞轮,使机器人能在无人工干预下不断积累新原语,并与现有技能组合完成长周期任务? 这一能力对 持续学习 和 自主机器人 工业应用至关重要,它直接关系到机器人能否在动态环境下自我进化,大幅降低部署维护成本。
行业类比
这类似于 LLM 的工具调用与指令微调:基础模型先通过预训练获得通用能力,再通过指令和工具 API 自主扩展功能边界,无需为每个下游应用重新训练参数——机器人 VLA 同样需要可操纵的原子动作,作为其功能扩展的 API。
核心洞察
- **原语级可操控性** 将 VLA 的动作空间从完整轨迹降维到可复用的基元动作(如移动夹爪、倾倒)。通过 VLM 对示教进行自动分解和标注,使策略在推理阶段能接受语言指令精确切换子技能。这区别于多数对齐视觉-语言-行动的端到端方法——它们往往将新技能视为全新任务,必须依赖额外的人类示教,而 InSight 的操控性让已有示教中的运动模式被重新组合,大幅降低获取新技能所需的数据门槛。
- **VLM 引导的数据飞轮** 构建了“识别缺失原语 → 自主尝试演示 → 自动过滤成功样本 → 增量训练”的闭环。现有自监督探索或数据增强方法通常缺乏语义理解和任务级判断,容易产生无效尝试。InSight 借助 VLM 的任务规划能力定位技能缺口,并生成试探性低层控制指令,使机器人能够围绕高价值缺失技能高效采样,成功样本自动注入训练集,实现可持续的自主技能增长,而无需人工标注或重置环境。
方法
输入
InSight 的输入是少量人工演示(例如仅包含“拾取与放置”技能的演示)与一个未见过的新任务描述(如“翻转方块”)。
关键模块
系统分为两阶段:
自动原语分割与可操控 VLA 构建:
- 利用 VLM 规划分解将演示轨迹自动划分为带语义标签的动作原语(如“将夹爪移动到碗上方”“向上抬起”“倾倒瓶子”),并结合末端执行器位姿作为分割依据。
- 使用这些标注原语训练或微调 VLA 策略,使其能够按照原语指令进行操控(即实现原语级可操控性)。
VLM 引导的技能获取数据飞轮:
- 缺失原语识别:给定新任务,VLM 分析所需步骤,并与已有原语库对比,找出缺失的原语。
- 自主演示尝试:对每个缺失原语,VLM 提出底层级控制方案(如末端位姿增量、速度指令),由机器人自主执行,并利用 VLM 判断执行是否成功。
- 数据闭环:成功的尝试会被自动标注、存储并加入训练集,用于后续微调 VLA,从而持续扩充技能库。
输出
最终输出一个可操控原语的 VLA 策略,能组合已有原语执行长时域、从未见过的新任务,无需额外人类演示。
与同类方法的差异
与依赖预设技能库或人工定义原语的方案不同,InSight 通过 VLM 驱动的自动分割与自主数据收集,实现了从极少演示中自我扩展技能的能力,无需任何目标技能的人工演示。
实验
实验设计
InSight 在仿真和真实世界中验证其自主技能获取框架。任务涵盖 block flipping、drawer closing、sweeping、twisting、pouring 等,这些目标技能在初始训练数据中不存在,完全通过无人类演示的方式习得。实验分为两阶段:
- 阶段一:利用少量包含基础原语(如 pick-and-place)的人类演示,通过 VLM 规划分解与末端执行器位姿自动分割出带标签的 primitive,使 VLA 具备 primitive 级别的可操控性。
- 阶段二:给定一个需要新原语的新任务,VLM 分析任务计划并标记缺失的 primitive,然后 VLM 引导的数据飞轮自主生成低层控制尝试,自动评判成功与否并筛选可靠演示加入训练集,实现 continual skill acquisition。
仿真环境为自定义操作任务,真实世界使用 Franka 机器人。实验从仅包含 pick-and-place 原语的人类演示开始,逐步扩展技能库。
关键发现
- 技能可组合性:习得的原语可被灵活组合以执行从未见过的新颖长时域任务,无需额外人类示教。例如,学会“flip”后可与已有原语组合完成更复杂的操作序列。
- 自主数据生成质量:VLM 提议的低层控制方案虽非完美,但配合自动成功检测,能高效筛选出有效演示,形成正向飞轮,使 VLA 准确率随迭代提升。
- 真实世界泛化:在真实机器人上,InSight 从仅包含“scooping”的人类演示出发,成功自主学会了“sweeping”,证明了从仿真到真实的有效迁移。
与基线对比的解读
传统 VLA 或行为克隆方法的能力严格受限于人类演示中的技能分布,扩展新技能必须重新收集大量数据。InSight 首次将 primitive steerability 与 VLM-guided data flywheel 结合,实现了无需人工的自主技能扩展。相比固定原语库的 VLA,InSight 在开放世界的持续学习能力上具有明显优势,但生成的原语受限于 VLM 的规划与低层策略的可行性,未来可结合更强的闭环校验机制。
行业影响
落地场景:自主技能获取赋能机器人操作
InSight 的核心能力是让 VLA 模型在少量人类演示基础上,自主识别缺失的操作基元(primitive)、尝试生成演示并完成训练闭环。这直接适用于需要频繁更新操作技能的自动化场景:
- 仓储与物流:机械臂在商品拣选、打包、拆垛等任务中,经常会遇到新品类或新包装。InSight 允许机器人自动探索并掌握翻转、倾倒、扫取等基元,无需人工重新编程或采集大量演示。
- 柔性制造:小批量、多品类的装配线可借助 InSight 快速学习拧紧、插拔、按压等新型操作,降低换线成本。
- 服务机器人:在酒店、医院等环境中,机器人需要操作多样化的物品(开门、倒水、整理),基元级操控与自主获取机制使机器人能逐步扩展技能集。
商业价值:从“人工教”到“机器自学”的成本拐点
传统机器人操作技能获取依赖专家演示,每条新技能都需要数小时甚至数天的采集与标注,商业扩展性差。InSight 带来的商业优势体现在:
- 降本:自动分割与 VLM 引导的数据飞轮大幅减少对人类演示的需求。实验表明,仅需少量相关任务演示(如抓取放置)就能引导机器人自主习得翻转、关抽屉等新基元,减少专家参与,降低部署和运维成本。
- 增收:更快的技能扩展意味着机器人可以承接更多类型的任务,提升资产利用率。例如,仓库机器人能在淡季自主训练,旺季快速切换到新品类,提高吞吐量。
- 体验优化:服务机器人面对非预设物品时不再“卡壳”,能自主试探并习得操作方式,提升任务成功率和用户满意度。
与现有工作流的接口:轻量级嵌入机器人软件栈
InSight 设计上强调模块化,可集成到主流机器人开发流程中:
- 仿真先行:利用现有仿真平台(如 Isaac Sim、MuJoCo)批量运行 VLM 规划的低级控制策略,验证后迁至真实环境,降低物理试错风险。
- 与 VLA 框架结合:InSight 的分割与数据飞轮可作为 Octo、RT-2 等 VLA 模型的上游数据引擎,输出的带标签基元轨迹直接用于微调,无需改变 VLA 网络结构。
- ROS 2 集成:自动分割与基元库管理可作为 ROS 节点,对外提供“技能查询—尝试执行—结果标注—模型更新”的标准化服务,融入现有行为树规划或任务编排逻辑。
具体落地用例
- 电商仓库自动拣选:面对每天上新的不规则商品,机械臂利用 InSight 自主尝试并习得“旋转物体以找到平整面”“掀开包装盖”等基元,并结合已有基元组成新的长序任务,减少人工干预。
- 医疗辅助机器人:在康复训练中,机器人需要根据患者状态调整抓握力度或运动轨迹,InSight 允许机器人通过少量示范和自主探索学习个性化操作基元,提高辅助精准度。
局限
- **VLM 引导链路的可靠性瓶颈**: InSight 在技能发现与执行阶段严重依赖 VLM 的规划与低层控制指令质量。若 VLM 对任务分解错误或生成不可行的末端执行器位姿,数据飞轮将产生无效演示并可能污染训练集。论文虽引入 oracle 检查机制,但在真实开放场景中完全自动化的错误检测与恢复仍十分困难,尤其当任务涉及精密接触或动态约束时(如 pouring),VLM 的空间推理精度可能不足以稳定完成任务。
- **Primitive 分割的泛化风险**: 自动分割流水线基于 VLM 计划分解与末端执行器位姿聚类,假设同一 primitive 的运动模式具有一致性。当演示轨迹包含复杂过渡或动作边界模糊时,分割易出错,从而影响下游 steerability 的精确控制。对于未在训练数据中出现的全新物体或场景,分割质量可能明显下降,需大量工程适配,限制了 skill acquisition 的即插即用性。
- **学得技能的组合性局限**: 所获技能仍限定在预定义的 primitive 空间内,无法自发涌现更高阶的抽象行为。对于需要长期推理、多层次分解的任务(如先搜索再操作),当前依赖 VLM 一步规划的方式难以应对,且 VLA 策略本身不具备在线重规划能力。此外,飞轮仅收集成功的原始演示,未利用失败尝试进行对比学习,样本效率与技能边界探索存在提升空间。