Video2Skill: 从流式经验到可复用的具身技能
具身智能体 在不同物体与场景中的操作行为差异极大,但往往共享一小组可复用技能,用这些技能做规划能帮助智能体泛化到新任务。然而,智能体只能使用自己已知的技能进行规划。从观测经验中恢复技能——规划的反向过程——可以随时间积累这类知识,并为训练未来的智能体提供技能数据。VLM 能很好地描述单个操作事件,但它们能否把一串事件组织成可复用的技能?作者将这一问题形式化为 Streaming Embodied Skill Discovery (SESD):模型按顺序观看视频,并维护一个持续演化的技能库,以此影响其后续决策。 为系统衡量该能力,论文提出 Video2Skill 基准,覆盖机器人桌面操作与人类厨房活动,考察三项核心能力: - 在时间上定位操作事件; - 把属于同一变换的事件分组; - 判断何时复用已有技能、何时新建技能。 在 19 个开源 VLM 上,许多模型的分组水平接近随机,规模扩大也未必带来稳定提升。错误模式取决于感知与技能库更新如何耦合:联合模型 会把不同变换合并为同一技能,而依据文本描述更新技能库的模型则会重复生成已有技能。 监督微调(包括作者提出的 counterfactual library-state rebalancing (CLaRe))能改善分组,却暴露出更深的瓶颈:训练后的模型会巩固熟悉的技能,却很少扩展技能库,其技能库规模不足参考规模的一半;训练中未见的变换虽能被定位,却几乎不会被赋予新技能。因此,判断已有技能何时不足 成为核心挑战。
论文精读
TL;DR Video2Skill 基准揭示当前 VLM 在流式具身技能发现中的关键瓶颈:能定位操作事件,但分组技能接近随机,且难以判断何时该创建新技能,为构建可复用技能库提供系统评测与改进方向。
问题
问题背景
具身智能体执行长程操作任务时,依赖 技能库 (skill library) 进行规划,但技能库通常需要人工定义或从静态数据中离线提取。从观测经验中逆向恢复可复用技能,即流式具身技能发现 (Streaming Embodied Skill Discovery, SESD),成为让智能体持续积累知识、扩展能力的关键路径。Video2Skill 基准将这一问题形式化为模型在线观看视频流并维护持久技能库的任务。
现有方法局限
当前 VLM 虽然能描述单个操作事件,但在组织事件流时存在系统性缺陷:
- 分组接近随机:在 19 个开源 VLM 上,事件分组能力接近随机水平,且模型规模增大并不持续带来提升。
- 感知与库更新耦合错误:联合更新库的模型倾向于把不同变换合并为同一技能;仅从文本描述更新库的模型则会为重复出现的事件创建冗余技能。
- 监督微调瓶颈:即使使用CLaRe 等反事实库状态重平衡策略,模型也主要巩固训练中见过的技能,库大小停滞在参考尺寸一半以下;对新变换能准确定位时间但几乎不会分配新技能。
这些局限直接导致实际部署时,智能体无法将新观测转化为可复用技能,造成规划空间缺失和重复学习。
为什么难/重要
SESD 要求模型同时具备时序事件定位、跨实例概念抽象和增量库存维护三项能力,且必须在流式输入下持续做出“重用现有技能还是创建新技能”的在线决策。一旦误判,要么破坏技能区分度,要么造成库冗余。该能力直接影响机器人从非结构化经验中自动构建技能数据、降低人工标注成本的可行性,是具身智能走向开放世界需要解决的核心瓶颈之一。
行业类比
类似推荐系统中的在线意图聚类:系统从用户行为流中实时提取可复用的兴趣标签,必须在不重复、不合并的前提下动态扩增标签库,而新类目发现不足会导致长期冷启动和推荐同质化。
核心洞察
- 流式技能发现要求模型在持续输入中维护与更新技能库,而不是对单个视频片段进行独立描述,因此“何时创建新技能”与“何时复用现有技能”成为核心决策点。相比传统视频理解或单步操作识别基准,Video2Skill 显式建模了库状态对后续决策的影响,揭示了现有 VLM 在长期流式场景下的系统性失败。
- 模型错误模式取决于感知与库更新的耦合方式:端到端联合模型倾向合并不同变换为一个技能,而基于文本描述更新库的模型则重复创建相同技能。这表明不同架构引入了不同的归纳偏差,且这种偏差无法仅靠模型规模消除,因为 19 个开源 VLM 中分组能力接近随机。这一发现提示研究者需要从信息流和决策时序角度重新设计流式技能学习机制。
- 监督微调及反事实库状态重平衡(CLaRe) 改善了分组,但库扩展停滞:训练模型只巩固熟悉技能,对未见变换几乎从不分配新技能。这暴露出“识别技能不足”是一个独立于分组能力的瓶颈,可能需要在训练中显式建模新颖性检测或不确定性,否则模型无法主动扩展技能库以应对新任务。
方法
方法概览
输入 为连续视频流,模型顺序观看操作事件,并维护一个持久化技能库(skill library)。任务定义为 Streaming Embodied Skill Discovery (SESD),要求模型在每个时间步输出三项决策:事件时间边界定位、事件与现有技能的相似度分组、以及是否将事件作为新技能加入库或归入已有技能。
关键模块
- 事件感知与定位:基于 VLM 对视频帧进行编码,识别操作事件的起止时间。
- 技能表示与匹配:将事件转换为技能描述或嵌入,与库中已有技能计算相似度,用于分组。
- 库更新决策:根据相似度阈值决定复用或新建技能;该模块是 SESD 的核心难点。
训练策略
- 直接评估 19 个开源 VLM,发现分组能力接近随机,且模型规模不解决此问题。
- 提出监督微调方案,并设计 CLaRe(Counterfactual Library-state Rebalancing):在训练时构造反事实的库状态(例如故意移除库中本应存在的技能或加入干扰技能),生成平衡的正负样本,强制模型学会“当库中已有相似技能时输出复用,否则输出新建”。
- 微调后模型在分组准确率上提升,但库规模停滞于参考库的一半以下:训练中未见过的变换能被定位,却几乎从不触发新技能创建。
输出
输出为随时间演化的技能库,以及每个事件的技能归属标签。
与离线聚类或一次性技能发现不同,SESD 强调在线流式维护和决策与库状态的耦合;CLaRe 显式操纵库状态以缓解“复用偏好”偏差,但结果显示现有模型在“识别已有技能不足”的能力上仍存在根本瓶颈。
实验
实验设计
Video2Skill 基准覆盖机器人桌面操作与人类厨房活动,测试三项核心能力:时间定位、事件分组、技能复用/新建决策。评估 19 个开源 VLM;并采用监督微调,包括 CLaRe 反事实库状态重平衡。
关键发现
- 许多模型分组表现接近随机水平,扩大模型规模并不持续带来改善。
- 错误模式与架构耦合方式相关:联合模型倾向合并不同变换,文本更新模型则重复已有技能。
- 监督微调改善分组,但技能库停滞在参考大小的一半以下;训练未见变换能被时间定位却极少触发新技能。
基线对比解读
传统 VLM 评测只关注单事件描述能力,Video2Skill 强调增量库维护,暴露出“识别现有技能不足”这一核心瓶颈。联合模型与文本更新模型的对比说明感知与库更新耦合方式决定失败类型;CLaRe 提升分组但未解决库扩展,需重新设计以库增长为导向的指标与训练目标。
行业影响
落地场景
Video2Skill 可嵌入机器人数据平台与视频理解产品。例如电商仓库的机器人操作日志流,实时解析抓取、放置事件,自动构建可复用技能库;内容平台从烹饪 / DIY 视频中提取并分组变换步骤,生成结构化教程图谱;企业服务中分析员工操作录屏,识别标准作业流程(SOP)技能。
商业价值
主要降本增效:减少机器人技能编程与人工标注成本;提高技能复用率,加速新任务部署;视频内容结构化提升搜索、推荐与生成质量。长期支撑通用 embodied AI 的预训练数据生产与持续学习闭环。
与现有工作流接口
可作为 VLM 后处理模块接入现有视频分析或机器人数据管道:
- 输入流式视频帧,输出事件时间戳与技能 ID
- 维护持久化
skill library,提供查询与版本管理 API - 使用 CLaRe 微调开源 VLM,与 ROS、云视频存储集成
关键瓶颈:识别“现有技能不足”是模型主要短板,工业部署需人工校验新技能创建。
具体 use case:
- 电商履约中心:机器人从历史抓取视频中学习不同物体变换,自动生成抓取/放置技能库,减少重新编程。
- 内容平台:从烹饪视频流中提取“切菜”“搅拌”等技能,用于自动生成分步教程或短视频模板。
局限
- **监督微调后模型仍无法有效扩展技能库**,论文明确指出:经过微调(包括 CLaRe)的模型虽然巩固了训练中见过的技能,但在面对新变换时几乎从不创建新技能,库大小停滞在参考库的一半以下。这表明当前方法在开放世界技能发现上存在根本瓶颈,模型缺乏识别“已有技能不足”的能力,这被作者视为核心挑战。这意味着实际部署中,机器人无法自主积累新技能,限制了其长期适应性和泛化能力。
- **基准场景覆盖有限,评估可能低估或高估真实能力**。Video2Skill 仅覆盖机器人桌面操作和人类厨房活动两个领域,视频数量和变换类型有限,可能无法全面反映现实世界的多样性。此外,评估仅使用 19 个开源 VLM,未包含闭源商业模型或参数量更大的模型(如 GPT-4V、Gemini 等),因此“规模不总是有帮助”的结论可能不适用于所有模型架构或更大规模训练。同类的技能发现工作通常关注静态数据集,而流式设置的动态特性可能未被完全捕捉。
- **CLaRe 方法主要解决库状态不平衡,未触及开放世界识别的本质**。CLaRe 通过反事实重平衡提升分组性能,但它依赖于已标注的参考技能库和训练数据,无法在新技能出现时自主判断是否需要扩展库。与最近的持续学习或开放词汇检测方法相比,该工作缺乏记忆机制或不确定性建模,导致模型在面对分布外变换时倾向于保守归类到已有技能,而非创建新技能。这限制了其在真实流式环境中的实用性。