EmbodiedSkills: 一种用于编排、训练和部署VLA智能体的统一框架
视觉-语言-动作(VLA)模型将视觉观察和语言指令直接映射为机器人动作,但长时程任务不仅需要动作预测。智能体必须在物理状态演变中协调感知、规划、执行、进度验证与恢复。单独的动作预测或模型生成的技能决策,并不能保证提议的操作在当前状态下有效,也无法确保其结果会被验证。我们提出 EmbodiedSkills,一种统一框架,将每个技能决策视作一次执行提议:运行时在执行前检查其前置条件,并在执行后验证结果。一个共享的可执行技能接口将高级技能选择、受限的低层VLA执行与动作后验证连接在同一智能体循环内。由于该接口保持固定,低层VLA策略可在不改变智能体循环的情况下替换或调整。该接口还将规划、执行、验证与恢复事件记录为结构化轨迹,为各组件提供监督,并在交互反馈可用时支持可选的在线适应。 我们在 RoboTwin 2.0 与 LIBERO 上,以 Qwen3-VL 和 OpenPI/pi0.5 实例化 EmbodiedSkills。任务自适应的低层VLA策略在 50 个 RoboTwin 2.0 任务中平均成功率达 86.20%,在四个 LIBERO 测试套件上为 97.40%。这些结果确立了框架中任务自适应低层VLA策略的执行性能。在四个记忆依赖的 RMBench 任务上,相同的任务自适应执行方法平均成功率为 12.5%。该框架提供了一个可训练且可检视的智能体层,将这些策略转化为闭环具身系统。
论文精读
TL;DR EmbodiedSkills 提出统一框架,将技能决策视为需先验条件与事后验证的执行提案,以固定接口串联高层规划、低层 VLA 执行与恢复,使策略可替换且代理闭环可训练。
问题
问题背景
当前具身智能领域聚焦于 VLA 模型 在真实 / 仿真机器人上的直接控制,期望从视觉观察和语言指令端到端预测动作,并逐步向长时间跨度任务扩展。
现有方法局限
- 动作预测缺乏验证机制:主流 VLA 输出单步动作或高层技能决策,但不检查技能前置条件是否满足,也不验证执行后状态是否达到预期,导致错误逐步累积。
- 缺少结构化闭环与恢复:一旦执行失败,系统无法感知偏差并触发恢复,只能继续盲目执行或中断,物理状态演化下任务成功率大幅下降。
- 低层策略与高层规划耦合松散:更换底层 VLA 策略往往需要重新设计整个 agent 逻辑,接口不统一,难以模块化迭代或复用。
- 训练数据与部署不一致:离线训练时没有记录规划、执行、验证、恢复事件轨迹,无法为验证器和恢复策略提供有效监督信号。
为什么这个问题难且重要
长时任务中物理状态动态变化,低层 VLA 策略本身存在分布外不确定性和累积误差;需要将 感知—规划—执行—验证—恢复 整合为可训练的闭环系统。然而现有方法多为黑盒端到端,缺乏可检查的中间状态和固定接口,导致调试困难、部署风险高。业界对可复用、可解释、可在线适应的 embodied agent 架构需求迫切。
行业类比
类似 LLM 工具调用框架中,工具执行前需校验参数合法性、执行后需检查返回结果,否则盲目调用会引发级联错误。
核心洞察
- **将技能决策视为受运行时守卫的“执行提案”**。EmbodiedSkills 的核心创新在于引入固定的**可执行技能接口**,该接口强制在每次技能执行前检查前置条件、执行有界低层 VLA 行动,并在执行后验证结果。与直接输出动作的 VLA 模型或简单分层控制相比,这一机制把开环的动作预测转变成闭环的具身推理,能有效应对长程任务中物理状态变化导致的动作失效。该框架通过统一接口将感知、规划、验证与恢复耦合,使高层决策不仅产生意图,还确保意图在物理世界中得到执行与确认。
- **低层 VLA 策略与高层智能体循环的解耦**。EmbodiedSkills 通过固定接口使低层 VLA 策略可替换或任务适配,而不改变高层 agent loop。这意味着可以用领域微调(如 Qwen3-VL 选择技能、OpenPI/pi0.5 执行动作)提升特定任务成功率(RoboTwin 86.20%,LIBERO 97.40%),无需重新设计整体控制逻辑。同时,接口记录的结构化轨迹提供组件级监督,支持离线训练和可选的在线适应,降低了从单任务 VLA 策略迁移到通用具身系统的工程成本。
方法
输入与整体流程
输入为视觉观察、自然语言指令和当前环境状态。EmbodiedSkills 将其组织为单一 agent 循环:高层技能选择 → 低层 VLA 执行 → 后动作验证与恢复。整个流程通过共享的 可执行技能接口(executable-skill interface) 连接,该接口固定不变,因此低层 VLA 策略(如 OpenPI/pi0.5)可独立替换或适配,不影响上层循环。
关键模块
- 技能决策(Agent State and Skill Decision)
基于 Qwen3-VL 等 VLM,结合当前状态和历史轨迹,生成技能提案(execution proposal)。每个提案被视为待验证的操作,而非直接执行的命令。 - 可执行技能契约(Executable Skill Contract)与阶段结构化技能空间(Phase-Structured Skill Space)
技能被组织为precondition、execution、verification、recovery等阶段。运行时首先检查前置条件是否满足(guarded runtime transition);不满足则进入恢复或重新规划。 - 有界低层 VLA 执行(Bounded Action Execution)
低层策略只负责执行限定范围内的动作片段,由高层根据验证结果决定继续、停止或切换。 - 验证与恢复(Verification and Recovery)
执行后,通过视觉或状态检查判断技能是否达到预期结果;失败则记录失败原因,并触发恢复策略或重新规划。 - 结构化轨迹记录(Structured Trajectories)
所有规划、执行、验证、恢复事件均被记录为结构化数据,为各组件提供监督信号,并支持可选的在线闭环适应(如交互式反馈微调)。
输出
输出为闭环机器人动作序列以及可供训练或检查的结构化交互轨迹。
与同类方法的差异点:传统 VLA 或分层智能体通常只生成动作或技能决策,缺乏执行前条件检查与执行后结果验证的契约机制;EmbodiedSkills 将技能决策转变为可验证、可恢复的执行提案,并通过固定接口实现低层策略的热插拔与全链路审计。
实验
实验设计
实验在 RoboTwin 2.0(50 个任务)、LIBERO(四个套件)和 RMBench(四个记忆依赖任务)上验证框架完整性。低层 VLA 策略基于 Qwen3-VL 与 OpenPI/π0.5,进行任务适配微调。评估记录机器人任务成功率,并采集规划、执行、验证、恢复的全链路事件轨迹。
关键发现
- 任务适配后的低层 VLA 策略在 RoboTwin 2.0 上平均成功率达 86.20%,在 LIBERO 四个套件上达 97.40%,证明固定技能接口与执行前/后校验能有效支撑长程操作。
- 在 RMBench 记忆依赖任务上仅 12.5%,显示需要跨步骤记忆与状态推理的场景仍是明显瓶颈。
- 框架的结构化轨迹为组件级监督与可选在线适应提供数据,但论文未给出消融定量结果。
与基线对比
该工作未直接报告与外部基线模型的成功率对比,而是聚焦于任务适配后的低层 VLA 策略在闭环框架中的表现。与常规端到端 VLA 直接输出动作相比,EmbodiedSkills 将每次技能决策视为执行提案,通过前置条件检查与后置结果验证将开环控制转化为有保障的闭环执行。固定可执行技能接口允许替换低层策略而不改动智能体循环,同时支持在线适应,这区别于依赖单一模型微调或硬编码状态机的传统分层方法。
行业影响
落地场景
EmbodiedSkills 适合需要闭环验证的机器人操作平台,如电商仓库分拣、制造业装配、服务机器人。其核心创新是将技能决策作为“执行提案”,运行时检查前置条件并验证结果,显著优于直接输出动作的传统 VLA 策略。例如在电商退货处理中,上层 LLM 选择“抓取-放入料箱”技能,系统先验证抓取点遮挡与夹爪状态,执行后通过视觉确认物体已入箱,失败则触发恢复,减少人工介入。
商业价值
- 降本:前置条件检查与事后验证减少错误执行和人工重试,结构化轨迹降低组件微调的数据采集成本。
- 加速迭代:固定接口允许替换底层 VLA(如从 OpenVLA 换到 π0.5)而不改动 Agent Loop,缩短方案切换周期。
- 可靠性溢价:对于高价值任务(如医疗辅助、工业精密操作),可验证的闭环行为能够支撑 SLA 承诺。论文在 LIBERO 达 97.40% 成功率,可作为商务谈判的量化依据。
与现有 stack 集成
EmbodiedSkills 可作为智能体执行层嵌入现有机器人软件栈。高层任务编排(如 LLM 规划器、行为树)通过 execute_skill() 接口下发技能,运行时返回 precheck_failed / success / recovery 等状态,易于对接 ROS 2 action server 或云机器人平台。结构化轨迹可直接写入数据管道,支持离线训练和在线 RL 反馈循环。
局限
- **记忆依赖任务表现不足**:RMBench 平均成功率仅 12.5%,远低于 RoboTwin 2.0 的 86.20% 和 LIBERO 的 97.40%。这表明框架在需要跨步骤记忆和长期状态跟踪的任务上仍有明显瓶颈。虽然接口记录了结构化轨迹,但未显式建模外部记忆或长上下文状态聚合,高层技能选择与低层 VLA 执行难以有效维持长程依赖。未来可引入 memory-augmented 模块或分层记忆机制来提升此类任务表现。
- **任务适应的数据与反馈成本较高**:RoboTwin 2.0 和 LIBERO 上的高成功率建立在 task-adapted 低层 VLA 策略之上,需要收集部署一致的训练样本。对于真实机器人,样本采集成本高且耗时;在线适应依赖交互反馈,现实中反馈可能稀疏、延迟甚至缺失。论文未讨论冷启动场景下无样本时的策略初始化方法,限制了框架在快速部署新任务场景中的实用性。
- **验证与恢复机制的通用性未充分验证**:Guarded runtime transition 和 verification 依赖预设的可执行技能契约与相结构技能空间,如何自动构建、扩展或更新这些契约来处理开放环境中的未知物体、动态变化和异常状态,论文未涉及。实验集中在限定的操作任务,对接触丰富、非结构化或长周期物理交互场景的鲁棒性仍待检验。