带着意图行动: 蒸馏 Vision-Language-Action 模型的行为意图
Vision-Language-Action (VLA) 模型 可将多模态上下文转化为机器人动作,但其动作解码器仍主要依赖行为克隆训练,仅监督演示的电机指令,却忽略了行为在指令下服务的局部目标。现有未来条件监督虽引入帧、潜在观测、轨迹或运动表示,但仅捕捉可能发生的特定实现,而非共享的语义目标。 为此,我们提出 Intention Distillation (INDI),将行为级意图蒸馏至动作解码器。训练时,冻结的教师 VLM 解读由当前观察、指令、粗略动作摘要及对应执行视频组成的演示片段;部署的 VLA 则从标准输入在中间解码器层恢复该多模态意图表示,并用于组织动作预测,同时融合行为展开与实现结果的表征。 在 SimplerEnv-Bridge 上,INDI 将 GR00T-N1.7 成功率从 64.3% 提至 84.7%;在 RoboCasa Kitchen 上,从 64.1% 提至 70.3%,并对 π{0.5} 在两项基准均带来一致提升。真实世界任务中,平均成功率从 62.0% 升至 68.7%,较长时间跨度的任务提升达 12.0 个百分点。 进一步分析表明,恢复的潜在表示被解码器有效使用,捕获行为目标与执行进度,并以目标相关方式组织下游预测。实验证明,动作解码器受益于显式建模其生成行为的语义目标。
论文精读
TL;DR INDI 用冻结的 teacher VLM 从演示段蒸馏行为级意图到动作解码器,使 VLA 显式建模动作背后的语义目标,在仿真与真实机器人任务中显著提升成功率。
问题
VLA 模型 将多模态上下文映射为机器人动作,已成为机器人操作学习的重要范式,但动作解码器仍主要依赖 行为克隆 训练。
现有方法局限: 行为克隆只监督“演示了哪个电机指令”,对指令下行为所服务的局部目标保持隐式,模型难以区分相同动作序列背后的不同意图,容易过拟合演示的具体轨迹。未来监督(如未来帧、隐观测、轨迹、运动表征)虽补充了未来信息,但捕捉的是“可能发生什么”的特定实现而非共享语义目标;这些信号对轨迹变化敏感,无法提炼出可迁移的意图先验,导致跨场景泛化弱。
为什么难/重要: 机器人示范数据稀缺且昂贵,同一高层意图可以有多种运动实现,意图是抽象、多模态、非单一映射。从有限示范中恢复语义意图并注入动作解码器,需要跨模态对齐与可解耦表示,同时要避免未来信息泄漏目标的具体实现,才能提升长程任务泛化。业界正在从“模仿动作”转向“理解行为原因”,这直接影响 VLA 的样本效率与真实环境成功率。
行业类比: 类似自动驾驶中从驾驶示范学习“变道决策意图”,而不是模仿某次变道的具体方向盘转角序列,语义意图能显著提高对新道路场景的适应能力。
核心洞察
- 提出**意图蒸馏**(Intention Distillation)概念,将行为克隆从模仿动作提升到理解动作背后的语义目标。传统 VLA 行为克隆只监督演示动作,导致模型学到的可能是表面动作映射,而 INDI 利用冻结教师 VLM 从执行视频中提取意图表示,让动作解码器显式建模“为什么要做这个动作”。这种从动作到意图的监督信号转变,使模型能泛化到未见场景,在多个基准上显著提升成功率。
- INDI 的关键设计是在解码器中间层恢复意图表示,并与行为展开和结果表示协同组织预测,而非简单地将意图作为额外输入拼接到解码器。这种架构迫使解码器利用意图信息来条件化动作生成,避免了信息瓶颈或忽略意图。分析表明恢复的潜在表示被解码器实际使用,并捕获了行为目标和执行进度,证明意图蒸馏不仅提升性能,还让模型行为更可解释。
- 与常见的未来预测监督(预测下一帧、轨迹等)不同,INDI 蒸馏的是行为级别的语义意图,而不是具体的未来实现。未来预测容易过拟合到特定轨迹或环境细节,而意图表示捕捉跨场景共享的目标语义,因此在不同基准和真实世界任务中都表现出稳健增益(如 GR00T-N1.7 在 SimplerEnv-Bridge 从 64.3% 提升至 84.7%)。这为 VLA 训练提供了一种更高效、更泛化的监督信号。
方法
输入
- 当前机器人观测(图像 / 本体感知)
- 自然语言指令
- 粗粒度动作摘要(例如“将碗放入抽屉”)
- 训练阶段额外提供该段行为对应的执行视频
关键模块
- 意图教师:一个冻结的 VLM(视觉语言模型)接收上述全部输入(含执行视频),产出多模态意图表示
intent,编码该行为的语义目标——要完成什么、为什么这样做,而非具体轨迹。 - 意图恢复:部署的 VLA 在自身中间解码器层引入轻量投影头,仅从标准推理输入(无执行视频)预测出与 teacher 意图对齐的 latent;训练时用蒸馏损失约束该 latent 与
intent的距离。 - 意图感知解码:恢复的 intent 作为条件注入后续解码层,与表征“行为如何展开”(how it unfolds)和“最终达成什么”(what it achieves)的中间表示融合,共同指导动作 token 逐层生成。
输出
机器人动作序列(离散动作 token),可直接控制执行器。
差异点
与现有 future-based supervision(监督未来帧、潜观测或轨迹)相比,INDI 蒸馏的是这些具体实现背后共享的语义目标,因此对演示多样性更鲁棒,且教师模型无需在线推理。
实验
实验设计
INDI 在三个层面验证:仿真基准(SimplerEnv-Bridge、RoboCasa Kitchen)与真实世界任务,覆盖不同难度与地平线长度。基线模型包括 GR00T-N1.7 与 π0.5,其中 RoboCasa 使用 controlled baseline 以排除数据偏差。方法上,INDI 冻结教师 VLM 从观测、指令、粗动作摘要和执行视频中蒸馏行为意图,部署时从中间层恢复该意图表示并辅助动作解码。
关键发现
- 在 SimplerEnv-Bridge 上,INDI 将 GR00T-N1.7 成功率从 64.3% 提升至 84.7%(+20.4pp)。
- 在 RoboCasa Kitchen 上,提升从 64.1% 至 70.3%(+6.2pp),且对 π0.5 同样稳定增益。
- 真实世界平均成功率从 62.0% 升至 68.7%,长周期任务最高增益 12.0pp。
- 分析表明恢复的 latent 确实被解码器使用,编码了行为目标与执行进度,并按目标组织下游预测。
与基线对比的解读
相比 future-based supervision 只提供未来帧/轨迹的特定实现,INDI 显式建模行为背后的语义目标,因此对动作分布变化更鲁棒。在跨模型(GR00T-N1.7 与 π0.5)和跨环境(仿真到真实)的泛化性上表现一致,说明意图蒸馏不依赖特定架构。对工程实践的启示:在行为克隆中引入语义级意图监督,可低成本提升 VLA 的长期规划能力,且无需额外推理开销——教师仅在训练时使用,部署时从标准输入恢复意图,保持推理效率。
行业影响
落地场景
INDI 可直接用于服务机器人、工业机械臂、自动驾驶等依赖 VLA 模型的产品。例如:
- 电商仓储分拣机器人:在复杂指令下(如“将红色盒子放到左侧货架第三层”)提升动作成功率,减少误操作。
- 家庭服务机器人:对长程任务(如“整理桌面并倒垃圾”)保持行为意图一致,避免中途偏离目标。
这些场景中,机器人需要理解指令背后的语义目标而不仅是执行动作序列,INDI 的意图蒸馏恰好弥补该缺口。
商业价值
- 降本:提高成功率直接减少机器人试错和人工干预成本,长程任务 12 pp 的提升可显著降低运维支出。
- 增收:更高可靠性支撑机器人服务规模化,例如无人配送、自动清洁等按次付费模式。
- 体验提升:用户指令执行更准确,增强对机器人产品的信任,尤其在医疗辅助、教育陪伴等交互密集场景。
接口集成
INDI 可作为训练插件嵌入现有 VLA 流程:
- 训练时:引入冻结教师 VLM 为每个演示片段生成意图表示,在动作解码器中间层加入意图恢复损失(如 MSE 或 contrastive),无需修改推理架构。
- 推理时:部署模型仅从标准输入(观测、指令)恢复意图,不增加额外传感器或延迟。
- 兼容性:已与 GR00T-N1.7、π0.5 等主流 VLA 集成,对代码库改动小。
局限
- INDI 的训练依赖额外的执行视频和冻结的 teacher VLM 来生成意图目标,这增加了数据采集和标注成本。在真实世界大规模部署时,为每个新任务收集对应的执行视频可能不切实际,尤其是长周期或高动态场景。此外,teacher VLM 的推理开销在训练阶段不可忽视,限制了快速迭代和低成本实验。
- 论文在真实世界任务上的评估数量有限(平均成功率提升 6.7 pp),且仅在特定机器人平台和任务类型上验证,尚无证据表明其在跨形态机器人、复杂动态环境或未见任务上的泛化能力。teacher VLM 对行为目标的语义解释可能带有自身偏差,若教师模型在长周期任务或歧义指令上出现误读,该错误会通过蒸馏传递给学生模型。