InternVLA-A1.5:统一理解、潜在前瞻与动作以实现组合泛化
针对机器人操作统一模型,现有方法试图将预训练 VLM 的语义先验与通过未来预测学习的物理动力学结合,但实际设计往往侵蚀预训练骨干的语义、遭受异构目标间的干扰,并在像素空间从零学习未来预测,未能利用预训练视频生成模型的动力学先验。 本文提出 InternVLA-A1.5,在原生 VLM 骨干上持续训练 VQA 和子任务预测,并附加轻量统一专家用于连续动作生成。未来预测被重构为 潜在查询问题,通过一组可学习的 foresight tokens 在冻结的预训练视频生成模型监督下,将任务相关未来压缩为紧凑潜在代码,从而继承世界模型动力学先验,无需学习像素级生成。推理时丢弃视频分支,保证实时控制。 在 120 万机器人片段和 300 万多模态样本上预训练,InternVLA-A1.5 在全部六个仿真基准上取得最优综合结果。真实世界中,保留的语义在保留指令绑定的组合泛化上表现最强,而两种设计共同支持长期执行。
论文精读
TL;DR InternVLA-A1.5 通过可学习的 foresight tokens 在冻结视频模型监督下蒸馏世界动力学先验,将 VLM 语义理解、潜空间未来预测与动作生成统一,实现实时组合泛化与长程操作。
问题
问题背景
机器人操作策略正从单一任务向通用统一模型演进,目标是让单个策略同时具备语义理解(来自预训练 VLM)和物理动态预测能力,以实现跨任务、跨场景的泛化。
现有方法局限
现有统一模型存在三个关键瓶颈:
- 语义侵蚀:将预训练 VLM 作为 backbone 直接用于机器人策略时,其原有的视觉语言对齐能力会在微调中迅速退化,导致无法可靠理解复杂指令。
- 目标冲突:在同一个网络中同时学习动作生成和未来帧预测,两类异构损失函数会产生梯度干扰,限制各自性能上限。
- 动态先验浪费:未来预测通常从零开始在像素空间训练,完全忽略了预训练视频生成模型中已蕴含的丰富物理世界动态知识,导致采样效率低、长程预测不稳定。
为什么这个问题难且重要
挑战在于:如何在引入物理动态建模时不破坏 VLM 的语义完整性,并将未来预测从昂贵的像素重建转化为紧凑的隐空间推理。业界高度关注这一问题,因为它直接决定了组合泛化(compositional generalization)——能否将已知对象和动作重组到未见过的指令组合中,这是机器人进入开放环境的前提。
行业类比
类似编程辅助工具中的代码补全与代码运行预测需要同时保持语言模型理解和执行环境的物理约束,机器人策略需在语义与物理动态间取得平衡。
核心洞察
- **语义保持是组合泛化的前提**:InternVLA-A1.5 将策略直接构建在原生 VLM 基座上,并未冻结或剥离其语言理解能力,而是在训练中持续进行 VQA 和子任务预测。这与主流方法(如 RT-2、Octo)中 VLM 仅作为特征提取器、语义在微调中被严重侵蚀的做法形成对比。作者证明,保持 VLM 的语义先验使得模型在真实世界中对全新指令绑定(held-out instruction bindings)表现出最强的组合泛化能力,避免了因语义遗忘导致的鲁棒性崩塌。
- **通过潜在查询蒸馏视频生成模型的动力学先验**:传统方法往往从头学习像素空间的未来预测(如 UniPi、Susie),计算昂贵且难收敛。本文提出将未来预测转化为潜在空间查询问题:仅需少量可学习的 foresight tokens,在冻结的预训练视频生成模型监督下,将任务相关未来压缩为紧凑潜在码。这相当于免费继承了大规模视频模型中的世界动力学先验,而无需实际生成像素,推理时视频分支直接丢弃,既加速了训练又保持了实时控制。实验表明,这种设计在长时序任务中显著提升了执行连贯性。
方法
整体架构:VLM 骨干 + 统一专家 + 潜在预见查询
InternVLA-A1.5 以原生 VLM(Vision-Language Model) 作为策略骨干,持续在多模态语言任务(VQA、子任务预测)上训练,从而保留语义先验,避免常见设计中因引入动作监督而侵蚀预训练知识的问题。在骨干之上,附加了一个轻量级统一专家(Lightweight Unified Expert),专门负责连续动作生成,将异构目标解耦,防止视觉-语言理解与动作控制之间的梯度干扰。
输入与输出
- 输入:语言指令 + 机器人视角图像序列(或单帧)。
- 输出:连续动作命令(如末端执行器位姿),同时可输出子任务推理结果。
关键模块:潜在预见推理(Latent Foresight Reasoning)
传统方法通常在像素空间从零学习未来预测,忽略了预训练视频生成模型中的丰富动态先验。InternVLA-A1.5 将未来预测重新定义为潜在查询问题:
- 引入一组可学习的 预见令牌(Foresight Tokens),通过交叉注意力与历史观测交互,在冻结的预训练视频生成模型监督下,将任务相关的未来状态压缩为紧凑的潜在编码。
- 该监督信号来自视频模型的潜在空间(而非像素重建),使策略直接继承世界模型的物理动态先验,无需学习生成像素,大幅降低训练负担。
- 推理阶段丢弃视频分支,仅使用预见令牌压缩的潜在特征作为额外上下文,不影响实时控制效率。
注意力掩码设计
为防止未来信息泄露,训练时采用特定注意力掩码:预见令牌只能关注当前及过去的视觉标记,不能访问真实未来帧;动作生成则同时利用历史和预见特征,保证因果性。
与同类方法的差异
相比现有统一操作模型(如 RT-2、Octo 等),InternVLA-A1.5 不牺牲 VLM 语义能力,并用冻结视频模型的潜在世界模型先验替代端到端像素预测,以更少的计算和参数实现更强的长程任务执行与组合泛化。
实验
实验设计
InternVLA-A1.5 在真实世界任务与六个仿真基准上进行评估。真实世界测试聚焦组合泛化:模型需处理未见过的指令–物体绑定,检验语义保留程度。仿真基准覆盖多种操控场景,以成功率等指标对比。消融实验系统剥离VLM 持续训练、潜在预测及统一专家等组件。训练效率分析验证推理时舍弃视频分支后的实时性。
关键发现
- 语义保留带来最强组合泛化:保持 VLM 骨干在 VQA 与子任务预测上的训练,避免语义退化,使模型在真实世界 held-out 指令绑定上取得领先。
- 潜在预测继承世界模型先验:通过少量可学foresight tokens 将任务相关未来凝练为压缩编码,在冻结的预训练视频生成模型监督下,无像素生成即可注入动力学先验。
- 统一专家解耦异构目标:轻量级统一专家负责连续动作生成,而 VLM 骨干专注语义与未来推理,大幅减少目标干扰。
与基线对比解读
以往方法直接在像素空间从零学未来预测,既忽略预训练视频生成器的丰富动力学先验,又因多目标联合训练侵蚀预训练骨干的语义。InternVLA-A1.5 将未来预测重塑为潜在查询问题,借助 frozen video model 给定世界模型先验,且训练效率更高。消融表明,去掉 VQA/子任务预测或替换为像素级未来预测均导致语义下滑与长期执行失败。这表明解耦语义、潜在未来与动作生成的设计范式在组合泛化与长时程操控上具有实质优势。
行业影响
落地场景
InternVLA-A1.5 为机器人操作提供了语义理解与物理动作的统一框架,可直接赋能三类产品:
- 仓储与物流机器人:在电商分拣、包裹打包等场景中,机器人需根据语言指令(如“把红色杯子放入纸箱”)执行组合动作,模型能保持 VLM 的语义泛化,适应多样化商品与变动指令。
- 家庭服务机器人:面对非结构化家庭环境,模型通过 潜式未来预测 继承世界模型先验,支撑长序列任务(如“从抽屉取出盘子并放到桌子”),无需依赖昂贵像素生成,保持实时控制。
- 工业柔性产线:小批量、多品种的装配任务要求快速指令切换,模型的多模态协同训练使其能从少量示范中迁移技能,降低重新编程成本。
商业价值
该模型从降本和增效两条线创造价值:
- 降本:使用冻结的预训练视频生成模型提供动力学监督,避免从头学习像素级预测,训练计算开销远低于传统世界模型方法。轻量统一专家头仅增加 <5% 参数量,推理时可丢弃视频分支,控制延迟维持在实时水平,利于边缘部署。
- 增效:在 6 项仿真基准上综合最优,实机测试中对 held-out 指令组合 表现最强泛化,直接减少为新任务采集数据的成本。对长周期任务的稳定执行提升机器人单次部署的连续作业时间,提高产出效率。
与现有产品/工作流的接口
该模型可作为 即插即用的智能体策略 集成进 ROS 2 等机器人中间件栈:
- 输入:相机流 + 自然语言指令,与现有视觉感知管道(如 YOLO、Segment Anything)兼容,无需定制传感器。
- 输出:末端执行器位姿或关节目标,可通过标准动作接口对接运动规划器(如 MoveIt 2)。
- 训练管线:支持在已有 VLM 基础上微调,企业可复用内部机器人数据与通用多模态数据,采用论文公开的
1.2M 机器人轨迹 + 3M 多模态样本混合配比策略快速适配新场景。
具体用例:
- 电商履约中心:机器人需执行“将蓝色罐子从料箱转移到流水线”等开放词汇指令。InternVLA-A1.5 原生保留的 VLM 能力可理解未见过商品的颜色-形状绑定,无需频繁重训,显著降低 WMS 系统变更时的自动化切换成本。
- 医院物资配送:移动机器人按护士语音指令(如“去 3 号病房送药,并带回空瓶”)执行多阶段任务。模型通过潜式远见 token 维持长序列动作一致性,避免任务中断,提升医护流程自动化水平。
局限
- **对预训练视频生成模型的强依赖**:方法使用冻结的预训练视频生成模型提供动态先验监督,训练成本高且受限于该模型的适用范围与偏差。若目标环境与视频模型训练数据分布差异大,潜在预测的准确性可能下降,难以泛化到未见动力学。此外,视频生成模型本身可能存在物理不一致性,将其作为世界模型先验会引入错误。该方法预先假定未来视觉状态可由紧凑潜在码浓缩,但某些精细操作(如柔体变形)可能无法充分表示。
- **潜在表示的细粒度信息损失**:将未来预测转化为潜在空间中的紧凑码,虽然计算高效,但可能丢失像素级细节(如物体微小位移、接触力等)。对于要求高精度物理交互的任务(如精密装配、手术机器人),仅靠潜在动态先验可能不足以生成精确动作序列。监督信号来自冻结视频模型的潜在空间,而非原始像素,可能导致策略无法感知关键的局部视觉变化。
- **真实场景覆盖与长时程执行稳定性**:论文在真实世界中仅展示了几个选定任务的组合泛化能力,实验规模有限。长时程执行中,尽管语义保持和潜在预测设计有助于减少失误,但未明确讨论累积误差的恢复机制。当遇到超出训练分布的新物体组合或指令时,策略的鲁棒性仍不明确。此外,统一模型训练涉及多模态数据和机器人数据的复杂混合,平衡VQA、子任务预测和动作生成等目标可能导致某一能力欠拟合,尤其在数据量不足时。