论文

SimpleMemVLA: 一种简单但有效的原生视频记忆,面向 Vision-Language-Action 模型

SimpleMemVLA: 一种简单但有效的原生视频记忆,面向 Vision-Language-Action 模型

长时程操作 具有部分可观测性:选择下一个动作所需的信息,可能只出现在数分钟前的观测中。现有记忆机制——检索库、学习式压缩器、循环状态——必须在尚不知道未来决策需要什么的情况下,就先决定从过去保留哪些内容。这一设计源于「分钟级历史过大、无法直接处理」的假设,而现代 VLM 主干已让该假设不再成立。 SimpleMemVLA 是一个不设专用记忆模块的 VLA。它保持采样历史完整,并以主干预训练时所用的 带时间戳视频 (timestamped video) 格式直接送入主干;生成子任务的 隐状态 则成为从历史流向标准 flow-matching 动作头的唯一通道。 由于连续决策共享大部分历史,在执行动作时对共享前缀进行预填充,可将延迟保持在接近单帧 VLA 的水平。 SimpleMemVLA 在四个记忆基准上取得新的 SOTA,且不牺牲通用控制性能。在固定主干与训练设置的情况下,它大幅优于检索、压缩与循环状态机制,因果干预实验也证实策略确实在读取其历史。代码见 https://github.com/wadeKeith/SimpleMemVLA。

论文精读

TL;DR SimpleMemVLA 摒弃专用记忆模块,把完整时间戳视频历史直接喂给预训练 VLM 骨干,用隐藏状态驱动 flow-matching 动作头,在多个记忆基准上刷新 SOTA 且不牺牲通用控制性能。

问题

问题背景

长程操作(long-horizon manipulation)在机器人学习领域愈发受到关注,核心难点在于环境的部分可观测性:做出当前动作所需的关键信息,可能只出现在数分钟前的观测中。因此,VLA 模型必须具备跨长时间窗口的记忆能力。

现有方法局限

当前主流记忆机制可分为三类,各自存在结构性缺陷:

  • 检索库(retrieval banks)依赖相似度匹配选取历史帧,容易忽略时序上下文和低频但关键的视觉线索;
  • 学习压缩器(learned compressors)将历史压缩为固定向量,信息瓶颈导致细粒度细节不可逆丢失;
  • 循环状态(recurrent states)受限于隐状态容量,难以精确回溯远距离依赖,且梯度传播困难。

更根本的问题在于:这些机制都基于“分钟级历史太大、无法直接处理”的假设,必须在知道未来决策需要什么之前决定保留哪些信息。但随着现代 VLM 骨干(如视频 Transformer)上下文窗口和计算效率提升,这一假设已不再成立。

为什么这个问题难/重要

长程操作对延迟和算力高度敏感,直接输入完整历史会带来巨大计算开销;但任何形式的压缩或筛选都可能破坏决策所需的时序信息。如何在保留完整历史的同时实现实时推理,是工程上的核心矛盾。业界对此高度关注,因为机器人操作、自动驾驶、远程操控等场景均需要可靠的长时记忆,而现有方法在标准记忆基准上性能提升有限。

行业类比

类似视频问答任务:让模型直接观看完整原始视频片段,而不是依赖预先生成的摘要或关键帧,往往能正确回答需要跨帧因果推理的问题——SimpleMemVLA 正是将这一思路迁移到机器人动作生成上。

核心洞察

  • SimpleMemVLA 的核心洞察是:现代 VLM 骨干已经具备直接处理分钟级视频历史的能力,因此无需预先设计记忆压缩或检索模块。与依赖检索库、学习式压缩器或循环状态的方法不同,本文保留原始采样历史,以带时间戳的视频格式直接输入预训练 VLM,让模型在解码动作时自行决定关注哪些历史帧。这一做法消除了“先决定保留什么、后决定需要什么”的信息瓶颈,在四个记忆基准上显著超越专用记忆机制,同时保持通用控制性能不降。
  • 流式推理中通过共享前缀 prefill 与滑动窗口注意力,将决策延迟压至接近单帧 VLA 是另一个关键工程贡献。由于连续决策之间历史高度重叠,推理时缓存已计算的视频前缀 hidden states,仅在执行动作期间增量 prefill 新帧,避免每次决策重算整段历史。此外,只对 softmax 层应用滑动窗口、保留绝对时间戳,能够在固定 KV cache 成本下处理任意长历史。这种设计让“不压缩直接读历史”在部署层面真正可行,而非仅停留在理论正确。
  • 因果干预实验证明 SimpleMemVLA 并非把历史当作无关背景,而是真正利用历史信息做出动作决策。通过抹除或扰动历史帧并观察动作变化,验证了策略对历史上下文的因果依赖,并发现模型具备涌现的视觉上下文学习能力。这回应了对“直接喂历史可能只是增加计算而没有实际用途”的质疑,也为记忆机制评估提供了一个可操作的归因检验手段。

方法

输入与表示

SimpleMemVLA 的输入为历史观测序列(多帧图像),不做任何压缩或筛选,而是保留完整采样历史,并编码为带时间戳的视频格式。这一格式与预训练 VLM 骨干原本的输入分布一致,使得模型可以直接利用视频理解能力,无需额外适配。

关键模块与信息流

  • VLM 骨干:采用预训练的视觉-语言模型直接处理时间戳视频,输出每个时间步的隐藏状态。骨干不做结构改动,仅通过微调适应机器人控制任务。
  • 子任务隐藏状态通道:模型在视频序列上生成一个子任务 token(sub-task token),该 token 的隐藏状态汇总了整段历史的上下文信息。这条隐藏状态路径是历史信息流向动作头部的唯一通道,没有单独的检索库、压缩器或循环记忆模块。
  • Flow-matching 动作头:以子任务隐藏状态为条件,通过 flow-matching(一类生成式建模方法)生成动作序列。动作头是标准的、与具体任务无关的预测模块。

推理与训练效率

连续决策之间共享大部分历史观测。推理时,系统在动作执行期间预填充共享前缀(即相邻决策重复的历史部分),仅对新出现的少数帧进行计算,使得每步决策的延迟接近单帧 VLA。训练阶段同样利用这一共享结构进行高效打包,无需为长历史付出完整序列的注意力成本。

与同类方法的差异

与显式记忆机制(如检索历史片段、学习压缩表示、维护循环状态)不同,SimpleMemVLA 不引入任何形式的记忆模块,而是让 VLM 骨干直接阅读完整的历史视频,并通过子任务隐藏状态隐式地传递记忆信息,从而在多个记忆基准上获得更优性能且不牺牲通用控制能力。

实验

实验设计

SimpleMemVLA 在多个基准上验证,包括 RoboMME 与 LIBERO-Plus 等 memory benchmarks,以及通用控制任务。对比对象为 retrieval、compression、recurrent 三类 memory mechanism,固定 backbone 与训练配置。

关键发现

  • 在 4 个 memory benchmarks 上达到 state of the art,且不损失 general-purpose control 性能。
  • causal interventions 显示策略 确实读取历史,而非忽略。
  • 共享前缀预填充使 streaming inference 延迟接近单帧 VLA。

与基线对比解读

传统 memory 机制面临两难:在知道未来决策需求前就必须压缩/丢弃信息。SimpleMemVLA 将完整 timestamped video 直接输入预训练 VLM backbone,历史信息仅通过生成 sub-task 的 hidden states 传递给 flow-matching action head,架构更简单,效果却显著优于专用 memory 模块。工程启示:当 VLM 容量足够时,应优先利用其原生视频理解能力,避免过早设计复杂记忆组件。

行业影响

落地场景

SimpleMemVLA 不引入额外记忆模块,直接让预训练 VLM 以原生视频格式消费完整历史观测,适合长程、部分可观测的操控任务。典型场景包括:

  • 仓储/物流机器人:分拣、打包中需跨分钟级依赖(如识别传送带上出现过的特定包裹),策略可基于完整视频流做决策。
  • 家用服务机器人:连续任务如“整理厨房”中,动作决策依赖几分钟前看到的物品位置,模型能原生利用历史视频。
  • 自动驾驶数据闭环:也可迁移至驾驶场景的时序决策,无需额外记忆压缩器,降低栈复杂度。

商业价值

  • 降本:省去检索库、可学习压缩器或循环状态模块,训练和推理管线更简单,减少工程维护与存储开销。
  • 体验提升:因果实验证明策略真实读取历史,长程操控成功率更高,直接改善机器人产品可用性与任务完成率。
  • 部署友好:推理时通过预填充共享前缀,决策延迟接近单帧 VLA,有利于实时控制场景。

与现有产品/工作流的接口

  • VLM 即插即用:只要 backbone 支持视频输入,可将 SimpleMemVLA 作为替代记忆方案,无需重写数据流。
  • 流式推理优化:支持滑动窗口注意力实现有界成本流式推理,与现有 vLLM 或 TensorRT 等推理栈兼容。
  • 训练数据准备:需要带时间戳的视频片段与子任务标签,可与现有机器人数据采集平台集成。

具体落地用例:在电商仓储中,机器人打包订单时需记住传送带上数分钟前出现过的异常包裹,SimpleMemVLA 可直接输入多模态历史视频流,提升复杂订单处理准确率;在医疗辅助机器人场景,手术或护理机器人需依据几分钟前的视觉线索做出安全动作,该方法可简化记忆管线并降低延迟。

局限

  • **历史长度与计算开销的线性关系**:SimpleMemVLA 保留完整历史并直接输入骨干,模型内存占用与注意力计算随历史长度线性增长。虽然论文提出了滑动窗口注意力作为有界成本方案,但窗口大小固定后,超出窗口的早期关键信息将无法回溯,对于长达数十分钟甚至更久的任务可能失效。此外,滑动窗口仅对 softmax 层生效,其他层仍需处理完整历史,实际推理成本仍高于单帧 VLA,部署时需要额外优化或硬件支持。
  • **对骨干视频理解能力的强依赖**:方法假设预训练 VLM 骨干能有效处理带时间戳的原生视频格式。若骨干未在类似视频数据上预训练,直接输入长视频流可能无法充分捕捉时序因果,导致策略读取历史的性能下降。同时,将历史压缩为隐藏状态的单一通道可能存在信息瓶颈,论文通过因果干预验证了历史确实被读取,但未深入分析隐藏状态究竟保留了何种信息以及是否丢失关键细节,这类可解释性缺失可能影响可靠性。
  • **实验基准与对比公平性局限**:论文在四个记忆基准上取得了 SOTA,但基准主要面向桌面操控或模拟环境,缺乏真实世界长期操控任务的验证。对比的检索、压缩、循环状态机制可能未经过充分调优,且各机制的实现细节和超参数未完全对齐,对比结果可能高估 SimpleMemVLA 的优势。另外,方法未与完全端到端训练的记忆模块在统一规模下进行严格消融,部分收益可能来源于骨干差异或训练数据,而非记忆接口本身。
论文Cheng Yin2026-09-02原文

相关内容