论文

机器人操控中视觉-语言-动作模型的双重潜在记忆

机器人操控中视觉-语言-动作模型的双重潜在记忆

主流视觉-语言-动作模型(VLA)在马尔可夫假设下主要基于当前观测预测动作,难以处理长时序、时间依赖的任务。现有记忆增强VLA要么扩展观测窗口,要么从记忆库中检索历史作为辅助策略上下文,但将记忆置于VLA推理的原生潜空间之外,阻碍了历史经验与多模态推理及动作生成的流畅交织。 为此,我们提出LaMem-VLA,一种潜记忆原生框架,将历史经验重构为潜在记忆令牌,直接与VLA推理交织。其核心包含四个协调组件:(1)curator将历史经验组织为互补的短期记忆库和长期记忆库;(2)seeker利用多模态认知查询两个记忆库,检索上下文相关证据;(3)condenser将检索到的证据重构为紧凑的短期和长期记忆令牌;(4)weaver将这些记忆令牌与当前观测及指令注入连续嵌入序列。通过在相同连续潜空间中表示、检索和消费历史经验,LaMem-VLA使记忆直接参与VLA推理,在有界上下文下指导动作生成。在SimplerEnv和LIBERO上的大量实验证明了其优越性。

论文精读

TL;DR LaMem-VLA 将历史经验重构为潜在记忆令牌并直接织入 VLA 推理的连续潜在空间,使记忆原生参与动作生成,突破传统外挂记忆导致的推理断裂,在长程操作任务上取得 SOTA。

问题

问题背景

VLA 模型正成为通用机器人操控的主流范式,其核心是利用视觉-语言模型的理解能力直接输出机器人动作。然而,多数 VLA 模型基于 马尔可夫假设 设计,即只根据当前观测预测下一步动作,忽略了历史交互对长期任务的关键作用。

现有方法局限

已有记忆增强 VLA 尝试两种路径:

  • 扩展观测窗口:将过去多帧图像或特征直接拼接到当前输入,受限于上下文长度,且难以高效利用早期经验。
  • 外部记忆检索:维护一个记忆库,在推理时根据相似度检索历史片段作为辅助信息输入策略网络。

这两种方式的共同缺陷是 记忆落在 VLA 的潜在推理空间之外:记忆以原始图像、文本或额外特征的形式存在,与视觉、语言模态融合时只是机械拼接,无法让历史经验以统一的隐含表示参与推理过程。模型在多步任务中缺乏对时序因果和动作历史的深层理解,导致长程任务成功率急剧下降。

为什么这个问题难且重要

在潜在空间内原生地操作记忆,需要解决三个核心技术挑战:

  1. 记忆的高效组织:如何将连续交互流压缩为结构化的短期和长期记忆,同时保留与任务相关的时空细节。
  2. 跨模态检索与融合:如何用多模态认知(当前观测+指令)精准地从记忆库中找到相关证据,再将其重构为紧凑的潜在记忆令牌,无缝插入 Transformer 嵌入序列。
  3. 上下文限界下的推理:潜在记忆令牌必须足够紧凑,不挤占关键视觉和语言信息,同时直接影响注意力流和动作头输出。

解决这些问题不仅推动 VLA 从“反应式”走向“前瞻式”,更对服务机器人、自主装配等需要长时间连续交互的场景具有直接落地价值。业界对此高度关注,因为目前多数商业部署的机器人操控系统仍然依赖人工预设的状态机或简单的视觉 servo 策略,缺乏通用记忆能力。

行业类比

这一问题与大语言模型中的 检索增强生成(RAG) 类似,但 RAG 面向离散文本空间,而机器人记忆需要嵌入连续动作空间和 3D 物理交互,同时满足毫秒级推理延迟,比文本记忆更加苛刻。

核心洞察

  • LaMem-VLA 将历史经验重构为潜在记忆令牌并直接融入 VLA 推理的连续嵌入序列,从根本上改变了记忆的参与方式。现有方法或扩展观测窗口导致计算随任务长度线性增长,或从记忆库检索历史作为离散辅助上下文,记忆被置于多模态推理的潜在空间之外,无法与动作生成过程紧密交互。LaMem-VLA 的“编织”机制使记忆令牌与当前观测和指令在统一潜在空间内共同参与注意力计算,打破了马尔可夫假设的限制,让历史经验真正引导长程动作决策。
  • LaMem-VLA 引入短期与长期双尺度记忆拱顶,并通过可学习的冷凝器将检索证据压缩为紧凑的潜在令牌,解决了记忆丰富性与有限上下文长度之间的矛盾。短期记忆聚焦瞬时反应所需的近期模式,长期记忆维护全局任务进展,两者协同使模型能根据当前情境灵活调用不同时间尺度的信息。这一设计不同于缺乏层次结构的记忆库或静态池化方法,通过端到端的压缩与跨尺度交互,在 LIBERO 等基准上显著提升了复杂长程任务的鲁棒性与成功率。

方法

核心思想

LaMem-VLA 将历史经验完全映射到 VLA 模型的连续潜在空间中,通过记忆的生成、检索、压缩和注入,使历史信息直接参与每一步的动作推理,打破传统 Markov 假设的局限。

处理流程

  1. 输入:当前视觉观测、语言指令以及由 Curator 维护的历史交互序列(观测-动作历史)。
  2. 记忆库构建(Curator):Curator 将历史经验组织为两个互补的记忆库:
    • 短期记忆库:存储近期交互的细粒度状态变化,捕获瞬时动态。
    • 长期记忆库:通过压缩策略保留跨越长周期、对任务推进有持续影响的关键模式,避免灾难性遗忘。
  3. 检索与压缩(Seeker + Condenser)
    • Seeker 以当前多模态认知特征(视觉-语言嵌入)为查询,从两个记忆库中检索上下文相关证据。
    • Condenser 将检索到的证据编码为一组紧凑的潜在记忆令牌(latent memory tokens),分别对应短期与长期记忆,使离散历史转化为可参与前向计算的连续嵌入。
  4. 记忆注入与推理(Weaver):Weaver 将生成的记忆令牌与当前视觉令牌、指令文本令牌编织为一个统一的嵌入序列,送入 VLA 的骨干网络(如预训练 LLM)。在该序列中,历史记忆与当前感知在同一潜在空间内交互,共同指导动作 token 的自回归生成。
  5. 输出:机器人动作离散 token(如关节角度或末端位姿增量)。

关键差异

现有记忆增强 VLA(如扩展观测窗口或策略侧检索)将记忆视为外部辅助信号,未与模型原生潜在表示对齐;LaMem-VLA 全程在连续潜在空间内表示、检索和消费记忆,使历史经验以原生 token 的形式直接参与推理,更流畅地引导长周期任务的决策。

实验

实验设计

论文在 SimplerEnvLIBERO 两个仿真基准上验证 LaMem‑VLA 的有效性。SimplerEnv‑Bridge 场景侧重评估模型在长时序依赖任务上的表现,需要智能体记住并利用先前的操作上下文;LIBERO 则包含多种复杂的物体操作任务,提供系统性的对比框架。实验将 LaMem‑VLA 与标准 VLA(如 OpenVLA)以及现有的记忆增强 VLA 方法进行对比,并设置了消融研究以分离各记忆组件的作用。

关键发现

  • 长程任务性能突出:在需要时序推理的任务上,LaMem‑VLA 明显优于仅依赖当前观测的 Markov 基线,证明其在连续动作预测中能有效利用历史经验。
  • 双尺度记忆协同:短时与长时记忆库(short‑term / long‑term vault)的协作检索与融合,使模型既能捕捉近期状态变化,又能回溯远距离的关键帧,互补提升决策稳定性。
  • 消融验证:移除 curator、seeker 或 condenser 中的任一组件均导致成功率下降,尤其是「双尺度」设计替换为单一时长记忆后,脆弱性显著增加,证实了不同粒度记忆分工的必要性。

基线对比深度解读

与现有记忆增强方法的根本差异在于,LaMem‑VLA 将记忆的表示、检索、融合完全纳入 VLA 的共享隐空间,而传统方法仅将历史信息作为辅助上下文附加在策略侧。这种设计使得记忆 token 能够与多模态嵌入无缝交织,直接参与跨模态推理,从而避免了「历史经验」与「当前感知」之间的语义割裂。在 SimplerEnv 的连续操作任务中,该优势体现为更低的任务重试次数与更平滑的动作轨迹;在 LIBERO 的多任务泛化测试中,模型对未见过的物体排布也表现出更强的鲁棒性,暗示隐记忆原生融合能有效降低对特定视觉线索的过拟合。

行业影响

落地场景

LaMem-VLA 通过将历史经验封装为潜在记忆 token 并直接参与推理,显著提升了机器人在长周期、时序依赖任务中的表现。该技术可广泛用于:

  • 仓储与物流:多步骤订单拣选、分拣打包,机器人需记忆移动路径、物品位置及先前操作结果,应对动态变化。
  • 柔性制造:装配、焊接等工序,机器人根据连续步骤的状态反馈动态调整动作,避免重复试错。
  • 服务机器人:家庭或商用场景中,机器人需记忆用户偏好、环境布局及交互历史,实现个性化连续服务。

商业价值

  • 降本增效:记忆驱动的推理减少了对感知输入的依赖,降低传感器与算力开销;提升长任务成功率,减少人工干预与重编程成本。
  • 体验升级:机器人能更连贯地执行复杂指令,避免因“遗忘”导致任务中断,用户体验更自然流畅。
  • 模型复用:LaMem-VLA 的记忆框架可作为即插即用模块,赋能现有 VLA 模型(如 RT-2、Octo),延长技术栈生命周期,保护企业投资。

与现有产品/工作流的接口

  • 模型层集成:可作为记忆适配器(Memory Adapter)插入主流 VLA 模型,通过 weaver 组件 将记忆 token 与视觉、语言指令(embedding sequence)拼接,无需改动原始模型架构。
  • 数据基础设施:短/长期记忆 vaults 可对接向量数据库(如 Milvus、Pinecone)存储历史 embedding,配合 retrieval 机制(seeker)实现高效在线查询。
  • 机器人中间件:以 ROS 2 节点 或 gRPC 服务封装,接收观测与指令,返回记忆增强的推理结果,与现有控制栈无缝衔接。

具体落地 Use Case

  • 电商仓储双边拣选:机器人收到“拿红色杯子放到二号货架”指令,途中避障并记忆杯子实时的视觉特征,若移动路径被临时障碍打断,可结合短期记忆恢复路径,避免回到起点重规划。
  • 医疗服务机器人:在病房递送场景中,机器人记忆不同患者的饮食禁忌与用药时间,通过长期记忆 vault 检索历史交互,在合适时间提醒或递送物品,形成连续护理流程。

局限

  • 论文仅在仿真环境 (SimplerEnv-Bridge 与 LIBERO) 上验证,未在真实机器人平台上进行实验,因此其鲁棒性与迁移能力在实际物理交互、传感器噪声和机械臂动力学差异下仍存疑。此外,四个组件 (Curator/Seeker/Condenser/Weaver) 的联合设计增加了工程复杂度,可能对实时推理与部署造成额外开销。
  • LaMem-VLA 引入的短期与长期记忆 vault 可能依赖固定的容量或检索策略,在面对极长序列 (>数千步) 的任务时,latent memory tokens 的压缩与选择性回忆能否保持关键信息仍有待检验。论文未讨论记忆维护机制(如遗忘或冲突解决),可能限制其在开放、非平稳环境中的持续学习能力。
  • 与其它记忆增强型 VLA 相比,该方法虽将记忆操作统一到连续的潜在空间,但本质上仍是利用历史隐式引导当前动作,缺少显式的因果推理或符号记忆,因此在需要严密逻辑顺序的任务上(如多条件分支规划)可能表现不如基于显式记忆图或程序的方法。
论文Hongyu Qu2026-07-08原文

相关内容