MemBodied:用于 Vision-Language-Action 模型的循环关联记忆
Vision-Language-Action(VLA)模型为通用机器人控制提供了坚实基础,但绝大多数策略并不保留和利用当前观测之外的 episode 级信息。这在对历史依赖的操作任务中后果显著——这类任务所需的信息只存在于过去的观测里。把历史观测留在上下文中可以恢复这些信息,但代价是上下文不断膨胀与推理延迟大幅增加。 MemBodied 是一种固定大小的情景记忆(episodic memory),由两个互补组件构成: 1. 关联状态(associative state):记录跨策略调用的交互; 2. 情节锚点(episode anchor):保留初始场景的紧凑表示作为参考。 每次策略调用时,模型以当前输入与记忆组件为条件生成动作,而非直接使用过去的观测。 在 5 个需要记忆的 RMBench 任务上,MemBodied 的平均成功率达到无状态策略的 7.81 倍、vanilla recurrent memory 的 2.98 倍,并以少 10 倍的附加参数超越最强的记忆增强 baseline 达 1.3 倍。在完全可观测的 LIBERO-Long 上,它取得 90.6%,较无状态 π0 策略提升 5.4%。这些结果说明,MemBodied 可作为扩展策略上下文以应对历史依赖操作任务的实用替代方案。
论文精读
TL;DR MemBodied 为 VLA 模型引入固定尺寸的循环关联记忆(associative state + episode anchor),在不膨胀上下文的前提下保留跨步历史,在 RMBench 记忆依赖任务上相对无状态策略提升 7.81 倍成功率,并超越最强记忆增强基线。
问题
问题背景
当前 Vision-Language-Action (VLA) 模型是通用机器人控制的重要基础,但绝大多数策略在每一步决策时仅基于当前观测,缺乏对 episode 级历史信息的显式建模。
现有方法局限
- 上下文扩展方案 :直接在策略输入中保留过去观测,会导致上下文长度线性增长,推理延迟和显存开销快速膨胀,难以在真实机器人实时控制中落地。
- 普通循环记忆 :vanilla recurrent memory 虽然参数恒定,但对长时依赖的建模能力有限,且不同任务下的记忆写入 / 读取机制需要精细设计,否则容易遗忘关键线索或引入噪声。
- 压缩历史方法 :一些方法尝试压缩历史为紧凑向量,但往往以增加额外参数或牺牲信息保真度为代价,无法兼顾记忆容量与推理效率。
为什么这个问题难 / 重要
历史依赖操控任务(如重新排列积木、记忆物体初始位置)要求模型跨时间步保留并关联过去观察中的关键信息,而这些信息在当前观测中完全不可见。VLA 模型通常由大参数量 Transformer 构成,增加记忆模块会带来训练和推理的额外负担。同时,机器人操作对动作输出延迟高度敏感,不能像 LLM 那样无限扩展上下文。因此,如何在固定内存预算下实现可靠的长期记忆,是 VLA 走向真实世界部署的关键瓶颈,也受到学术界和工业界的广泛关注。
行业类比
类似 LLM 应用中,为了避免将所有长文档内容塞进 prompt 导致成本失控,引入 RAG 或外部记忆模块按需检索相关信息。
核心洞察
- MemBodied 的核心贡献在于用固定大小的 episodic memory 替代不断增长的上下文窗口,解决了历史依赖任务中保留过去观测与推理开销之间的权衡。与直接堆叠过去观察或使用 vanilla recurrent memory 不同,它通过一个显式的关联状态(associative state)和一个紧凑的场景锚点(episode anchor)来存储和检索跨步骤信息,使模型在不增加上下文长度和推理延迟的前提下,显著提升对长程依赖的建模能力。这一设计对工程部署尤其重要,因为固定内存占用量可以保证推理成本可预测,同时避免注意力机制因过长序列带来的平方级复杂度增长。
- MemBodied 将快速权重关联记忆(fast-weight associative memory)机制引入 VLA 策略,使用门控 delta 规则(gated delta rule)进行写入,并通过 memory token injection 方式参与动作生成。与传统循环网络(如 LSTM/GRU)的隐式记忆更新相比,这种可分离的读写结构允许模型显式地决定哪些信息需要写入记忆、哪些信息需要擦除或更新,从而更有效地保留与任务相关的历史状态。实验显示该方法仅需极少的额外参数(约为最强 memory-augmented baseline 的 1/10)即可在 RMBench 上达到 1.3 倍的性能提升,说明其记忆表征的高效性。
- MemBodied 通过分离视觉和动作在记忆中的角色,实现了对历史信息的互补编码:关联状态记录策略调用之间的交互(action-centric),而 episode anchor 则保存初始场景的紧凑表示(vision-centric)。这种双组件设计避免了过去方法中单一记忆表示在不同模态信息之间产生干扰的问题,使模型能够在需要回忆早期观测或累计多次尝试结果的任务中表现更稳定。在 LIBERO-Long 上的提升(90.6% vs 85.2%)主要来自长程任务的改善,进一步验证了该结构对长时程操作场景的适配性。
方法
输入
MemBodied 的输入包括:当前视觉观测(RGB 图像)、语言指令(如任务描述),以及来自上一策略调用时刻的固定大小记忆。该记忆由两个互补组件构成:
- 关联状态 (associative state):记录跨策略调用的交互信息,类似快速权重。
- 片段锚点 (episode anchor):在片段开始时提取的初始场景紧凑表示,作为全局参考。
关键模块
- 递归 VLA 公式:策略被建模为递归函数,每次调用接收当前观测与记忆,输出动作并更新记忆。
- 关联记忆写入:
- 写值构造:从当前观测和语言指令生成待写入的值。
- 门控 delta 规则写入:以门控方式更新关联状态,避免覆盖关键历史信息。
- 关联检索与注入:通过关联检索从记忆状态中提取与当前任务相关的信息,使用 memory-token injection 将记忆 token 注入 Transformer 主干(如 π 0.5),与当前输入共同驱动动作生成。
- 固定片段锚点记忆:在片段开始编码初始场景 token,提供不变的空间上下文。
- 因果协调:严格保证读取发生在写入之前,防止未来信息泄漏。
- 序列训练:利用整个片段的序列数据进行训练,使模型学会何时写入、检索和利用记忆。
输出
模型输出机器人动作(例如末端执行器位姿或关节目标)。
与直接扩展上下文(将历史观测拼进输入)或普通循环记忆相比,MemBodied 以固定参数和计算开销保存并检索历史依赖信息,避免了上下文膨胀与推理延迟增长。
实验
实验设计
MemBodied 在两类基准上验证:RMBench 中 5 个记忆依赖的操控任务(含 M(1) 与 M(n) 变体)和完全可观测的 LIBERO-Long 长程任务套件。基线包括无状态策略、普通循环记忆(如 RNN/LSTM)、以及最强的 memory-augmented baseline(如压缩历史方法)。评估协议涵盖真实机器人实验与推理效率分析。
关键发现
- 在 RMBench 记忆依赖任务上,MemBodied 平均成功率达到无状态策略的 7.81 倍、普通循环记忆的 2.98 倍。
- 相比最强 memory-augmented baseline,MemBodied 以 10 倍更少的附加参数 获得 1.3 倍 成功率。
- 在 LIBERO-Long 上,MemBodied 达到 90.6%,比无状态 π_0 策略提升 5.4%,且提升主要集中在长程子任务。
- 真实机器人实验验证了迁移性,推理效率方面 MemBodied 保持固定大小记忆,避免了上下文增长带来的延迟。
基线对比解读
MemBodied 的核心优势在于 固定大小的情景记忆:通过关联状态记录跨策略调用的交互,并用情景锚点保存初始场景的紧凑表示。与直接保留过去观测作为上下文的方案相比,它避免了 token 数量膨胀和推理延迟线性增长;与普通循环记忆相比,其关联读写机制能更精准地保留与任务相关的历史信息。参数效率的提升(10 倍更少)源于轻量级记忆模块设计,使其可作为即插即用组件叠加到现有 VLA 骨干(如 π_0.5)上,无需大幅增加模型容量。
行业影响
落地场景
- 仓储物流机器人:处理多步骤订单(如先取 A、再取 B、最后放回 A),需要记忆 A 的初始位置与中间状态,MemBodied 可显著提升此类历史依赖任务成功率。
- 家庭服务机器人:厨房整理、多房间物品归位等长时操作,面临遮挡与视觉信息丢失,固定大小情景记忆能避免上下文膨胀。
- 实验室自动化:移液、样本分装等序列操作需要记住已处理孔位,MemBodied 可作为即插即用模块增强现有 VLA 策略。
商业价值
- 降本:固定大小记忆替代不断增长的 observation 上下文,降低推理阶段 token 开销与延迟,减少 GPU 显存占用。
- 增收/提效:在 RMBench 上相对 stateless 策略提升 7.81 倍 成功率,扩大机器人可商业化执行的任务范围;在 LIBERO-Long 达 90.6%,长时任务可靠性接近实用阈值。
- 体验提升:减少因遗忘导致的任务失败与人工干预,提升自动化产线或服务机器人的连续作业能力。
与现有产品/工作流接口
- 即插即用设计:作为 VLA 模型(如 π0、OpenVLA)的附加模块,通过 memory token 注入,无需修改 backbone 预训练权重。
- 轻量集成:仅增加极小参数量(比最强 baseline 少 10 倍 参数),可直接在现有 robot learning stack 中先仿真后迁移真机。
- 训练友好:支持 sequence training,复用现有指令数据与 RL 流程,适合快速原型验证。
具体 use case:电商仓储拣选场景中,机器人执行“取回退换商品并重新上架”任务,需记忆商品原货位;生物实验自动化场景中,移液工作站按配方多轮加样,需记住已加入试剂孔位。MemBodied 以固定大小记忆避免长上下文延迟,为这两类真实场景提供可部署的记忆增强方案。
局限
- **评估范围有限**:论文主要在 **RMBench** 和 **LIBERO-Long** 两个基准上评测,虽然它们分别覆盖了记忆依赖任务与完全可观测长时任务,但均以模拟环境为主。真实机器人实验仅在少数任务上展示,缺乏在多样化真实世界长时操作中的泛化验证。记忆机制对感知噪声、动态场景变化的鲁棒性尚不清楚,需要更多现实部署测试才能确认其实际工程价值。
- **固定大小记忆的容量瓶颈**:MemBodied 采用固定大小的 episodic memory,虽然避免了上下文长度随步数线性增长,但容量固定可能不足以存储长序列中所有关键信息。对于需要记忆大量不同物体位置、状态或历史尝试结果的任务,关联状态与 episode anchor 两个组件可能成为性能瓶颈。如何根据任务复杂度自适应调整记忆容量,论文未给出方案,这限制了其在超长时任务中的应用。
- **训练复杂度与超参数敏感性**:引入循环联想记忆和 gated delta-rule 写入机制增加了训练时的计算开销与超参数调节负担,同时需要配合序列训练策略,可能导致训练不稳定或对学习率、记忆维度等超参数敏感。论文未充分讨论训练效率与超参数敏感性,工程落地时可能需要额外调优工作,增加了实际部署的复杂度。