记忆即计划:以记忆锚定规划进行世界-动作建模
主流机器人策略通常采用 Markovian 形式化,但许多复杂的真实世界操作任务本质上是 非 Markovian 的,需要超出当前观测的长时程记忆。现有记忆机制往往依赖语言摘要、不断增长的视觉窗口或二者的组合,因而可能丢失细粒度视觉证据,或在历史覆盖与执行效率之间陷入权衡。 MaP-WAM 将依赖记忆的世界-动作建模分解为 记忆锚定规划 与 计划条件执行,并把长期多模态情节上下文作为规划期证据,而非反复让执行器以完整历史为条件: - 记忆表示为已完成片段记录,包含语言指令与稀疏视觉上下文; - 这些情节记忆被转换为紧凑计划,由下一段级语言计划与对应视觉引导构成。 World-Action-Progress (WAP) 模型在推理时联合预测动作块与相应的执行进度,从而在未知时长上完成每个计划,并通过计划-观测对齐校准预测进度,实现自适应片段切换与闭环上下文更新。MaP-WAM 保持执行器上下文长度固定,结构化注意力还使规划与执行两个阶段都能使用 key-value 缓存。 实验方面,MaP-WAM 在 RMBench 上取得 83.3% 成功率的最优表现,真实机器人任务成功率达 78.0%,并且随着任务历史增长,执行器推理延迟基本保持恒定。
论文精读
TL;DR MaP-WAM 把长程情景记忆转化为“下一步语言计划+视觉引导”的紧凑计划,执行时联合预测动作块与进度并自适应切换,在非马尔可夫操控任务中兼顾历史覆盖与固定推理延迟,达到 83.3% 仿真成功率。
问题
问题背景
当前机器人操作策略正从单任务向通用具身智能演进。主流策略常采用 Markovian 假设,仅依赖当前观测决定动作,但许多真实世界操作任务(如“先拿起杯子再倒水”)本质上 非马尔可夫,需要历史上下文。
现有方法局限
现有记忆机制主要有三类:
- 语言摘要 将历史转为文本,会丢失空间位置、物体姿态等细粒度视觉证据;
- 增长视觉窗口 保留近期图像,但序列长度随任务时间线性增长,导致 Transformer 推理延迟上升;
- 混合方案 试图平衡,但往往面临历史覆盖率与执行效率的折中,且难以对已完成的任务段进行结构化复用。 这些方法无法在长周期操作中同时保持执行器的固定上下文长度和丰富历史信息。
为什么这个问题难 / 重要
技术挑战在于多模态长期记忆的表示、压缩与检索需要与实时闭环控制兼容。执行器需在毫秒级延迟内响应,同时感知上下文。业界对通用机器人策略的关注度持续提升,尤其需要可扩展、恒定延迟的推理架构;如果记忆机制导致执行时间随任务变长,难以在真实机器人上部署。
行业类比
类似大语言模型在处理超长文档时用检索增强生成(RAG)替代把所有 token 一次性送入模型:需要从记忆中选择关键证据,而不是全部重放。
核心洞察
- MaP-WAM 的核心在于把非马尔可夫任务中的长期记忆重新建模为“计划”,而不是持续膨胀的状态或摘要。对比现有方案,语言摘要会丢失细粒度视觉证据,增长视觉窗口则让执行器上下文长度随历史线性增加,难以兼顾覆盖与推理效率。MaP-WAM 通过 **completed segment records** 将历史压缩为包含 `language instruction` 和稀疏视觉上下文的 **compact plans**,planner 在规划时利用长上下文,executor 只接收单个 segment 的计划,上下文长度固定。这种 **Memory-as-Plans** 分解既保留了关键视觉引导,又保证执行延迟不随任务历史增长,从架构上解决了记忆与效率的 trade-off。
- MaP-WAM 的 **World-Action-Progress (WAP)** 模型通过显式预测动作块与执行进度,并对齐观测来校准进度,实现自适应 segment 切换。常规策略要么预测固定长度动作块后强制切换,要么依赖额外终止信号,难以应对未知时长的操作。WAP 联合预测 `action chunks` 和 `execution progress`,在推理时用 **plan-observation alignment** 校准预测进度,使得执行器能根据实际观测动态决定何时结束当前 plan 并触发下一个 segment 的规划,形成闭环上下文更新。这种进度校准机制让非马尔可夫任务的执行更鲁棒,避免过早或过晚切换导致的任务失败。
方法
输入与核心模块
MaP-WAM 的输入包括当前观察、历史任务记忆。记忆以 completed segment records 形式存储,每条记录含语言指令与稀疏视觉上下文(例如关键帧图像)。框架包含两个核心模块:
- Memory-Grounded Planner:接收长期多模态 episodic context,将其转换为紧凑计划,计划由下一 segment 的语言子目标与对应视觉引导构成。
- World-Action-Progress (WAP) 模型:作为计划条件执行器,以固定长度上下文感知当前观察与当前计划,联合预测动作块(action chunks)与执行进度(execution progress)值。
执行与校准流程
WAP 在推理时逐 segment 执行,通过 plan-observation alignment 将预测进度与观察到的视觉状态对齐,校准进度估计,从而触发自适应 segment 转换:当进度接近完成时自动进入下一计划,同时以新完成的 segment 记录更新记忆上下文,形成闭环上下文更新。
输出与效率特性
最终输出为动作序列(供机器人执行)与进度信号(控制转换)。与同类方法相比,MaP-WAM 不将完整历史直接送入执行器,而是仅在规划阶段使用记忆,执行器上下文长度固定,配合 structured attention 实现规划与执行两侧的 key-value caching,使端到端推理延迟随历史增长近似恒定。
差异点:与依赖语言摘要或增长视觉窗口的机制不同,MaP-WAM 以“记忆即计划”压缩历史,保留细粒度视觉证据的同时避免执行效率随历史线性下降。
实验
实验设计
MaP-WAM 在 RMBench 基准与真实机器人任务上评估。RMBench 覆盖非马尔可夫操作场景,真实机器人任务验证长时程物理交互。评估指标为成功率与推理延迟。
关键发现
- RMBench 成功率达 83.3%,真实机器人任务达 78.0%。
- 执行器上下文长度固定,配合结构化注意力与 KV 缓存,推理延迟随历史增长保持近似恒定。
- 记忆表示为已完成分段记录(语言指令 + 稀疏视觉上下文),规划器将其转换为紧凑计划,实现细粒度视觉证据与高效执行的平衡。
基线对比解读
相比基于语言摘要或增长视觉窗口的现有记忆机制,MaP-WAM 避免丢失细粒度视觉信息,同时不牺牲执行效率。其分离式记忆规划与计划条件执行架构,在长时程任务中显著优于传统马尔可夫策略,且无需重复处理完整历史,这是成功率提升与延迟稳定的关键。
行业影响
落地场景
MaP-WAM 适合非马尔可夫长程操作任务,典型场景包括:
- 仓储物流:多步骤拣选与包装,需记忆已处理物品位置与状态,避免重复或遗漏。
- 家庭服务机器人:连续整理、烹饪等任务,需保留细粒度视觉证据,而非仅依赖语言摘要。
- 柔性制造:装配与维护中,历史观测影响后续决策,固定执行上下文可提升产线节拍。
商业价值
- 降本:执行器上下文长度固定,推理延迟不随历史增长,降低边缘设备 GPU 占用与功耗,支持更大规模部署。
- 增收 / 提效:在 RMBench 上 83.3% 成功率、真实机器人 78.0% 成功率,减少任务中断与人工干预,提升整体吞吐。
- 体验提升:自适应段切换与闭环更新提升操作鲁棒性,适合对可靠性要求高的服务场景。
与现有产品 / 工作流的接口
- 可作为 VLA 模型中的记忆模块,替代现有基于语言摘要或增长视觉窗口的方法。
- 与 ACT / Diffusion Policy 等执行策略兼容,通过 plan-conditioned 执行解耦规划与动作生成。
- structured attention 和 KV cache 优化可集成进现有 Transformer 推理框架,如 vLLM 或 TensorRT-LLM。
- 通过 segment records 与 plan-observation alignment 实现闭环,可对接 ROS 2 等机器人中间件。
具体落地 use case:
- 电商仓库拣选机器人:处理多订单合并拣选,将已完成子任务编码为 segment records,规划下一段语言计划与视觉引导,执行器固定上下文保证高并发下延迟平稳。
- 家庭服务机器人:执行“收拾餐桌—洗碗—归位”长任务,需记住哪些盘子已收、哪些区域已清理;稀疏视觉上下文保留关键证据,避免语言摘要丢失细节,提升任务完成度。
局限
- **依赖语言指令与稀疏视觉上下文**:该方法以语言模型生成段级语言计划,语言描述的准确性直接影响后续执行;稀疏视觉上下文虽降低计算与存储,但可能丢失细粒度几何/纹理信息,在精密操作任务中可能成为瓶颈。论文未对视觉上下文稀疏程度做系统消融,难以确定最优权衡。
- **泛化性评估有限**:实验主要在 RMBench 模拟基准和少量真实机器人任务上进行,缺少跨场景、跨物体、动态环境的大规模验证。真实实验的任务多样性和重复次数未详细披露,因此对开放世界或分布外情况下的稳健性证据不足。
- **双组件架构增加系统复杂度**:与端到端策略相比,MaP-WAM 分离规划与执行,虽然执行延迟恒定,但引入额外的规划器(可能调用大语言模型)和模块间通信,训练与部署成本更高。论文的延迟测量聚焦执行阶段,未充分讨论规划阶段开销及模块间错误传播对整体系统的影响。