面向部分可观测机器人操控的技能级记忆基准测试与增强
近期机器人学习的进展让操控策略能够执行日益多样的任务并跨环境泛化。然而,可靠执行往往依赖无法仅从当前观测推断的隐藏任务状态,因此交互历史变得至关重要。为此,我们提出了 HIDE,一个用于评估部分可观测条件下操控记忆能力的基准。 HIDE 包含 15 项任务,覆盖重复计数、历史状态回忆与执行进度追踪三类能力,并引入随机初始配置以及决策点——在这些决策点上,相似的观测需要依据先前事件采取不同动作。 我们进一步提出 SEEK 框架,组合三种互补的记忆机制,以保留历史证据并追踪执行状态。评测显示,现有策略在 HIDE 上存在显著局限;而记忆增强在仿真与真实世界实验中均提升了任务成功率。单独的记忆机制对某些任务有益,却可能损害另一些任务;它们的组合在所评估配置中于 HIDE 上取得了最高平均成功率。 这些发现凸显了维护隐藏任务状态内部表征的重要性,以及让记忆设计与任务特定信息需求相匹配的必要性。
论文精读
TL;DR 机器人操作常依赖隐藏状态记忆。本文提出 HIDE 基准与 SEEK 记忆框架,验证三种互补记忆机制组合可显著提升部分可观测操作的成功率。
问题
问题背景:机器人操作策略近年追求多任务与跨环境泛化,但可靠执行常依赖无法仅凭当前观测推断的隐藏任务状态,部分可观测性 成为核心挑战。
现有方法局限:多数策略将当前观测或短时历史直接输入网络,缺乏对长期事件的显式建模。在相同观测对应不同动作的决策点上(如重复计数、历史状态回忆、执行进度跟踪),仅靠视觉或本体感受易失败。研究社区也缺少统一基准评估操作策略的记忆能力,各方法难以横向对比,进展受限。
为什么难/重要:真实部署中遮挡、传感器噪声等造成部分可观测不可避免,记忆机制需在存储内容、历史长度与计算开销间权衡。HIDE 通过随机初始化和决策点设计,系统性暴露现有策略在计数、召回与进度跟踪上的缺陷。业界对机器人长期自主运行的需求上升,构建对隐藏状态的内部表示是提高可靠性的关键。
行业类比:类似大语言模型的上下文学习需要保留历史 token,机器人也需要将交互历史编码为可检索的内部状态以支持条件化动作决策。
核心洞察
- HIDE 将“隐藏状态记忆”独立为机器人操作评测维度:当前观测相似但需根据历史事件选择不同动作。现有基准多假设完全可观测或仅测视觉泛化,无法暴露策略对内部任务状态的丢失。HIDE 通过随机初始配置和决策点,把记忆能力与感知能力解耦,发现主流 visuomotor 策略在需要历史证据时成功率大幅下降,为局部可观测条件下的实际部署提供了明确的测试层。
- SEEK 的核心洞察是技能级记忆应由多种时间尺度的机制组合,而非单一上下文窗口或 RNN 隐状态。窗口上下文记忆保留近期细节,持久锚点记忆维护长期关键证据,阶段计数记忆显式跟踪结构化进度;三者分别对应不同的隐藏状态信息需求。实验显示单独使用某一组件会在部分任务上造成性能下降,组合后才取得 HIDE 平均最高成功率,说明记忆增强必须与任务所需信息类型匹配,不能简单堆叠通用记忆模块。
方法
输入与动机
SEEK 面向 部分可观测的机器人操作 任务:策略仅凭当前观测(RGB-D 图像、本体感知)无法确定隐藏任务状态,需利用交互历史。输入为历史观测序列 o_1, ..., o_t 与动作序列 a_1, ..., a_{t-1}。
关键模块
SEEK 在策略中引入三类记忆机制:
- Windowed Context Memory:保留最近固定长度窗口内的观测-动作历史,提供短期上下文。
- Persistent Anchor Memory:从完整历史中筛选并长期保存与任务相关的关键事件(如“目标曾被遮挡”),作为持久证据。
- Stage-Counter Memory:显式计数重复动作或执行阶段,跟踪任务进度(如已抓取次数)。
编码与检索
三类记忆分别编码为紧凑向量。在每一步,策略通过 注意力机制 从记忆中检索与当前观测相关的信息,与当前观测特征融合,再输入策略网络。
输出与训练
策略输出末端执行器动作(位姿或关节目标)。训练采用行为克隆目标,并可能对记忆内容施加辅助监督(如计数回归损失),鼓励记忆模块学习有意义的隐藏状态表示。
与同类方法差异
SEEK 的区别在于同时组合短期窗口、长期锚点和显式进度计数器,而不是依赖单类记忆或隐式 RNN 状态,从而匹配不同任务对记忆类型和留存时长的差异化需求。
实验
实验设计
- HIDE 基准包含 15 个部分可观测操作任务,覆盖重复计数、历史状态回忆与执行进度跟踪三类场景。每项任务随机初始化配置,并在关键决策点呈现相似观测但要求不同动作,迫使策略依赖交互历史。
- 评估对比基线策略与 SEEK 框架(三种互补记忆机制:
Windowed Context Memory、Persistent Anchor Memory、Stage-Counter Memory)在模拟与真实机器人上的成功率。
关键发现
- 现有策略在 HIDE 上表现明显不足,验证了部分可观测操作中对显式记忆的需求。
- 记忆增强后,任务成功率在仿真和真实世界均获提升。不同记忆组件对任务影响差异大:某些任务受益于某一机制,但另一机制可能导致性能下降;三者组合在所有评估配置中取得最高平均成功率。
与基线的深度对比
- 单一记忆机制往往存在任务偏好:窗口上下文适合短时依赖,但长时历史回忆需要持久锚点。仅靠一种机制难以覆盖 HIDE 中多样化的信息需求。
- 组合式设计的关键在于记忆类型与任务状态需求对齐:SEEK 通过可插拔组件实现灵活检索,避免通用记忆模块引入冗余或干扰。
- 工程启示:设计操作策略时不应假设单一记忆结构能通用;应分析任务中隐藏状态的时效性(瞬时 vs 持久)和精度要求,选择或组合对应记忆机制。
行业影响
落地场景
部分可观测操控广泛存在于物流分拣、精密装配、家庭服务机器人等场景。例如,仓储机器人需在视觉遮挡或传感器噪声下记住已抓取物品数量、托盘装载进度;服务机器人需回忆用户之前的指令(如“再倒半杯水”)以决定当前动作。HIDE 基准覆盖的重复计数、历史状态回忆、执行进度跟踪三类任务,直接映射到这些工业任务中的决策点——相似观测需不同动作。
商业价值
SEEK 框架通过组合记忆机制提升任务成功率,直接降低因状态丢失导致的错误抓取、重复动作与任务中断。在仓储自动化中,成功率提升意味着更少人工介入、更低货物损耗;在服务机器人中,可靠的长期交互提升用户体验与付费意愿。模块化记忆设计允许在不重训完整策略的情况下适配新任务,缩短部署周期,降低工程成本。
与现有产品/工作流的接口
SEEK 可作为记忆模块插入现有模仿学习或强化学习策略。其三个组件——窗口上下文记忆、持久锚点记忆、阶段计数器记忆——分别编码近期历史、关键事件与执行阶段,工程上可实现为独立的记忆编码器/检索器,与 transformer 策略的输入拼接,或作为 ROS 2 节点通过标准消息接口传递记忆状态。训练时记录隐藏状态作为辅助监督,推理时实时更新记忆上下文,无缝集成到现有机器人中间件。
具体 use case
- 电商仓储拣选:机器人面对多 SKU、随机摆放,需记住当前订单已拣选哪些物品,避免重复抓取或漏拣。机器人在视觉上相似的箱子前,需依据之前的拣选历史决定当前动作。
- 医疗辅助机器人:在手术器械传递或配药流程中,需跟踪当前步骤进度,即使当前画面相似(如多个相同容器),也必须根据已完成步骤选择下一个操作。
局限
- **HIDE 基准覆盖范围有限**:仅包含 15 个仿真任务,集中在重复计数、历史状态回忆和执行进度跟踪三类。虽然任务设计针对部分可观测性的核心挑战,但未涵盖更复杂的长期时序依赖、多步规划或空间记忆需求,因此作为通用基准的代表性受限。此外,所有任务基于固定机械臂平台和简化视觉输入,与真实场景中的感知噪声和动态变化存在差距,对策略的鲁棒性评估不足。
- **SEEK 的记忆机制依赖手工设计**:框架结合窗口上下文记忆、持久锚记忆和阶段计数器记忆,但每种机制的超参数(如窗口长度、锚点选择策略、计数器更新规则)需要根据任务类型手动调整。面对全新任务时,工程师可能需要进行大量调参或重新设计记忆结构,增加了部署成本。与端到端隐式记忆模型(如 Transformer 自带长程依赖建模)相比,SEEK 的显式设计可解释性更强,但灵活性和自动化程度不足。
- **实验验证范围与对比基线有限**:真实世界实验仅覆盖少数任务,且未与更多强基线(如长序列 Transformer、外部记忆增强方法)进行系统对比。虽然在 HIDE 上 SEEK 的平均成功率最高,但论文指出个别记忆机制可能降低某些任务的表现,说明组合方式并非对所有情况都是最优。实际应用中,需要针对具体任务进行消融或成本权衡,这也限制了方法的开箱即用性。