论文

WorldLines: 长期状态具身智能体的基准测试与建模

WorldLines: 长期状态具身智能体的基准测试与建模

为了让具身智能体在真实家庭中长期协助人类,它们必须记住用户习惯、世界状态以及过往交互。现有的长期记忆基准主要评估以语言为中心的检索和问答,而具身基准通常关注短期任务执行,未能在动态环境中测试长期记忆的运用。 我们提出 WorldLines,一个以项目为导向的长期具身家庭辅助基准。它构建包含对话、动作、执行反馈、物体和设备状态变化的时间扩展家庭轨迹,并将其转化为带证据链接的样本,用于 Memory QA 和 Embodied Task Planning。进一步,我们提出 ObsMem,一个基于观察者的记忆框架,维护可感知可见性的记忆和动作原生状态轨迹,以支持状态感知决策。 实验揭示了部分可观测性、被覆盖的世界状态以及将长期记忆转化为具身计划中的持续挑战,而 ObsMem 为此设定提供了更强的参考架构。

论文精读

TL;DR WorldLines 基准通过长周期家庭轨迹追踪,评测具身智能体对动态世界状态的长期记忆与规划能力;ObsMem 框架以观察者锚定记忆与类型化更新,缓解部分可观测和状态覆盖挑战。

问题

问题背景

构建能在真实家庭中长周期服务的具身智能体 (embodied agents),核心挑战之一是让智能体具备长时记忆,以追踪用户习惯、环境状态和交互历史,从而做出连贯、上下文感知的决策。

现有方法局限

当前长周期记忆基准几乎仅评价纯语言场景下的检索与问答能力,而具身任务基准则聚焦于短期执行,忽视了动态环境中的持续状态变化。这导致三大关键缺失:

  • 状态不可观测性:现有测试不评估智能体对视野外物体状态变化的记忆,无法应对家庭中大量“开环”事件(如无人时设备状态自动切换)。
  • 记忆-行动脱节:缺乏将长期记忆转化为物理行动计划的流程验证,智能体可能记住信息,却无法据此产生正确的环境交互。
  • 世界状态覆写:没有覆盖“同一对象状态被多次改变后,智能体能否正确回忆最新状态”的场景,而这在真实家庭中频繁发生。

技术挑战与重要性

真实家庭服务请求天然具有时间延展性状态依赖性:例如用户说“我去健身房,一小时后回来,帮我预热烤箱”,智能体需记住时间窗口、用户意图及烤箱状态的变化。这要求记忆系统同时处理多模态证据(对话、动作反馈、设备状态更新),并在部分可观测条件下维护一致性世界模型。然而,当前研究在“将记忆转化为状态感知的具身计划”这一环节严重滞后,成为制约家用智能体从演示走向大规模部署的关键瓶颈。产业界对终生学习型服务机器人的兴趣日益浓厚,亟需能衡量这一能力的标准化基准。

行业类比

这类似于自动驾驶中的长期场景记忆:车辆需要记住几分钟前被遮挡的行人位置,以预测其可能再次出现;家用智能体同样需在数小时甚至数天内追踪家庭状态,才能提供可靠服务。

核心洞察

  • 现有长期记忆基准几乎只评估语言中心化的检索与问答(如 Recall@K、F1),忽略了具身场景中物品状态演变、设备控制历史、可见性约束等物理世界信息。WorldLines 首次将 Memory QA 与 Embodied Task Planning 联合打包,要求代理同时回答关于历史状态的问题并基于记忆生成多步动作计划,这让评估直接对齐真实家庭助手的长期记忆需求,跳出了“记忆=语言记忆”的窠臼。
  • ObsMem 的核心突破在于将记忆组织从“交互记录”升级为“观察者锚定”模型:它维护可见性感知的片段(visibility-aware memories)和动作原生状态轨迹(action-native state trails),使得记忆检索不仅回答“发生了什么”,还能直接支撑“当前该做什么”的状态推理。这与基于向量检索 + LLM 的通用 Memory 方案形成鲜明对照——后者往往在遇到被后续动作覆盖的世界状态时产生幻觉或不一致,而 ObsMem 通过类型化更新和查询时检索策略显著降低了逐次交互中的状态漂移。

方法

WorldLines 基准构建方法

WorldLines 采用 项目驱动 (project-driven) 的生成范式, 模拟真实家庭中长期助手任务。输入为家居环境定义与用户项目需求, 关键流程包括:

  1. 项目周计划生成: LLM 根据高层项目目标(如“准备周末聚会”)生成跨越多日的子任务计划, 定义每日的对话与行动节拍。
  2. 会话级意图规划: 以日为单位进一步细化为多个会话 (session), 每个会话包含用户指令、代理动作、执行反馈和世界状态变化。
  3. 闭环轨迹生成: 在模拟器中执行计划, 代理通过对话和动作与环境交互, 记录 对象状态 (如冰箱温度)、设备状态 (如灯光开关) 的时序变化, 形成含有 部分可观测 特性的长周期轨迹。
  4. 证据链接任务构建: 从轨迹中自动抽取事件, 转换为 Memory QA(事实回忆、状态推理) 和 Embodied Task Planning(基于历史状态做出决策) 两类样本, 每个问题均绑定轨迹片段作为证据, 保证可验证性。

ObsMem 记忆框架

ObsMem 的设计遵循 观察者扎根 (observer-grounded) 原则, 输入为代理的第一人称感知序列 (视觉描述、动作反馈), 通过三个模块实现状态感知的长周期记忆:

  • 记忆摄取: 将原始观察转换为 visibility-aware 记忆条目, 显式记录代理的可见范围与遮挡情况, 避免凭空记忆。
  • 类型化记忆更新: 依据观察类型(对话、动作、状态变化)将记忆分别存入 对话记忆动作原声轨迹 (action-native state trail) 与 世界状态记忆, 其中动作轨迹保留操作前后的状态快照, 支持因果推理。
  • 查询时检索与回答: 对 Memory QA, 从相关记忆中检索证据并生成答案; 对任务规划, 动态读取当前状态轨迹以捕捉 被覆盖的世界状态 (overwritten states), 避免使用过期信息。

输出为增强的上下文, 供 LLM 进行回答或生成动作计划。

与传统记忆系统相比, ObsMem 不再将记忆视为静态文本片段的向量检索, 而是通过观察者扎根和类型化存储, 显式建模部分可观测性与状态时序, 这是其在动态环境下提升决策鲁棒性的关键差异点。

实验

实验设计

WorldLines 基准通过项目驱动的方式生成长期住宅场景的时序轨迹,包含对话、动作、执行反馈与对象/设备状态变化。每个场景转化为带证据链的 Memory QAEmbodied Task Planning 两类任务,用于评估具身智能体在长期记忆下的问答与规划能力。我们对比了 ObsMem 与多种基线系统,包括基于语言模型的直接检索、记忆增强型决策等。消融实验针对记忆可见性、状态更新机制和查询检索策略展开,并在下游具身任务规划中进一步验证框架的实用性。

关键发现

实验揭示三个持久挑战:

  • 部分可观测性:智能体只能从自身视角感知环境,导致记忆不完整。
  • 世界状态覆盖:随时间推移,对象状态频繁变更,历史记忆可能被新信息覆盖,造成前后矛盾。
  • 记忆到具身计划的转化:即使检索到相关记忆,将其准确转化为可执行的实体动作规划仍十分困难。

ObsMem 通过观察者基底的记忆注入(observer-grounded ingestion)与动作原生的状态轨迹(action-native state trails),显著缓解了上述问题,在 QA 准确率和规划成功率上均优于基线。消融结果表明,可见性感知的记忆筛选和类型化状态更新是性能提升的关键。

基线对比解读

与传统仅依赖语言检索的记忆系统相比,ObsMem 的差异化在于:

  • 显式建模哪些信息对智能体当时可见,避免了无依据的记忆回溯。
  • 将状态变化与具体动作绑定,而非单纯记录文本描述,使决策时能根据当前状态推断可行动作。
  • 在动态环境中,该架构展现出更强的鲁棒性,尤其在需要跨多天、多会话推理的场景中,基线方法常因状态混淆而失败,而 ObsMem 能保持更高的状态一致性。 这些发现为未来长时记忆架构提供了参考方向:将具身体验以状态为中心进行组织,而非仅依赖语言嵌入的相似度检索。

行业影响

落地的产品与场景

WorldLines 直接瞄准长期家用具身助手,但它的记忆基准和观测记忆框架可以复用到任何需要持续状态追踪的物理或虚拟代理中。典型产品形态包括:

  • 家用服务机器人(如移动操作臂、人形管家):处理跨时段指令(“我晚上 8 点开会,提前把客厅温度降到 22 度”),依赖对用户日程、设备状态的历史记忆。
  • 智能家居中枢(如带视觉的语音助手):持续跟踪家电开关状态、物体位置变化,并根据过往交互调整自动化规则。
  • 仓储/零售机器人:记忆库存变动、补货任务、故障历史,避免重复劳动或错误操作。
  • 远程医疗/看护系统:记录患者日常活动、用药提醒、环境异常,为真实长期护理提供上下文决策支持。

商业价值:降本、增收与体验升级

  • 降本:传统机器人每次任务从零感知,ObsMem 的 visibility-aware 记忆可减少冗余探索,降低计算和人工远程协助成本。
  • 增收:具备长期记忆的助手可以承载持续性增值服务(例如根据家庭成员偏好自动购买日用品、订阅健康管理),从单次硬件销售转向 recurrent revenue。
  • 体验提升:不再割裂的对话和任务执行,让用户感受到“机器人记得我”,大幅提高粘性与付费意愿。Memory QA 指标直接衡量记忆可靠度,可为产品认证提供量化依据。

与现有 Agent 工作流的接口

当前多数机器人或虚拟助手使用 LLM + 工具调用 架构,记忆通常只是简单的滑动窗口或向量检索。ObsMem 可作为记忆管理层插入现有技术栈:

  • 感知层:接收视觉/语言观测流,调用 observer-grounded memory ingestion 模块,将原始观测转化为 typed updates(如 DeviceStateChange, ObjectRelocation)。
  • 存储层:维护 visibility-aware memories 和 action-native state trails,替代或增强现有的向量数据库(如 Chroma / Pinecone)。
  • 决策层:下游 Embodied Task Planning 通过 Query-Time Retrieval 获取结构化证据,避免 LLM 凭空猜测状态,提升长序列任务成功率。

具体行业用例

  1. 电商仓库协作机器人
    机器人 A 在上午 10 点将一箱货品移至 B 区。下午 3 点机器人 B 收到补货指令,通过记忆系统确认该货品已被移动且状态完好,避免无效搜寻;若 A 曾标记“货箱损坏”,则系统自动触发退货流程。WorldLines 的任务规划评测可验证此类跨时间段、跨代理的信息传递可靠性。

  2. 虚拟健康教练(Digital Health Coach)
    应用内助手通过多模态设备(手机、手表、智能音箱)持续追踪用户睡眠、运动、饮食记录。当用户说“我最近总觉得累”,系统查询过去两周的 partial observability 记忆(如“连续 3 天睡眠不足 6 小时”、“昨天未记录晚餐”),生成证据链并建议调整方案。Memory QA 的评估范式可直接迁移至此类健康对话系统的长期记忆可靠性验证。

局限

  • **场景生成依赖 LLM 模拟**,WorldLines 的轨迹生成流程(项目规划、每日节拍、会话意图)高度依赖大语言模型的常识和推理能力,这可能导致生成的家庭场景偏向于模型先验中的典型行为,而缺乏真实环境中不可预见的多变性和长尾事件。此外,证据链接的正确性(如对象状态变化追踪)未经人工逐条核实,可能引入事实性噪声,使基准本身的可信度受限于生成过程的保真度,代理在此基准上的表现可能无法完全反映真实部署中的鲁棒性。
  • **ObsMem 框架的泛化性未充分评估**:实验部分仅报告了基于特定 LLM 后端(如 GPT 系列)的整体性能,但并未系统探究不同骨干模型(规模、训练数据、指令遵循能力)对 ObsMem 各模块(观察者记忆摄入、类型化更新、查询时检索)的影响。在资源受限、开源模型或不同模态能力下,该框架的记忆消歧和状态推理能力可能显著下降,其作为「更强参考架构」的普适性需要更多交叉验证。
  • **多模态空间感知能力有限**:相比一些直接利用 3D 场景图或视觉特征的具身记忆工作,ObsMem 主要依赖文本化的「可见性感知记忆」和「动作原生状态轨迹」,这可能丢失细粒度的空间关系和物体视觉外观信息。在需要精确物体定位、遮挡推理或非文本状态变化(如颜色改变、液体水位)的复杂家庭任务中,文本化记忆可能无法提供足够的几何与物理上下文,限制了将长期记忆转化为具体动作序列的粒度。
论文Yehang Zhang2026-06-17原文

相关内容