ABot-AgentOS: 具有终身多模态记忆的通用机器人智能体操作系统
近期VLM和VLA系统提升了机器人感知和动作预测能力,但长周期具身智能体仍需通用运行时层来处理推理、记忆、工具使用、验证及跨实体执行。我们提出ABot-AgentOS,一个通用机器人智能体操作系统,位于低级控制器之上,提供场景条件规划、上下文隔离技能执行、多阶段验证、多模态记忆和边缘-云协作的 deliberative 智能体层。 为评估此类系统,我们引入EmbodiedWorldBench,一个可执行基准测试,包含16个室内、室外和混合场景、四个难度级别及超过200个任务,涵盖导航、物体搜索、NPC对话、动态事件和基于轨迹的评分。ABot-AgentOS 进一步引入通用多模态图记忆,一个持久化、源基础的结构,将对话、视觉观察、空间上下文、时间关系和任务轨迹转化为类型化节点和边。 一个失败驱动的自演化循环将诊断出的记忆故障转化为门控运行时演化资产,这些资产仅提升到后续评估分割,防止当前分割真实标签泄露,同时实现持续改进。在 EmbodiedWorldBench 初始子集上,ABot-AgentOS 在任务成功率和目标完成度上均优于单控制器基线。 在记忆基准测试中,ABot-AgentOS Static 在 LoCoMo 上达到87.5,在 OpenEQA EM-EQA 上达到59.9,在 Mem-Gallery 上达到88.6,在 NExT-QA 上达到76.5 Acc@All;自演化进一步将 LoCoMo 提升至88.7,OpenEQA 至60.4,Mem-Gallery 至89.0。这些结果表明,通用智能体操作系统层可以改善长周期具身执行,同时为持续交互提供持久、可审计的记忆。
论文精读
TL;DR ABot-AgentOS 为具身智能体提供统一的 Agent OS 层,通过通用多模态图记忆和失败驱动的终生自进化,显著提升长程任务执行与记忆基准上的表现。
问题
具身智能领域,VLM 与 VLA 系统显著提升了机器人感知与动作预测,但长程(long-horizon) 任务仍需通用运行时层来协调推理、记忆、工具使用与跨本体执行。
现有方案多将感知、规划、控制与记忆组件分离,缺乏统一协调。记忆系统常为向量库或固定窗口上下文,无法融合视觉、空间、时序等多模态信息为结构化图表示,也难以实现源接地(source-grounded) 检索,导致 agent 遗忘历史、重复错误,且缺乏从失败中持续改进的机制。同时,缺少可执行、多场景、可追溯的基准来公平评估此类系统,限制了迭代速度。
长程具身任务要求 agent 在动态环境中理解复杂上下文并自适应调整。多模态记忆的持久化与高效检索、失败驱动的自进化 能力是核心技术难点。真实部署还需兼顾边缘实时处理与云端计算,对架构提出高要求。业界对通用服务机器人需求迫切,一个降低开发门槛、提供终身记忆 与自适应能力的 Agent OS 成为关键突破口。
与智能手机 OS 为应用提供统一硬件抽象和基础服务类似,机器人 Agent OS 向上屏蔽异构本体与控制细节,使开发者能像开发移动 App 一样便捷构建复杂机器人行为,加速具身智能应用落地。
核心洞察
- **AgentOS 运行时层**,区别于零散的 VLM/VLA 端到端模型,ABot-AgentOS 构建了位于低层控制器之上的**通用代理操作系统层**,统一提供推理、记忆、工具使用和验证等基础能力。这使得长期具身任务不再依赖单一模型,而是通过**模块化、可组合的运行时**实现跨场景和跨执行器的泛化,为复杂机器人应用提供了类似操作系统的基础设施。
- **失败驱动终身自我进化**,其进化循环通过诊断记忆失败,生成**门控进化资产**,仅在后续评估拆分中激活,避免当前数据泄露。这种设计在**LoCoMo、OpenEQA** 等基准上带来持续提升(如 LoCoMo 从 87.5 提升至 88.7),展现了从运行时诊断到策略改进的安全闭环,与常见的离线训练范式形成对比,为生产环境中的自我改进提供了审计友好的路径。
方法
系统输入
ABot-AgentOS 接收多模态传感流(RGB-D 图像、对话音频、空间坐标等)与自然语言任务指令,将它们输入到统一的代理运行时层。
核心模块与处理流程
场景条件任务规划
- 基于当前场景图(语义地图、物体关系)将高层指令分解为可执行子目标序列,生成计划时动态绑定环境上下文。
技能运行器
- 在上下文隔离的沙箱中执行 primitive 技能(如导航、抓取、对话),每次调用仅暴露必要信息,避免跨任务的观察泄露。
多阶段验证
- 在技能执行前、中、后设置检查点,通过视觉问答、逻辑规则等手段验证子目标完成情况,失败时触发重规划。
边云协作路由
- 根据任务延迟与算力需求,动态决定将规划、记忆检索等模块部署在边缘设备或云端,平衡实时性与模型容量。
通用多模态图记忆
- 核心持久化存储:将对话、视觉观察、空间拓扑、时序关系、任务轨迹统一为类型化节点和边。
- 记忆更新:增量式地将新体验插入图结构,保持 source-grounding 以避免幻觉。
- 检索与答案生成:通过图遍历和混合检索(稠密/稀疏)定位相关记忆,再用 LLM 生成带证据引用的回答。
故障驱动的终身自我进化
- 从运行时故障中自动诊断记忆缺陷(如遗漏关键观察),生成修正规则或新记忆节点作为 evo-assets。
- 采用门控机制:这些 assets 只被激活用于未来的评估分割,而当前分割被严格隔离,杜绝数据泄露。
- 八个分割的迭代进化确保能力持续提升,而非一次性微调。
输出
代理最终输出动作序列并更新图记忆,完成长时域具身任务(如“找到厨房里的苹果并描述上次对话内容”),同时提供可审计的追溯痕迹。
与同类方法的差异
ABot-AgentOS 与传统 VLA 端到端策略不同,它将图结构持久记忆和隔离式自我进化纳入代理运行时,而非仅依赖模型内部参数隐式存储经验,从而在长程任务中具备更强的可解释性和持续学习能力。
实验
实验设计
- 智能体评估:在 EmbodiedWorldBench 子集上测试,覆盖 16 个场景、200+ 任务,包含导航、物体搜索、NPC 对话、动态事件等,对比单控制器基线。
- 记忆评估:在四个记忆基准(LoCoMo、OpenEQA、Mem-Gallery、NExT-QA)上分别评估静态记忆系统(ABot-AgentOS Static)与经失败驱动的自我进化后的版本。
- 自我进化验证:将诊断出的记忆失败转换为门控运行时进化资产,仅在后继评估划分中启用,防止当前划分标签泄露,并观察跨划分持续改善。
关键发现
- 具身执行:ABot-AgentOS 相比单控制器基线在任务成功率和目标完成度上均有提升(具体数值未明确)。
- 记忆基准:静态记忆系统已取得有竞争力的结果,自我进化进一步带来一致提升:
- LoCoMo:87.5 → 88.7 (+1.2)
- OpenEQA EM-EQA:59.9 → 60.4 (+0.5)
- Mem-Gallery:88.6 → 89.0 (+0.4)
- 长程记忆:通用多模态图记忆(Graph Memory)能有效融合对话、视觉、空间、时序和任务轨迹,支持可审计的持久交互。
与基线对比解读
- vs. 单控制器:Agent OS 层提供了场景条件规划、多阶段验证、上下文隔离技能执行等高级推理能力,直接提升复杂长程任务的成功率,而不是仅依赖端到端动作预测。
- vs. 静态记忆:引入失败驱动的自我进化,系统能将运行时记忆错误转化为门控进化资产,在不污染当前测试分布的前提下,使记忆检索与回答更可靠。这种机制有别于离线重新训练,更贴合持续部署场景。
- 工程启示:分离的 Agent 运行时层与持久图记忆,使不同机器人形态可复用同一智能“大脑”,边缘-云协作路由则兼顾实时性与算力,为跨具身部署提供了可行范本。
行业影响
落地场景
ABot-AgentOS 可作为通用运行时层,赋能各类具身智能产品:
- 仓储与物流机器人:处理长时多阶段拣选、动态避障、人机对话确认;
- 家庭服务机器人:长期用户偏好记忆、多房间导航与物品搜索;
- 自动驾驶与无人机:跨场景规划、传感器异常处理与云端协同;
- 工业检测与巡检:基于视觉与空间记忆的缺陷记录、报告生成。
商业价值
- 降低部署与维护成本:Universal Multi-modal Graph Memory 实现持久化、可审计的上下文知识,减少重复建图与人工标注;
- 提升任务成功率与用户体验:failure-driven self-evolution 让机器人从错误中持续学习,长程任务完成率更高,交互更自然;
- 缩短开发周期:EmbodiedWorldBench 提供标准化测试,企业可快速评估不同躯干与技能组合,加速方案选型。
与现有产品栈的集成
本系统定位在低层控制器(如 ROS 或硬件驱动)之上,可通过 gRPC/HTTP API 暴露规划、记忆、验证服务,与现有机器人中间件无缝对接:
- 替换或增强传统行为树/状态机的规划层;
- 通过 edge-cloud collaborative routing 灵活拆分本地推理与云端大模型调用,适配不同算力条件;
- 记忆模块可输出结构化图谱,直接对接企业数据湖或监控看板,实现可解释性与合规审计。
具体工业用例
- 电商仓储拣选系统:在大型履约中心,机器人需导航至货架、识别商品、避让动态障碍并人工确认。ABot-AgentOS 将视觉、对话、空间关系编码为图记忆,误拣后触发自我进化修正策略,大幅降低异常处理人工成本。
- 高端物业管家机器人:酒店或办公区执行递送、引导、巡检等混合任务。系统通过 long-horizon planning 分解“接取物品→乘坐电梯→送达房间”等多步指令,并利用多模态记忆记住住户偏好,提升服务一致性与满意度。
局限
- **验证环境局限**:评估完全依赖模拟基准 **EmbodiedWorldBench**,未在真实机器人平台上测试。模拟环境难以反映物理交互中的传感器噪声、机械间隙、力控不确定性,以及实时闭环控制需求。Agent OS 的规划与记忆组件在真实部署中的鲁棒性、延迟和资源开销尚未验证,这限制了其在长期具身任务中的实用性。
- **自我进化机制的泛化风险**:**Failure-Driven Lifelong Self-Evolution** 将修复后的 evo-assets 仅推广到后续评估划分,避免当前划分泄露,但整个进化过程基于固定的评估场景分布。当面临未见任务或环境分布偏移时,累积的记忆修复可能过拟合到已见模式,导致新场景下回答或规划错误。缺乏跨领域、跨具身的泛化测试,持续学习的实际收益存疑。
- **对比基线不足**:实验主要与单控制器 baseline 对比,未系统性纳入当前先进的 **VLA 系统**(如 **RT-2**、**Octo**)或基于 **LLM** 的多模态规划器。在 EmbodiedWorldBench 上仅报告了相对于简单基线的提升,无法判断 Agent OS 相比于端到端 VLA 方法的效率、成功率与计算成本权衡,其架构优势的说服力因此弱化。