Vesta: 一种通用具身推理模型
在开放世界环境中运行的机器人必须无缝集成定位、空间推理、导航和长时程规划。尽管专用模型在各自任务上表现优异,但部署多模型组合计算成本高昂且易产生级联错误。 我们提出 Vesta,一种统一的具身通用模型,将上述能力整合到单个基础模型中。我们的方法结合了为诱导空间基础而构建的大规模多样化策展语料库,以及一个简单的多模态记忆机制,支持在扩展时间跨度上进行推理。 在多个基准测试中,Vesta 平均优于各单项最优的基线方法超过 20%,并优于每个类别最佳基线的集成方法超过 10%——表明通用模型能够匹配甚至超越专用模型。在需要记忆和推理的真实机器人任务中,Vesta 将任务成功率提升了 35% 以上。 本工作证明,单个通用模型是组合专用模型的一种可行、可扩展且更优的替代方案。
论文精读
TL;DR Vesta 将定位、空间推理、导航与长程规划统一为单一具身通用基础模型,在多个基准和真实机器人任务中以超 20% 优势超越专门模型,证明通用模型可替代多模型堆栈。
问题
问题背景
具身 AI 领域正致力于构建能够在开放世界中执行长期任务的通用机器人系统。这些系统需要无缝集成定位、空间推理、导航与长周期规划等多种能力,而当前研究焦点集中于如何用单一模型替代多模型堆叠,以降低工程复杂度和提升鲁棒性。
现有方法局限
主流方案依赖多模型堆叠(multi-model stack),例如上层 VLM 做高层规划,下层调用专用导航或操作模型执行指令。该范式存在明显局限:
- 计算冗余与延迟:各模型独立推理,累计延迟高,难以满足实时交互需求。
- 级联错误(cascading errors):上游模型的输出误差会向下游传播,缺乏全局纠错,导致任务失败率上升。
- 记忆割裂:不同模型无法共享记忆,使机器人难以维护跨时间步一致的上下文,在需要长期记忆的推理任务上表现差。
- 协同优化困难:各模型在独立数据上训练,无法进行端到端联合优化,整体性能受限于最薄弱的环节。
为什么这个问题难/重要
构建统一的具身通用模型面临多重技术挑战:首先,多模态对齐要求将视觉、语言和动作空间有效融合;其次,空间 grounding 需模型理解 3D 空间关系,并将符号化指令映射到物理世界;再次,长期记忆 对跨分钟级任务的推理至关重要,模型需维持并有效检索过去的观察与行动。业界关注度激增,因为通用基础模型一旦实现,可大幅简化机器人软件栈,提高系统泛化性和鲁棒性,是迈向通用具身智能的关键路径。
行业类比
如同自动驾驶从模块化管道转向端到端模型以消除级联误差和手工规则,机器人领域同样需要一个统一的具身基础模型 来整合分散的能力,避免多专家系统带来的集成与维护负担。
核心洞察
- 通用模型可超越专门模型集成:Vesta 在一个单一基础模型内统一定位、空间推理、导航和长程规划,不仅在各个基准上平均超出 SOTA 专家模型 >20%,甚至超越多类别最优模型的集成 >10%,直接质疑了“多模型堆叠必要论”。传统方案需为每个任务维护专有模型,导致计算冗余与级联错误;Vesta 通过通用架构和记忆机制消除这些瓶颈,证明通用基座在具身推理中更具可扩展性和工程可行性。
- 多模态记忆赋能长程推理:Vesta 引入简单的多模态记忆机制,让模型在长时间跨度上保持并利用历史信息,从而在需要持续记忆的真实机器人任务中成功率提升 >35%。这与大多数仅依赖当前观察或短时上下文的 VLM/VLA 形成鲜明对比:记忆不仅缓解了状态丢失,还使模型能够进行上下文相关决策,为通用机器人的长期自主性提供了直接且高效的方案。
- 通过大规模数据策划隐式诱导空间接地:Vesta 并未设计复杂的显式空间嵌入模块,而是用精心构建的多样化、大规模语料来使模型自然地获得空间推理能力。这种方法不同于常见的手工设计空间表示或专门网络分支,在保持模型简洁的同时实现了强泛化,为减轻通用机器人模型中空间理解负担提供了一条更具可扩展性的数据驱动路径。
方法
输入表示
Vesta 接收 多模态传感器流(RGB 图像、深度、本体感知)和 自由形式语言指令,统一编码为 token 序列。历史观察通过简单的滑动窗口记忆 存储为固定大小的上下文缓存,支持跨长时间步的关联。
核心模块
空间接地数据策展
大规模、多样化的策展语料库专门设计用于强化模型的空间理解能力。数据覆盖定位、导航、具身推理等不同任务,通过合成生成与真实标注结合,迫使模型学习从像素到物理坐标的映射,形成内在的空间世界模型。统一视觉-语言-行动架构
基于 Transformer 解码器 的单一模型,共享视觉与语言特征空间。所有任务被转换为统一的序列到序列格式:输入为多模态上下文+任务提示,输出为文本或特殊动作 token。任务提示(如[locate]、[navigate]、[plan])控制推理模式,无需多个专家头。多模态记忆机制
一种轻量的键值记忆库(key-value memory)附加在 Transformer 之上:新观察被编码为键值对存储,查询时通过注意力检索相关历史。该模块无需额外微调,即可让模型在长时程规划中回溯已访问区域或已执行动作,缓解遗忘问题。
输出与下游执行
根据任务类型,模型直接输出:定位坐标(回归值)、导航路径点序列、高层动作计划 或 自然语言推理结果。动作计划以结构化文本(如 JSON)发出,由底层控制器解析执行。
与分层多模型堆栈的差异:Vesta 将原本分离的 VLM 规划器、VLA 执行器、定位模块、记忆模块融合为单一可端到端优化的通才模型,避免了模块间通信延迟与级联错误,并在同等算力下取得更均衡的性能。
实验
实验设计
Vesta 在多个具身推理基准上评估,覆盖 定位 (localization)、导航 (navigation)、空间推理 (spatial reasoning)、长程规划 (long-horizon planning) 等核心能力。对比基线包括:(1) 每个任务当前的 SOTA 专用模型;(2) 由各任务最佳模型组成的 集成系统;(3) 真实机器人平台上需要记忆与推理的 端到端任务。评测指标涉及成功率、路径效率和规划步数等,以衡量通用模型相对于多模型堆栈的综合优势。
关键发现
- Vesta 跨任务平均性能 超过单个 SOTA 基线 >20%,表明统一模型有能力匹配甚至超越专用模型。
- 相较于集成各任务最佳基线的组合,Vesta 仍有 >10% 的提升,凸显单模型可避免级联误差、降低部署复杂度。
- 在真实机器人操作任务中,Vesta 将成功率 提高 >35%,验证了多模态记忆与空间 grounding 在长程推理中的关键作用。
基线对比解读
专用模型集成虽然理论上聚合最优能力,但模型间接口不一致、误差累积及额外计算开销导致其实际性能受限。Vesta 通过 大规模空间感知语料 和 多模态记忆 harness 在单一模型内实现了跨技能融合,从根本上消除了模块间通信成本和错误传递。这一设计在实时性、一致性与可扩展性上均表现出工程优势,证明通用家模型可作为更合理、可伸缩的替代方案。
行业影响
落地场景
Vesta 作为统一的具身通用模型,将定位、空间推理、导航和长程规划集成到单一基础模型中,可直接应用于需要机器人自主作业的多种场景:
- 仓储与物流:自主移动机器人(AMR)在动态仓库中执行分拣、搬运,需实时定位与路径规划,Vesta 可替代“多个专有模型+手工切换”的复杂栈。
- 零售服务:如超市清洁与导购机器人,需同时处理自然语言指令、识别商品位置、规划移动路线并避免碰撞,Vesta 支撑端到端交互。
- 家庭服务:家用机器人执行多步骤任务(如整理房间),需记忆物品位置并适应环境变化,Vesta 的多模态记忆与长程推理能力可提升任务成功率。
商业价值
- 降低部署成本:在复杂机器人系统中,集成多个专用模型需要大量工程调优和计算资源。Vesta 单个模型替代多模型栈,显著减少硬件和软件维护开销。
- 提升任务成功率:论文显示在真实机器人任务中成功率提升超过 35%,意味着更少的故障和人工干预,直接转化为运营效率提升。
- 加速产品迭代:通用模型可通过统一训练框架快速适配不同任务,减少了为每个新场景重新训练或集成模型的周期,缩短上市时间。
与现有工作流的接口
Vesta 的设计兼容当前流行的“高级规划+低级执行”层次化架构,可直接作为其中的规划器 VLM 使用。它输出的高层指令可被下游的运动规划器或 VLA 模型执行。集成要点:
- 多模态输入:支持 RGB 图像、深度信息、文本指令和历史记忆,与现有传感器套件和任务管理系统接口自然。
- 记忆模块:
multimodal memory harness可存储环境上下文,与机器人操作系统(ROS)中的世界模型或知识图谱对接,便于任务级重规划和错误恢复。 - 开放词汇集:基于大规模多样语料训练,使模型能理解未见过的物体和指令,降低了为新环境进行微调或示例标注的需求。
具体落地用例
电商仓储拣选:AMR 接收订单后需在动态货架间导航、识别并抓取商品。Vesta 可端到端解析“去 A-3 区拿蓝色包装洗发水”这类指令,结合实时定位与空间推理规划路径,即使货架发生变动也能通过记忆同步更新内部状态,避免碰撞其他机器人或工人。相比现有“视觉定位模型+路径规划器+目标检测”的堆叠方案,显著简化部署并提高鲁棒性。
医院物资配送:医院环境人员密集、布局常变,配送机器人需理解“把药送到 302 病房 B 床”的指令,并记住已送达任务避免重复。Vesta 的多模态记忆使其能在复杂走廊中重新规划路线并识别病房标识,与现有护士站系统通过 API 对接,自动接收任务并上传状态,减少人力成本并提升药品配送准确率。
局限
- - **训练数据依赖与领域差异**:Vesta 依赖大规模、多样性高的策划语料库来诱导空间 grounding,语料的覆盖度直接决定模型在 open-world 场景下的泛化能力。若目标环境与训练分布差异显著(如强动态光照、非结构化地形),模型性能可能大幅下降。论文未系统分析语料组成与域迁移敏感度,社区复现时需额外投入数据工程,限制了开箱即用的实用性。 - **记忆 harness 的长跨度容量未充分验证**:虽然提出了多模态记忆机制以支撑长时域推理,但论文仅在有限真实机器人任务(如清洁场景)上展示了效果,并未在持续数小时或跨天级任务中测试记忆衰退或检索失效问题。对于需要持久化环境 memory 的部署场景,这一机制的可扩展性与可靠性仍存疑。 - **计算效率与实时性未深入讨论**:作为统一基础模型,Vesta 的推理时延与资源消耗可能远高于单任务专用模型,尤其在边缘设备上。论文未提供推理速度、内存占用等效率指标,也未与轻量级 specialist 模型在相同硬件下对比,这使得实际部署中可能面临成本与实时性挑战,抵消了统一模型的部署便利性优势。