论文

Embodied-R1.5: 通过具身基础模型进化物理智能

Embodied-R1.5: 通过具身基础模型进化物理智能

Embodied-R1.5 是一个统一的具身基础模型 (Embodied Foundation Model, EFM),在单一架构中集成了全面的具身推理能力,涵盖具身认知、任务规划、纠错和指代,旨在实现通用物理智能。 方法上,通过三条自动化数据构建管道大幅扩展关键能力的数据覆盖,构建了超过 150 亿 token 的大规模数据系统,并设计了多任务平衡强化学习方案以缓解异构任务冲突。进一步提出 Planner-Grounder-Corrector (PGC) 闭环框架,使单一模型能够自主执行并自我纠错,完成长时域任务。 实验方面,仅 8B 参数的 Embodied-R1.5 在 24 个具身 VLM 基准中16 个达到 SOTA,超越 Gemini-Robotics-ER-1.5 和 GPT-5.4 等领先模型。由于内化了具身能力,只需少量数据即可微调为 VLA(视觉-语言-动作模型),在 4 个流行操作基准套件上超越 π{0.5} 等模型。此外,零样本真实机器人实验在指令跟随、可供性判断、铰接物体操作和长时域复杂任务中验证了其强泛化能力。 已开源模型权重、数据集、训练代码以及面向具身任务的评估框架 EmbodiedEvalKit,以推动 EFM 的未来研究。

论文精读

TL;DR Embodied-R1.5 用 8B 参数统一模型整合认知、规划、纠正与指向,通过多任务平衡 RL 和闭环 PGC 框架实现长时自主纠错,在 16/24 具身 VLM 基准上超越更大模型。

问题

问题背景

具身智能正从孤立的任务执行迈向 通用物理智能,业界亟需能够融合多维能力的 具身基础模型 (EFM),在开放世界中完成复杂的长程操作。

现有方法的局限

当前具身 VLM 与 VLA 模型普遍存在三个结构性缺陷:

  • 能力碎片化:大多数模型仅单独优化 具身认知(如空间推理)、任务规划行为生成,缺乏统一的闭环推理与自纠正能力,难以在单个架构内协同工作。
  • 关键数据稀缺:空间推理依赖精确的 3D 坐标标注,纠错数据需覆盖多样失败模式,人工采集成本极高,导致 15B token 级别的高质量具身数据集长期空缺。
  • 多任务冲突:将认知、规划、纠错、指向等异构目标纳入联合训练时,梯度方向冲突严重,现有 RLHF 范式未设计面向多任务的 奖励平衡机制,性能相互拖拽,反而低于单任务专项模型。

为什么这个问题难且重要

  • 技术挑战:统一模型需同时处理语言、视觉、动作序列与 3D 空间关系,输入模态和输出空间极不统一;多任务强化学习要求在不同 reward 间动态调整权重,避免灾难性遗忘,这是 多模态 RL 的开放难题。
  • 产业关注度:全球主要机器人实验室(如 Google DeepMind、Tesla)均将 通用机器人基础模型 视为下一代自动化的核心,而将认知–规划–纠错–执行整合进单一模型,是降低长程任务失败率、实现真正自主的关键瓶颈。

行业类比

如同大语言模型通过 指令微调 统一了翻译、摘要、代码等多种 NLP 任务,具身智能也需要一个 “大脑” 将看见(grounding)、思考(planning)、纠正(correction)和行动(action)内化在同一模型中,从而像人类一样在复杂物理环境中灵活应变。

核心洞察

  • 通过多任务均衡强化学习配方缓解异质任务冲突:Embodied-R1.5 将具身认知、规划、修正等能力统一训练,但不同任务梯度方向可能冲突。它设计了一种**多任务均衡 RL 配方**,动态调整任务权重与奖励尺度,使模型在 15B token 数据上同时习得多项能力,避免单一任务主导。这不同于多数工作中针对每种能力分别微调或简单混合数据,为通用具身模型的多任务协同训练提供了新思路。
  • 自动化数据构造流水线系统化扩展关键能力的数据覆盖:现有具身数据集往往偏向单一能力(如导航或抓取),而该工作构建了三条**自动化数据流水线**——3D 场景标注生成空间推理、故障感知构造修正数据、功能性 affordance 与轨迹数据生成——显著扩大数据覆盖面至 15B token 以上。这使得仅 8B 参数的模型在 24 个基准上的 16 个达到 SOTA,表明**数据广度**与**自动化构造**是提升小模型具身推理能力的有效途径。
  • Planner-Grounder-Corrector 闭环框架实现单模型自主长程任务执行与自纠错:传统具身系统常将感知、规划、执行分离,错误恢复依赖外部规则。Embodied-R1.5 内建 **PGC 闭环**,用同一模型完成从理解指令、接地到行动规划,并在执行中自我诊断和修正。这种**端到端的闭环自主性**使得模型在零样本真实机器人实验中展现出强泛化能力,验证了统一架构同时在思考与行动上的潜力,为部署鲁棒自主机器人提供了更简洁的方案。

方法

统一多能架构

Embodied-R1.5 构建为单一具身基础模型 (EFM),输入端融合视觉观测(RGB / 深度)与自然语言指令,输出端统一生成任务规划序列、空间指向坐标或纠错决策。模型内化四大能力:具身认知(空间关系、可供性推理)、任务规划错误检测与纠正视觉指向,避免多专家系统间的上下文割裂与通信延迟。

三管齐下的自动化数据构建

  • 管道1: 3D场景标注 通过逆透视投影将2D实例掩码提升至3D,对齐水平面后自动生成 空间推理问答,扩充具身认知数据。
  • 管道2: 故障感知构造 按失败类型(规划层/执行层)从多源数据合成纠正样本,包括错误规划–重规划对和执行失误–校正信号,训练模型自诊断能力。
  • 管道3: 功能可供性与轨迹 采集物体交互关键点与操作轨迹,构建可供性指向和动作先验数据,补全操控闭环所需的地面知识。
    总规模超15B tokens,核心能力覆盖度大幅提升。

多任务平衡强化学习训练

训练分两阶段:监督微调 (SFT) 赋予基础推理能力,随后进入强化微调 (RFT)。RFT 阶段提出多任务平衡 RL 配方——动态估计各任务(规划、纠错、指向)的梯度贡献并自适应调节权重,消除异构任务间优化冲突;奖励函数联合考量规划步骤合理性、纠错前后差异及动作落地精度,单模型同时驾驭多目标。

Planner-Grounder-Corrector 闭环框架

执行时模型以Planner 角色生成子目标序列,Grounder 将子目标转换成可执行动作(如末端位姿),Corrector 在线监测环境反馈,发现偏差后触发自纠错回路。该PGC闭环使单一 8B 模型能完成长程任务的自主执行与即时自校正,无需外部重规划器。

与同类方法的差异:区别于π0.5 等 VLA 依赖海量遥操作数据训练,Embodied-R1.5 通过纯视觉-语言推理数据闭环自纠正机制,显著降低了对昂贵机器人示教数据的依赖,同时以轻量参数实现跨多基准的 SOTA 性能。

实验

实验设计

Embodied-R1.5 的实验覆盖从基准测试到真实机器人操作的完整评估链路。作者构建了 EmbodiedEvalKit 统一评估框架,汇聚 24 个具身 VLM 基准,横跨具身认知、任务规划、纠正与指向四大能力域。模型先在 15B token 大规模具身数据 上完成监督微调,再通过 多任务平衡强化学习 (RL) 配方 缓解异构任务冲突,最后引入 Planner-Grounder-Corrector (PGC) 闭环框架 实现单模型自主执行与长程任务自我纠正。

评估分四个层面:1) 具身 VLM 基准全面评测;2) 模拟环境 (4 个主流操作基准) 中微调为 VLA 与 π_0.5 对比;3) 零样本迁移至真实机器人,涵盖指令跟随、功能可供性定位、铰接物体操作;4) 长程闭环任务演示。

关键发现

  • 8B 参数 的 Embodied-R1.5 在 24 个基准中的 16 个上达到 SOTA,超越 Gemini-Robotics-ER-1.5GPT-5.4 等大模型。
  • 内部化的具身能力使其仅需少量数据微调即可变为 VLA,在 4 个操作套件上 全面超越 当前领先 VLA 模型 π_0.5
  • 零样本真实机器人实验中展现出对指令跟随、可供性理解及复杂长程任务的 强泛化能力,PGC 框架有效提升闭环自主性与纠错鲁棒性。

与基线的深度对比

与通用视觉语言模型 (GPT-5.4、Gemini-Robotics-ER-1.5) 相比,Embodied-R1.5 的突出优势并非来自参数规模,而是 领域专用数据的构造与多任务 RL 训练策略。三个自动化数据管线(3D 场景标注、失败感知纠正数据构建、功能可供性与轨迹数据生成)弥补了现有具身数据在关键能力上的覆盖缺失,使小模型得以内化物理世界的因果与空间推理规则。

与端到端 VLA 模型 π_0.5 的对比进一步表明,将具身推理能力解耦为前置基础模型再轻量适配的路子,在数据效率与跨任务泛化上均显著优于直接训练单一动作输出模型。PGC 闭环设计更赋予模型 自我诊断与修正 能力,这是传统单步预测式 VLA 难以实现的。总体而言,Embodied-R1.5 为构建通用物理智能提供了高效、可扩展的路线图。

行业影响

落地场景

Embodied-R1.5 作为统一的具身基础模型,可赋能多种物理智能产品:

  • 服务机器人:家庭看护、物品整理等长程任务,利用 PGC 闭环框架 自主规划、执行并实时纠错。
  • 工业自动化:仓储分拣、装配操作,模型通过少量数据微调即可获得高性能 VLA,适应柔性产线。
  • 自动驾驶:结合 3D 空间推理与指令跟随,提升复杂路口的决策与交互能力。
  • 医疗辅助:手术器械递送、患者移位等需要精确言语理解与空间认知的场景。

商业价值

  • 降本:自动数据构造流水线大幅降低高质量具身数据的采集成本(15B tokens 覆盖关键能力),减少人工标注与遥操作依赖。
  • 增效/增收多任务平衡 RL 缓解异构任务冲突,使单个模型即可闭环执行长程任务,提升机器人单位时间任务完成率,缩短部署周期。
  • 体验提升:内在化的具身认知与指向能力使人机交互更自然,模型能理解“把那个红色杯子放在桌角”等模糊指令,并自行纠正失误,提升终端用户信任感。

与现有产品/工作流的接口

  • 开源生态:模型权重、数据集、训练代码及 EmbodiedEvalKit 均已公开(GitHub),可直接集成到 ROS 2 或自定义中间件中,作为高层推理节点。
  • 模块解耦:PGC 框架中的 Planner、Grounder、Corrector 均为同一模型输出,可通过 gRPC/REST API 调用,与现有运动规划库(如 MoveIt)或底层控制器无缝对接。
  • 仿真适配:兼容 Isaac Sim、PyBullet 等仿真平台,利用其 3D 场景标注流水线可以快速为不同环境生成训练数据,加速 Sim2Real 迁移。

具体落地用例

  • 电商仓储:模型微调为 VLA 后,在 AMR 上执行货架拣选——接收自然语言订单(“取第三排左侧第二个蓝盒”),利用 指向模块 定位物品,通过 PGC 闭环一次抓取失败后自动调整抓取姿态,直至成功。整套流程无需手动编程,模型上线周期从数周缩短至天级。
  • 康复护理:在智能轮椅或辅助臂上部署 Embodied-R1.5,理解病患的模糊指令(“帮我把水拿过来”),结合室内 3D 空间推理导航到厨房,识别水瓶并安全抓取,途中若被障碍阻挡则自主重规划路径,全程无人工干预,显著提升残障人士生活独立性。

局限

  • **自动数据构建管线依赖仿真与标注质量**:论文的三条自动数据管线(3D 场景标注、失败感知修正、功能可供性/轨迹生成)虽然在规模上扩展至 15B tokens,但 3D 提升、语义理解和 QA 生成过程与实际物理世界纹理、光照、动态遮挡等存在分布差异,可能导致训练数据中渗入系统性噪声。尤其在执行失败矫正数据构建时,对失败模式的预设分类可能无法覆盖真实场景的多模态错误,限制模型面对未见错误时的自纠错能力。这一局限在真实机器人零样本实验中并未得到充分消融分析,可能影响在复杂非结构化环境中的可靠性。
  • **多任务平衡 RL 的效能取舍**:尽管提出的多任务平衡强化学习范式缓解了异质任务间的冲突,但平衡策略本质上是一种折衷,某些子任务(如具身认知、规划、修正、指向)的极致性能可能被牺牲。论文未单独报告各子任务在 RL 前后的性能变化,也未与针对单一任务精细调优的模型进行对比,从而难以量化“平衡”带来的性能上限损失。在实际部署中,若系统对某类能力(如精细操作轨迹规划)有苛刻要求,这种均匀提升策略可能不是最优选择,需额外工程手段弥补。
  • **闭环 PGC 框架的物理世界鲁棒性**:Planner-Grounder-Corrector 闭环依赖环境反馈信号进行自纠错,但在真实机器人实验中,感知模块的错误(如目标检测失败、姿态估计漂移)可能被递归放大,导致校正动作无效甚至引入新错误。论文仅在有限硬件平台和受控场景演示长程任务,未分析感知噪声下的闭环稳定性。与现有具身闭环系统(如 Code as Policies、SayCan)的对比也停留在基准指标,缺乏在物理世界中不同感知失败模式下的韧性评估,这为生产环境下的安全部署留下开放问题。
论文Yifu Yuan2026-06-09原文

相关内容