RxBrain: 带有联合语言-视觉推理与想象力的具身认知基础模型
具身认知要求智能体连接高级任务推理与待实现的物理状态。我们提出 RxBrain,一种带有联合语言-视觉推理与想象力的具身认知基础模型。与强调场景理解的视觉-语言模型或预测未来视觉状态的生成式世界模型不同,RxBrain 以单一规划序列表示具身规划,其中语言提供抽象结构(任务分解、规划原语、约束、时序和决策逻辑),而视觉想象力通过世界状态预测和联合子目标规划来具体化该结构,将每一步与中间和最终物理状态关联。 模型采用统一的 多模态混合 Transformers 架构,支持在一个模型中理解和生成语言、图像和视频。为训练此能力,我们构建了 自动流水线,将具身视频分解为规划步骤并与视觉状态转换对齐,转换为 联合文本-视觉规划监督。此外,引入 RxBrain-Bench 基准,评估模型是否通过联合文本和视觉组件(而非单独理解或生成)表示具身规划。 实验表明,RxBrain 保持具身理解和生成能力,产生包含耦合文本推理、世界状态预测和联合子目标规划的规划。扩展至连续机器人动作生成时,在无大规模动作数据预训练下表现出有前景的真实机器人性能。这些结果为具身认知的基础模型迈出初步一步。
论文精读
TL;DR RxBrain 统一语言推理与视觉想象,用单一模型生成包含任务分解、状态预测和子目标规划的结构化计划,并直接输出机器人动作,无需大规模动作预训练。
问题
具身认知的推理与想象鸿沟
具身认知(embodied cognition)要求智能体将高层任务推理与物理世界的状态变化紧密耦合,以实现可靠的规划与执行。当前领域聚焦于如何让模型既能理解任务目标,又能预测环境状态演变,从而连接抽象规划与具象动作。
现有方法主要形成两类独立范式:
- 视觉-语言模型(VLM) 侧重于场景理解和文本化决策,但缺乏对世界状态变化的显式建模与预测,文本规划容易脱离物理约束;
- 生成世界模型(world model) 能预测未来视觉帧,但缺少对任务分解、时序约束和决策逻辑的抽象表达,难以直接驱动复杂任务推理。 二者割裂使用,无法在统一框架内形成“语言规划 + 视觉想象”的闭环,导致规划结果与真实状态之间出现鸿沟。
这一问题的难度与重要性在于,联合推理与想象对模型架构、数据构造和评估均提出根本挑战:
- 多模态混合架构:需在同一模型内实现语言、图像、视频的理解与生成,且保证跨模态内容逻辑一致;
- 监督信号获取:将非结构化的具身视频自动转化为对齐的文本-视觉规划数据存在技术门槛;
- 能力评估:缺乏能衡量“联合文本-视觉规划”而非单一理解或生成的基准。 具身智能正从实验室走向真实场景(如机器人操作、自动驾驶),业界迫切需要能同步进行任务分解、状态预测和子目标规划的认知基础模型。
类比而言,这如同将**大语言模型的“思维链”(chain-of-thought)**扩展为具身场景的“视觉思维链”——每一步推理不仅产出文本决策,还要同时想象出环境的中间物理状态,以落地执行。
核心洞察
- RxBrain 提出了一种**语言-视觉联合推理与想象**的具身认知基础模型架构,将任务规划中的抽象逻辑与物理状态预测统一在单个规划序列中,而非像现有 VLM 或世界模型那样分别侧重文本决策或视觉预测。这种联合表示使模型能同时输出文本推理、世界状态预测和联合子目标规划,为具身认知提供了更完整的符号-感知耦合基础。
- 通过**自动构建联合文本-视觉规划监督数据管道**,RxBrain 从具身视频中分解规划步骤并与视觉状态转换对齐,实现了大规模弱监督训练,避免了昂贵的人工标注。该管道将视频中连续的物理变化转化为分步的规划原语与中间/最终视觉状态配对,解决了具身认知模型缺乏此类多模态规划监督的瓶颈。
- 论文提出的 **RxBrain-Bench** 评估基准强调同时对文本推理和视觉想象能力的双重考察,与现有仅评估单一模态理解或生成的 benchmark 形成本质差异。这种评估范式更贴近真实具身任务中对耦合认知能力的需求,为后续基础模型研究提供了更全面的性能衡量标尺。
方法
方法概述
RxBrain 以任务指令和初始视觉观察作为输入,通过统一的多模态 Mixture-of-Transformers 架构,生成一个联合语言-视觉规划序列:文本部分提供任务分解、时序逻辑与约束,视觉部分则以预测的世界状态或子目标图像实现物理接地。
关键模块与处理流程
- 统一多模态骨架:单一 Transformer 主干同时支持语言、图像、视频的理解与生成,避免传统流水线中 VLM 和世界模型的分立调用。
- 联合规划表示:输出序列将文本推理步骤与想象子目标图像交错排列——语言负责抽象控制流,视觉负责空间状态预测,两者互为上下文,形成端到端的联合推理。
- 训练数据构建:引入自动化流水线,将海量具身视频分解为规划步骤,并对齐相应视觉状态转换,从而生成
(指令, 文本规划序列, 图像子目标序列)的监督信号,无需人工标注。 - 扩展动作生成:在规划阶段之后,通过轻量适配模块可进一步输出连续机器人动作,实现在真实机器人上的部署,且不需要大规模动作数据预训练。
与同类方法的差异
RxBrain 不是独立的语言推理模型 + 世界模型;它将语言推理与视觉想象耦合在一个规划序列中,用同一模型同时完成“思考”与“预演”,从而让抽象逻辑与物理状态预测天然对齐,而非事后拼凑。
实验
实验设计
- 构建自动标注管线,将具身视频分解为规划步骤,并与视觉状态转换对齐,生成联合文本-视觉规划监督。
- 提出 RxBrain-Bench 评估基准,检测模型是否能通过文本和视觉组件联合表示具身计划,而非分离式理解或生成。
- 扩展至连续机器人动作生成,验证在无大规模动作数据预训练下的实机可行性。
关键发现
- RxBrain 保持具身理解与生成能力,产生的计划包含耦合的文本推理、世界状态预测和联合子目标规划。
- 在机器人任务中,模型表现出有前景的实机性能,证明视觉想象和语言推理的互补性对具身认知至关重要。
- 统一多模态 Mixture-of-Transformers 架构实现了在一个模型内理解语言、图像和视频并生成。
与基线对比深度解读
- 对比传统 VLM (强调场景理解和文本决策) 和 生成式世界模型 (主要预测未来视觉状态),RxBrain 的创新在于将语言和视觉想象融入单一规划序列。
- 语言提供任务分解、约束等抽象结构,视觉想象提供世界状态预测,将规划步骤与物理状态关联,使计划更具执行可行性。
- 这种联合表示避免了纯语言或纯视觉计划的局限性,尤其在需要精确物理状态对齐的复杂任务中显示优势。
行业影响
落地场景
RxBrain 将语言推理与视觉想象统一为联合规划序列,尤其适合需同时理解任务结构与物理状态的具身智能场景。
- 工业与物流机器人:在电商仓储中,机器人接收抽象指令(如“将货架A第三层的红色包裹搬运至打包台”),需分解步骤并预测移动路径、抓取姿态等中间物理状态。RxBrain 输出的文本计划与视觉子目标可直接驱动操作序列。
- 家用服务机器人:面对“整理干净的客厅”这类模糊指令,模型既能生成“收捡衣物→归位杂物→擦拭桌面”的文本规划,又能想象各步骤后的场景图像,使机器人自主校验与调整动作。
- 自动驾驶:将自然语言导航指令与周边交通场景的未来状态预测结合,增强决策可解释性与安全性。
商业价值
- 降低开发成本:论文提出的自动化流程将具身视频转化为文本-视觉规划监督,大幅减少人工标注数据依赖,尤其对长尾操作场景,可加速新任务的部署。
- 提升系统泛化:通过联合文本推理与视觉想象,RxBrain 能在未见过的环境中复用抽象规划知识,减少对特定场景微调的需要,直接降低机器人产品迭代开销。
- 体验升级:在人机交互中,机器人不仅能执行,还能以自然语言解释计划并通过视觉想象预览最终状态,增强用户信任,这对家用、导购、协作机器人等ToC场景至关重要。
与现有产品/工作流的接口
- 集成方式:RxBrain 可作为一个多模态规划模块嵌入经典机器人软件栈(如 ROS 2 节点),接收语言指令与 RGB 相机输入,输出结构化的 Planning Sequence(包含文本步骤、视觉子目标和约束)给下游的 reinforcement learning 或模型预测控制器。
- 与现有具身模型互补:相比专注于场景理解的 VLM(如 GPT-4V)或纯视频预测的世界模型,RxBrain 的联合规划序列更容易被传统规划系统(如 PDDL-based planner)消化,因为其文本部分相当于一个符号化计划骨架。
- 数据管线适配:其训练所需的文本-视觉对齐监督,可通过已有的记录-回放系统或仿真平台(如 NVIDIA Isaac Sim)批量生成,无需大幅改造现有数据采集流程。
具体落地用例
- 电商仓储拣选机器人:某“货到人”系统每天处理数千 SKU 的订单。机器人接收“取两罐A牌可乐和一个B牌纸巾”的语音指令,RxBrain 规划:
【文本】移动到3号货架 → 识别可乐 → 机械臂抓取 → 转向纸巾区,同时输出货架图像中的目标位置、抓取关键帧等视觉子目标,底层控制器据此生成连续动作。新类型的商品外观只需少量示例,泛化成本低。 - 智能工厂装配线:柔性生产线需频繁切换产品型号。操作员用自然语言描述新工序(如“将轴承压入左侧通孔”),RxBrain 生成操作步骤与各阶段的工件状态图像,直接指导机械臂序列,并将视觉预测用于非接触式过程监控,异常时可提前中止并请求人工介入。
局限
- **监督信号依赖自动管道**: 论文构建的自动 pipeline 将具身视频分解为规划步骤并与视觉状态转换对齐,其质量直接影响训练监督的可靠性。当视频动作粒度模糊、场景语义复杂或任务分解存在歧义时,生成的文本-视觉规划监督可能引入噪声或错误对齐,导致模型学习到次优的规划表示。该局限在论文中未被充分量化分析,缺乏对 pipeline 错误率及其对下游性能影响的系统评估,从而削弱了方法在开放环境中的可复现性和鲁棒性。
- **计算开销与实时性约束**: RxBrain 采用统一多模态混合 Transformer 架构,同时支持语言、图像和视频的理解与生成,模型参数量和推理延迟显著高于专注于单一模态的具身模型。这使其难以直接部署在算力受限的具身设备(如小型机器人)上,可能无法满足实时闭环控制需求。论文仅展示了离线规划和 few-shot 动作生成,未提供推理延迟或资源占用的基准数据,与轻量级世界模型或端到端动作策略相比,在工程落地层面存在明显劣势。
- **与机器人基础模型的差距**: 与 RT-2、Octo 等直接在大规模跨机器人数据上预训练的动作生成模型不同,RxBrain 侧重规划而未充分融入连续动作空间的大规模预训练,导致在需要精细动作控制的任务中性能受限。其 real-robot 实验仅覆盖少量简单场景,缺乏多任务、多平台泛化验证,难以证明该方法能像现有机器人基础模型一样快速适应新任务。此外,RxBrain-Bench 作为专属评测基准,尚未经过社区广泛检验,其评测维度的完备性与真实性还有待外部验证。