论文

RynnBrain 1.1: 迈向更强大和更通用的具身基础模型

RynnBrain 1.1: 迈向更强大和更通用的具身基础模型

我们提出 RynnBrain 1.1 ,一系列具身基础模型,涵盖 2B 、 9B 和 122B-A10B 规模。通过 统一时空和物理基础框架 训练,模型支持具身感知、空间推理、定位和规划。相比 1.0 版本,新模型引入 接触点预测 (跨模型家族)和 原生 3D 定位 (2B/9B 模型),使表征和输出更直接对齐机器人操作。 我们开发 RynnBrain-VLA ,具备统一跨具身动作空间和具身特定掩码,部署在 Unitree G1、Astribot-S1 和天机无极上。在 VSI-Bench 、 MMSI 和 RefSpatial-Bench 上,122B-A10B 模型超越所有评估的专有和开源模型。真实机器人实验表明:RynnBrain 初始化的策略优于基于 Qwen 的和代表性通用 VLA;联合多任务和多具身训练相比单任务训练提升过程分数和成功率。

论文精读

TL;DR RynnBrain 1.1 系列具身基础模型新增接触点预测与原生 3D 定位,其跨具身 VLA 策略在多个真实机器人上超越现有模型,并在多项认知与定位基准上达到 SOTA。

问题

问题背景

具身智能领域正从孤立的任务型开发转向构建通用具身基础模型,要求模型不仅能理解视觉语言,还能在物理世界中进行空间推理、定位、规划并直接输出操控动作,实现从感知到执行的统一。

现有方法局限

早期模型(如 RynnBrain 1.0)虽已具备一定的时空理解和物理推理能力,但仍存在三个关键断层:

  • 物理接触建模缺失:模型输出往往是语言描述或检测框,无法直接预测末端执行器与物体的接触点,导致操控规划需依赖额外后处理,效率与精度受限。
  • 小尺寸模型的 3D 接地缺失:只有大规模模型具备 3D 空间定位能力,而部署端常用的轻量模型(如 2B、9B 参数级)无法输出精确的 3D 坐标或点云,难以满足实时闭环控制需求。
  • 跨形态动作泛化薄弱:不同机器人形态(双足、单臂、轮式)的动作空间差异巨大,现有 VLA 模型通常针对单一形态训练,无法将认知能力无缝迁移至多形态硬件,限制了模型通用性。

为什么这个问题难/重要

具身模型需同时融合时空表征(视频帧序列理解)、物理接地(接触、力、几何约束)与多形态动作解码,对模型架构和数据配方提出极高要求。物理世界的长尾分布和实时控制需求使单纯扩大模型规模并非有效解法,如何在有限参数内注入物理先验、实现高效跨形态泛化成为核心挑战。这一问题受到业界高度关注,其突破将直接推动通用服务机器人从实验室走向现实部署,是迈向 AGI 的关键试金石。

行业类比

如同 Stable Diffusion 让图像生成从研究进入产品化,具身基础模型一旦解决物理接地与多形态泛化,将使机器人从专用编程转向通用技能迁移,产生类似 AutoML 对传统 ML 工程范式的颠覆性影响。

核心洞察

  • RynnBrain 1.1 通过引入 contact-point prediction 与原生 3D grounding,将模型输出直接对齐到可操作的物理位置,弥补了传统视觉语言模型在机器人操控中高层语义到低层动作的鸿沟。相比仅输出文本或边界框的模型,这种物理接地输出使策略初始化更有效,在真实机器人实验中实现更高的过程得分与成功率。
  • RynnBrain-VLA 采用统一的跨 embodiment 动作空间配合 embodiment-specific masking,实现单一模型在 Unitree G1、Astribot-S1、Tianji-Wuji 三种异构机器人上的零样本或少量微调部署。更关键的是,联合多任务多 embodiment 训练反向提升了各独立任务的成功率,证明跨形态训练不仅是工程便利,更是提升泛化与稳健性的有效手段,这为通用具身基础模型的规模化训练提供了新范式。

方法

模型架构与输入输出流

RynnBrain 1.1 以多模态时序数据(视觉帧、文本指令、机器人本体状态)为输入,通过 统一时空编码器(Unified Spatio-temporal Representation) 将动态感知与历史上下文融合为通用表征。该编码器基于大规模 Transformer,联合处理图像、点云、语言与动作序列,输出一个可复用的 embodied feature。

预训练:物理对齐的多维输出空间

预训练阶段直接建模与机器人操控相关的输出头,构成“感知-推理-定位-规划”一体化 pipeline:

  • 3D 接地定位(Native 3D Grounding):在 2B 和 9B 模型上新增像素级 3D 坐标预测,使表征与真实世界尺度对齐。
  • 接触点预测(Contact Point Prediction):预测机械臂末端与物体的接触区域,为精细操作提供 actionable cue。
  • 物理感知规划(Physics-aware Planning):生成符合物理约束的抓取或放置轨迹。 训练数据涵盖通用 MLLM 语料、多维认知数据、时空定位标注、3D 接地数据、接触点标注及物理规划示例,使模型在预训练阶段即建立强物理直觉。

后训练:统一跨本体 VLA 策略

为适配不同机器人,引入 RynnBrain-VLA 模块:

  • 统一跨本体动作空间(Unified Cross-Embodiment Action Space):将不同机器人的动作抽象为标准化 token,结合 embodiment-specific masking 在推理时动态激活本体相关的动作维度,实现一套权重服务多种形态(如 Unitree G1 双足、Astribot-S1 单臂、Tianji-Wuji 移动平台)。
  • 实时分块推理(Real-Time Chunking,RTC):将未来动作序列编码为块(chunk),平衡规划延迟与执行平滑性。 微调阶段采用多任务多本体联合训练,实验表明该方式相比单任务训练提升过程得分与成功率。

与同类方法差异:相比通用 VLA(如 RT-2、Octo)仅依赖视觉-语言对齐后加动作头,RynnBrain 在预训练阶段原生注入 3D 接地与接触点信号,使表征更直接支撑操控;跨本体泛化不依赖独立模型或适配器,而是通过统一动作空间 + 本体掩蔽在单一模型内完成,具备更强的扩展性与数据效率。

实验

实验设计

RynnBrain 1.1 的评估覆盖标准化具身认知基准和真实机器人任务。评测数据集包括 VSI-BenchMMSI(具身认知)和 RefSpatial-Bench(空间定位),同时测试 3D groundingcontact-point prediction 能力。Scaling 分析探究不同模型规模(2B/9B/122B-A10B)的性能变化。真实机器人部署在 Unitree G1Astribot-S1Tianji-Wuji 三种平台上,采用统一交叉具身动作空间和具身特定掩码,对比单任务微调与多任务多具身联合训练的效果。

关键发现

  • 122B-A10B 模型在 VSI-Bench、MMSI 和 RefSpatial-Bench 上全面超越所有专有和开源基线,验证大规模具身预训练的显著优势。
  • 具身能力遵循非均匀 scaling laws:部分能力随模型增大快速提升,另一些则趋于饱和,具身预训练是维持 scaling 收益的关键。
  • 真实机器人实验中,RynnBrain 初始化的策略在所有任务上优于 Qwen-based 基线和代表性通用 VLA;联合多任务多具身训练进一步提高过程得分与成功率。
  • 引入 contact-point 预测和 3D grounding 使得表征更直接对齐操控需求,提升了跨具身泛化。

与基线对比解读

与依赖通用视觉语言模型(如 Qwen 系列)初始化的方法相比,RynnBrain 的核心差异在于物理对齐的预训练:模型显式输出空间定位、3D 关键点和接触点,而非仅依赖隐式表征。这使动作生成更鲁棒,且能泛化到不同构型的机器人。联合训练实验表明,通过统一的动作空间和具身掩码,知识可在不同平台间高效迁移;小模型(2B)在真实机器人上也能取得可用的成功率,说明具身先验能降低 VLA 对模型容量的需求,为低算力场景的部署提供了可能。

行业影响

落地场景

RynnBrain 1.1 的统一时空-物理基础框架使其成为通用具身智能的基石,主要赋能场景包括:

  • 工业与仓储自动化:如拆码垛、无序分拣、移动操作。
  • 服务机器人:家庭或商用环境的语义导航与桌面操作。
  • 自动驾驶与无人配送:复杂道路下的空间推理与轨迹规划。
  • 遥操作与跨本体迁移:为仿人或新型机器人快速生成控制策略。

商业价值

  • 降本:预训练的具身基础模型大幅减少每个新任务的数据采集与训练开销,避免从零开发。
  • 增收:更泛化的操作能力让机器人能处理更多非结构化工作,扩大可自动化的业务范围。
  • 体验提升:接触点预测和原生 3D 接地使操作更精准、安全,降低碰撞风险,提升可靠性。

与现有产品/工作流的接口

模型提供 2B 到 122B 的多规模版本,可灵活集成:

  • 作为端到端 VLA 直接输出动作,通过适配层与 ROS 等机器人中间件对接。
  • 利用 具身特定掩码 实现单一模型驱动多形态硬件,简化多机型管理。
  • 可与现有 VLM 管线结合,用于特征提取、知识蒸馏或任务规划。

具体落地 use case

  • 电商仓储分拣:模型通过 3D 接地和接触点预测,在无序堆叠中指导机械臂精准抓取,提升对不同 SKU 的适应性,减少人工干预。
  • 自动驾驶施工场景:模型理解临时路障、锥桶等非标准元素,输出未来轨迹或规划路径,帮助决策系统应对长尾路况。

局限

  • **RynnBrain 1.1** 的跨 embodiment 能力仅在 **Unitree G1、Astribot-S1、Tianji-Wuji** 三种机器人平台上验证,虽然采用了统一动作空间与 embodiment 掩码,但面对更极端的硬件差异(如轮式、双足、多指灵巧手)时,泛化界限尚不明确。文中缺少对训练数据中 embodiment 分布的系统分析,也未说明新增硬件时的适配成本,这对实际工程部署构成不确定性。
  • 论文在预训练阶段纳入了 **contact-point 预测** 与 **原生 3D grounding**,但真机实验只展示了 VLA 微调后的性能,并未直接评估预训练表征在操控任务上的 zero-shot 迁移效果。因此,这些新增输出空间的收益主要在微调后体现,其独立贡献和组合增益的消融不够充分,可能限制方法论的可解释性与跨任务迁移的指导价值。
  • 尽管在多个具身认知、定位和 3D 基准上达到 SOTA,但所对比的开源模型列表有限,且缺少与近期涌现的 **具身基础模型**(如 RT-2-X、Octo、OpenVLA 等)的系统性横向对比。此外,大规模模型(122B-A10B)的推理延迟和计算开销未结合作业,对实时性要求高的具身场景,工程可行性仍需进一步论证。
论文Kehan Li2026-07-20原文

相关内容