腾讯发布具身VLM与RxBrain基座模型,已开源
腾讯开源两款具身大模型:VLM理解现实、规划动作;RxBrain想象未来状态,协同赋能机器人智能。
腾讯发布两款具身智能基座模型:Hy-Embodied-VLM-1.0 和 Hy-Embodied-RxBrain-1.0。前者让机器人“看懂”物理世界并规划动作,后者结合推理与想象预测状态。两者均已开源,为机器人开发提供新基础。
正文摘录
.jpg) 7 月 15 日,腾讯 Robotics X 实验室与福田实验室联合腾讯混元发布两款具身智能基座模型 —— 具身 VLM 基座模型 Hy-Embodied-VLM-1.0 以及具身世界认知基座模型 Hy-Embodied-RxBrain-1.0。两个模型旨在让机器人的 "大脑" 既能 "看懂" 现实世界,也能同时进行推理和想象。 Hy-Embodied-VLM-1.0 是腾讯的第二代具身 VLM(视觉语言模型,即能同时理解视觉和语言信息的模型)基座模型,从物理空间状态理解、动作-变化理解、时序和自适应推理三个层次构建能力维度,增强了场景感知、行动分析规划、导航等面向具身 agent(具身智能体,指能与环境交互的机器人)的多模态理解能力。新版本基于混元 A3B 基座开发,通过增训大规模具身数据,在扩充的 37 个评测任务上以 1/10 的计算量达到了与上一代 A32B 旗舰模型相当的效果,为高性能端侧模型提供了新基座。 Hy-Embodied-RxBrain-1.0 是一个具身世界认知基座模型,对世界理解、推理规划、行动后果预测等进行统一建模。它基于 Hy-Embodied-VLM 基座,使用 5 万小时以上高质量具身数据训练,在一个模型中实现文本、图像、视频以及图文交错的统一理解与生成。该模型将具身认知推理、行动规划和目标状态想象转化为更清晰、更稠密的多模态条件(Condition),为下游动作模型提供高层指导。在同尺寸模型中形成差异化领先能力,为具身 agent 的上层认知决策和下游动作生成提供了新基础模型。