面壁开源 1.5B 参数 VLA 模型 MiniCPM-Robot,称第一梯队表现
面壁智能发布两款小参数 VLA 模型,兼顾性能与实时性,并开源推理框架加速落地。
面壁智能发布并开源了 MiniCPM-Robot 系列,包含两款模型:1.5B 参数的 MiniCPM-RobotManip 负责机械臂操作,0.9B 参数的 MiniCPM-RobotTrack 负责机器狗目标跟踪。在主流评测中整体进入第一梯队,推理速度约为同类的一半。同时开源了具身智能推理框架 PhyAI,可在 RTX 5090 上实现 2 倍以上加速。
正文摘录
视频地址: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw 在上面这个真机演示里,两只机械臂围着桌面开始做三明治。它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。 视频地址: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw 从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。 电梯和地下停车场往往是网络信号比较差的地方。即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。 而在这两段 Demo 背后,则是 面壁智能 在 WAIC 期间正式发布并开源的 MiniCPM-Robot 系列 模型。 和它们一起出现的,还有开源具身智能推理框架 PhyAI ,负责让这些模型更快地适配硬件、跑到真实机器人上。 简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。 虽然参数量只有 1.5B,但在 LIBERO、Calvin、RoboTwin2 等主流 VLA 评测里,它的整体表现已经进入第一梯队,与 π0.5 等模型处在相近水平。 如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。 MiniCPM-RobotManip 会把历史观测和此前执行过的动作一起纳入判断。它知道任务已经进行到哪一步,也知道什么时候应该停下来。 在专门考察上下文记忆的 RMBench 中,π0.5 的成绩约为 10 分,接近随机水平,MiniCPM-RobotManip 则达到约 53 分。 叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。机器人只看眼前,很容易做到一半便“失忆”;