StarVLA发布VLAct:16卡训练超越GR00T N1.6等模型
VLAct用16卡和开源数据训练出强泛化VLA底座,证明数据效率比单纯堆数据更重要。
机器人VLA(视觉-语言-动作模型)通常依赖海量数据,StarVLA团队推出的VLAct却只用16张GPU和开源数据,让每条轨迹学得更值。它通过多动作头联合训练避免表征坍缩,提升跨任务、跨机器人迁移能力,在RoboDojo等榜单上超过WAM模型,且全部开源。
正文摘录
- title: 20% 数据超 GR00T N1.6、RoboDojo 超 WAM!StarVLA 只用 16 卡训出全新 VLA! - sourcecompany: 机器之心 - bodymarkdown: .jpg)  机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上: 除了继续 scale 数据以外,能不能让每一条数据都学得更值? 他们最新发布了面向 VLA 的 VLM 底座 VLAct 。 VLAct 的整个 continued pre-training 只使用开源数据和 16 张 GPU ,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5% ;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20% 的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也 全部开源 。