行业新闻

StarVLA发布VLAct:16卡训练超越GR00T N1.6等模型

VLAct用16卡和开源数据训练出强泛化VLA底座,证明数据效率比单纯堆数据更重要。

机器人VLA(视觉-语言-动作模型)通常依赖海量数据,StarVLA团队推出的VLAct却只用16张GPU和开源数据,让每条轨迹学得更值。它通过多动作头联合训练避免表征坍缩,提升跨任务、跨机器人迁移能力,在RoboDojo等榜单上超过WAM模型,且全部开源。

正文摘录

- title: 20% 数据超 GR00T N1.6、RoboDojo 超 WAM!StarVLA 只用 16 卡训出全新 VLA! - sourcecompany: 机器之心 - bodymarkdown: ![](https://image.jiqizhixin.com/uploads/article/coverimage/7faf2c8d-5ec8-4bbe-b89f-0040b8e1bef7/017(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上: 除了继续 scale 数据以外,能不能让每一条数据都学得更值? 他们最新发布了面向 VLA 的 VLM 底座 VLAct 。 VLAct 的整个 continued pre-training 只使用开源数据和 16 张 GPU ,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5% ;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20% 的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也 全部开源 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-06原文

相关内容