华中科技大学联合华为提出 TurboVLA:绕过大语言模型,以 0.2B 参数实现 32Hz 在线动作预测
TurboVLA 证明明确指令下动作预测无需每次运行大语言模型,用 0.2B 参数实现更高成功率与三倍速度。
现有机器人视觉-语言-动作模型(VLA,将视觉、语言与动作控制结合在一起的模型)通常依赖大语言模型融合信息,导致动作预测慢。TurboVLA 让视觉与语言特征直接交互,跳过 LLM,仅 0.2B 参数就在 RTX 4090 上达到约 32Hz 的在线动作预测,平均成功率 97.7%。
正文摘录
.jpg)  共同第一作者:谢亨义,姚晨飞,来自华中科技大学,研究方向为 3D 视觉。 Project Lead: 梁定康,华中科技大学计算机学院青年教师,研究方向包括自动驾驶,具身智能等。 近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出: 模型越来越大、语义能力越来越强,动作更新却未必足够快。 目前,大量 VLA 模型将大语言模型置于视觉感知和动作预测的中心。每次预测动作时,视觉观测都要先进入数十亿参数的语言主干,与语言指令完成融合后,才能进一步生成机器人动作。这不仅带来了显著的计算和显存开销,也意味着:即使模型采用连续动作专家或并行动作解码器,前面的语言模型依然需要完整运行,难以从根本上消除延迟。 这引出了一个核心问题: 对于已经给出明确操作指令的机器人任务,每次动作预测都必须运行一个大语言模型吗? 近期,华中科技大学团队联合华为提出实时视觉 — 语言 — 动作模型 TurboVLA。现有 VLA 通常将大语言模型作为视觉到动作的中间接口:视觉观测先与语言指令在大语言模型中完成融合,再基于得到的多模态表示生成机器人动作,即形成一条 V→L→A 的处理路径。