行业新闻

上海交大团队提出语义重绑定方法,提升VLA指令泛化能力20-40%

本文揭示VLA指令泛化失败源于语言特征偏移而非语义丢失,提出在关键层重绑定语义,简单有效提升20-40%。

VLA(视觉-语言-动作模型,让机器人根据视觉和语言指令执行动作)在指令改写后性能常大幅下降,因其语言理解依赖固定表达。上海交大等团队发现,问题并非任务信息丢失,而是语言特征偏移被动作模块放大。通过在关键层重绑定语言语义,可在不额外训练的情况下显著恢复性能,泛化能力提升20-40%。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/50450611-824e-48d2-bb2b-729a901f7a07/Screenshot2026-08-06at10(2).42.49.png) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。 大部分论文展示的能力都在训练和测试集指令分布一致的数据上刷点,结果哪怕是像 LIBERO 这种现在看起来简单的数据,在简单改写指令后性能都会暴降。如下图所示,vla-adapter 在 LIBERO-para 上性能暴降 51%。对于具身 AGI 来说,这是一个不能接受的问题,我们期待的是一个在各种环境下能听懂人的各种表述形式的任务指令的机器人。 因此,VLA 真正难的,并不是在固定指令模板上再多拿几个点,而是让同一个任务在不同说法下,最终落到同一套机器人动作上。也就是目标物体没有变化、视觉场景没有变化、成功条件也没有变化,只是换了一种语言表达,机器人仍然应该完成原来的任务。 围绕 VLA 语言泛化的问题,来自上海交大和无界动力具身智能实验室的联合团队提出了一项极其简单但非常有效的解法。通过重新设计语言语义进入视觉与动作计算路径的方式,让模型不依赖大量 paraphrase 训练,也能更稳定地执行改写后的指令。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-06原文

相关内容