衡量机器人策略中的语言迁移:为 Cosmos3 Vision-Language-Action 策略加入希腊语
机器人基础模型主要以英语训练和评估,且大多数语言并不存在机器人演示语料。我们研究在不做架构改动、仅使用机器改写指令的条件下,向开放的 Vision-Language-Action 栈中加入希腊语。 主要挑战在于测量,而非翻译。多种看似合理的指标会给出错误结论:颜色直方图指标会奖励噪声;单目标基准 在正确希腊语下得分 84.6%,在故意给出错误指令时仍有 82.6%;训练损失无法预测希腊语成功率;单次运行的对比则被种子波动主导。 在带三个种子的九十个任务判别式套件上,不含希腊语演示的 多语言文本塔 始终停留在其错误指令的下限,而仅希腊语训练最多只超出对照 2.7 个点。双语训练 相对其对照稳定领先 6.7-7.1 个点,并达到英语性能的约五分之二。策略还会过拟合译者的措辞,每个任务用七种措辞训练可将该惩罚大约减半。以 语言自适应世界模型 热启动、以及解冻文本塔,都会降低性能。 结果表明,低资源机器人策略本地化有两个实际要求:在信任某个指标之前,先建立一个有保证的零假设;并在多个种子间复现低资源语言的结果。
论文精读
TL;DR 研究向 Cosmos3 VLA 策略添加希腊语时的评估陷阱:常用指标误报成功,双语训练稳定提升但仅达英语四成,凸显低资源语言本地化中可靠基准与多种子验证的必要性。
问题
问题背景
机器人基础模型(如 Vision-Language-Action, VLA) 的训练与评估几乎全部基于英语,非英语语言的指令跟随与迁移能力成为当前机器人学习领域的关注点。
现有方法局限
现有评估工具常给出不可靠信号:
- 单目标基准在故意错误的希腊语指令下仍得到 82.6% 准确率,与正确指令的 84.6% 几乎无法区分;
- 训练损失在多个策略间差异不足 1.4%,但实际希腊语能力跨度达 7.2 倍;
- 颜色直方图度量对纯噪声生成给出高分;
- 单次运行比较被随机种子主导,目标语言成功率波动 31.6 点。
这些方法缺乏判别性协议 和多种子对照,无法区分真正的语言迁移与表面性能波动。
为什么这个问题难/重要
低资源语言没有机器人演示语料,只能依赖机器改写指令,但翻译措辞引入系统性偏差,模型容易过拟合。测量语言条件能力需要构造保证零假设 (如错误指令下限) 来归因,而构建这一基线本身就有挑战。业界对多语言机器人部署与可复现研究投入增加,若评估工具虚假正面,将误导研究资源和模型选择。
行业类比
类似多语言语音助手的意图理解,在标准评测集上得分高,但更换措辞或注入错误指令时仍可能误判,需要对抗性测试暴露表面泛化。
核心洞察
- 评估机器人策略的语言迁移时,测量比翻译本身更难:常见指标(颜色直方图、单目标基准、训练损失、单次运行对比)都会在完全没有语言理解的情况下给出虚假的高分。这独特地揭示了现有评估协议对语言条件作用不敏感,例如故意错误指令仍能获得 82.6% 的单目标成功率,且目标语言成功率随随机种子波动高达 31.6 点,而英语仅波动 1.0 点。这要求低资源语言本地化必须构建一个保证无效的对照基线,并在多个种子上重复实验,否则任何结论都不可信。
- 双语训练(混合英语与机器翻译的希腊语指令)是低成本提升低资源语言性能的有效策略:比仅用希腊语训练的控制组高 6.7–7.1 个百分点,但仅达到英语性能的五分之二。其独特之处在于量化了机器翻译带来的过拟合:策略会记忆翻译器的特定措辞,而使用每任务七种不同措辞训练可减轻约一半的惩罚。这与多数多语言迁移研究忽略翻译器偏差的现状形成对比,提示在低资源场景下应增加指令的措辞多样性,而非单纯扩大数据量。
方法
输入与数据准备
- 源数据为英语机器人指令,通过机器改写并结合强制术语表生成希腊语指令,无人工作文本。
- 视觉观察来自机器人环境,模型输入为视觉+语言指令。
关键模块与训练流程
- 模型堆栈:基于 Cosmos3 的 vision-language-action (VLA) 策略,包含视觉编码器、多语言文本塔、动作预测头,架构不做改动。
- 分两阶段研究:Study 1 先本地化世界模型,通过监督微调(SFT)使世界模型适应希腊语;Study 2 考察策略是否真正读取语言,对比不同训练配置:
- 希腊语单语训练(仅机器改写指令)
- 双语训练(英语+希腊语混合采样)
- 多措辞训练(每任务 7 种希腊措辞)
- 从语言适应的世界模型热启动、解冻文本塔等变体
- 输出:策略根据视觉和指令生成机器人动作。
评估协议与统计处理
- 设计判别性九十任务套件,每个任务包含正确希腊指令和故意错误的指令对照。
- 以正确指令下的成功率与错误指令对照的边际作为语言迁移核心指标,每个实验臂重复 3 个随机种子并做统计检验。
- 发现单一指标(颜色直方图、单目标基准、训练损失)会产生伪成功,必须依赖对照和多种子。
核心发现:双语训练产生 6.7–7.1 点的一致优势,但仅达英语性能的约 2/5;单语希腊语训练未超过其错误指令对照。
与同类方法差异
- 与常见“直接翻译指令后微调”的做法不同,本文重心不在翻译或架构,而是建立可证伪的测量协议,通过错误指令对照和多种子重复排除伪成功。
实验
实验设计
该研究基于 Cosmos3 VLA 模型,用机器改写生成希腊语指令,不修改架构。评估从常见单一目标基准扩展到 90 任务判别式协议,每个配方用 3 个随机种子 重复,以控制种子波动。
关键发现
- 单一目标基准在正确希腊语 84.6% 与故意错误指令 82.6% 之间几乎无区分度;彩色直方图指标对纯噪声也可翻倍。
- 双语训练(英文+希腊文)相对对照获得 6.7–7.1 点 的稳定优势,达到英文性能约 2/5;仅希腊文训练最多比对照高 2.7 点,未远离错误指令地板。
- 训练损失在六项策略间仅差 1.4%,但希腊语能力跨度达 7.2 倍;希腊语成功分数随种子波动 31.6 点,英文仅 1.0 点。
基线对比解读
相比纯希腊语训练,双语配方在保持英文能力的同时更好地整合希腊语知识,说明跨语言共享有助于低资源语言迁移;但结果仍远低于英文水平,且策略对翻译器措辞过拟合,使用多种措辞可显著降低惩罚。此类结果提示评估必须包含错误指令 null 对照与多种子复现。
行业影响
落地场景
该研究为低资源语言的机器人策略部署提供了路径验证。典型场景包括:
- 多语言服务机器人:酒店、医院、零售等场景中,机器人需理解非英语用户的自然语言指令(如希腊语、泰语等)。通过机器翻译生成训练数据即可快速扩展语言支持,无需人工演示。
- 工业协作机器人:在跨国工厂或多语言劳动力环境中,工人用母语下达操作指令。论文中的双语训练方法可让现有 VLA 模型保留英语能力的同时获得新语言。
举例:电商仓储 AMR 收到希腊语“把蓝色箱子放到 A 区”后能正确执行,而此前只能靠英语或关键词映射。
商业价值
- 降本:采用机器翻译指令替代人工翻译与演示收集,单语言本地化成本可降低一个数量级。
- 风控:论文揭示的五种假阳性评估(如子目标失真、单次运行种子漂移)可帮助团队避免将噪声当成效,防止上线后事故。
- 增收:支持更多语言可打开此前无法覆盖的客户群,尤其在多语言地区或出口型机器人产品中。
与现有产品/工作流的接口
现有 VLA 模型微调流程(如 OpenVLA、Cosmos3 方案)可直接集成:
- 在数据管线中加入机器翻译 + 措辞多样性增强(每任务至少 7 种说法)步骤。
- 评估环节替换为判别式基准(多任务、多子目标、多种子),而非传统单目标 accuracy。
- 训练时保持文本塔冻结,避免从语言适配世界模型热启动(论文发现会降性能)。
- 对所有低资源语言结果进行 3 种子对照,报告均值与标准差,而非单次运行。
这套方法可作为多语言机器人策略开发的标准模板,可嵌入 MLOps 平台(如 W&B、Kubeflow)自动生成评估报告。
局限
- **实验范围狭窄**:仅研究英语到希腊语这一对语言,且所有指令由机器翻译生成,缺少真实人类编写的语言多样性;实验在单一模拟基准(九十任务套件)上进行,未在真实机器人上验证。样本规模较小(每个配方仅三个随机种子),虽然论文强调跨种子复制的重要性,但结论的普适性仍需更大规模实验确认。
- **模型适配局限**:结论基于特定的 Cosmos3 视觉-语言-动作堆栈,文本塔冻结/解冻的负迁移发现可能不适用于其他架构;双语训练提升幅度有限(仅达到英语性能约五分之二),距离实用仍有较大差距;对翻译者措辞的过拟合问题即便增加措辞多样性也只能减半惩罚,未能完全解决。
- **与同类工作对比**:相比多语言 VLA 或跨语言迁移的前沿工作,本文主要贡献在于测量与评估协议,缺乏模型层面的创新(如新型适配器或训练策略);未探索更先进的多语言文本编码器(如 mT5、XLM-R)或大规模多语言预训练模型的直接迁移效果,可能低估了低资源语言的上限。