LabVLA: 在科学实验室中落地视觉-语言-动作模型
科学实验室日益依赖AI系统进行实验推理,但物理操作仍主要由人类完成。Vision-Language-Action (VLA) 模型为书面协议与机器人执行之间提供了接口,但现有策略多基于家庭和桌面演示训练,很少涉及实验室中的仪器、透明液体或固定协议流程。 为弥补这一差距,我们聚焦数据和具身两大瓶颈。数据方面,构建 RoboGenesis 仿真工作流与数据引擎,从原子技能组合可配置实验室流程,验证并筛选执行结果,导出结构化演示。策略方面,提出 LabVLA 模型,采用两阶段训练:先通过 FAST 动作标记预训练使 Qwen3-VL-4B-Instruct 主干具备动作感知能力,再用流匹配后训练附加 DiT 动作专家并实现知识隔离。 在 LabUtopia 基准上,LabVLA 在分布内和分布外设置下均取得最高平均成功率,超越所有对比基线。
论文精读
TL;DR LabVLA 通过 RoboGenesis 模拟数据引擎与 FAST token 预训练+流匹配两阶段训练,将 VLA 模型泛化至科学实验室场景,在 LabUtopia 基准显著超越基线,解决实验室操作的数据与多实施挑战。
问题
问题背景
科学实验自动化正从纯软件推理走向物理执行,Vision-Language-Action (VLA) 模型被视为连接协议文本与机器人操作的关键桥梁。然而,现有 VLA 策略几乎全部基于家居、桌面等消费级场景训练,直接部署到实验室时面临严重环境错配。
现有方法的局限
- 数据分布窄:主流 VLA(如 RT-2、OpenVLA)依赖的示教数据缺乏透明液体、微量试剂、精密仪器等实验室特有物体,导致视觉感知失效。
- 协议流程僵硬:实验室操作要求遵循固定规程(如移液、离心、温控),现有模型难以捕捉长程时序约束与严格顺序,易产生不安全动作。
- 跨本体泛化弱:不同机器人(单臂、双臂、移动底盘等)的观测-动作空间差异大,现有方法通常为单一本体定制,缺乏统一学习框架来适配多样硬件。
- 训练效率低:从零训练大型 VLA 成本极高,而预训练视觉语言模型(VLM)直接用于动作预测时,其映射头对连续控制信号敏感,容易遗忘原有语义。
为什么难且重要
实验室自动化涉及高精度操作、昂贵耗材与潜在安全风险,对模型可靠性的要求远超消费级任务。真实世界收集示范数据代价极大,且难以覆盖边缘案例。仿真环境虽能低成本生成数据,但需同时保证物理保真度、协议多样性与知识隔离(避免微调破坏基座常识)。业界将“科研自动化”视为通用人工智能落地的标志性场景,Nature、AAAI 等顶刊/会持续推动该方向,但缺乏公认的基准与系统化解决方案。
行业类比
类似于自动驾驶需要数以万计的场景仿真来训练感知与规划,实验室 VLA 也需要通过程序化生成的多模块、多流程仿真数据,才能获得足够的视觉多样性与任务泛化性。
核心洞察
- **知识绝缘 (Knowledge Insulation)** 训练策略通过分离 VLM 主干与 DiT 动作专家的更新管道,在维持通用视觉语言理解的同时高效注入连续控制能力。这与常见微调整个 VLM 导致语言退化或完全冻结 VLM 仅训练动作头导致控制欠拟合的思路截然不同:LabVLA 先通过 FAST 动作 token 预训练唤醒 VLM 的动作感知,再以 flow matching 独立训练 DiT 专家,梯度不回流至 VLM,从而在 LabUtopia 基准的分布内与分布外场景下均显著优于端到端微调的 RT-2 及冻结 VLM 的 Octo 等基线,为多具身实验室策略的泛化性与稳健性提供了一个可复现的训练范式。
- **RoboGenesis 数据引擎** 将实验室工作流抽象为原子技能的组合,通过程序化场景构建与验证式 rollout 过滤,批量生成跨机器人构型的结构化演示数据。与面向家务的模拟器 (如 Habitat、MimicGen) 不同,RoboGenesis 直接建模实验室特有要素——透明器皿、精密仪器、固定协议序列——并内建多元域随机化与失效检测,从而产出的 LabEmbodied-Data 不再是零散的桌面操作记录,而是覆盖多具身、多任务的实验室技能图谱,使 VLA 策略能够在无真实实验室采集成本的条件下习得协议级执行能力,大幅降低了“具身 AI for Science”的工程门槛。
方法
LabVLA 的方法核心由两部分构成:RoboGenesis 数据引擎 与 两阶段训练范式,旨在解决实验室自动化中数据匮乏与多 embodiment 适应难题。
输入 → 关键模块 → 输出
1. 数据生成:RoboGenesis
- 输入:可编程的实验室工作流描述(protocol)与机器人配置文件。
- 基于原子技能库将高层 protocol 分解为可执行的原子动作序列;通过仿真环境自动构建场景、域随机化,执行 rollout 并过滤无效轨迹,最终导出结构化的跨 embodiment 演示数据(LabEmbodied-Data)。
- 输出:带视觉观察、语言指令、动作标签的多机器人数据集,覆盖透明液体、科学仪器等实验室特有视觉域。
2. 模型训练:两阶段配方
- 阶段一:FAST 动作 token 预训练
以Qwen3-VL-4B-Instruct为骨干,将连续动作离散化为特殊的 FAST tokens 注入 VLM 词表。仅优化动作 token 相关参数,使模型先获得动作感知能力,无需学习连续控制信号。 - 阶段二:Flow Matching 后训练
在冻结 VLM 主干下附加一个 DiT 动作专家,通过 flow matching 学习动作分布。同时引入知识绝缘(knowledge insulation)策略,防止连续控制训练破坏 VLM 原本的视觉语言知识。 - 推理时,模型接收视觉观察与语言指令,DiT 专家基于 VLM 的上下文表示生成连续动作序列。
输出: 可直接部署到不同实验室机器人的端到端 VLA 策略,实现从 protocol 到物理执行的闭环。
该方法与多数面向家居或桌面操作的 VLA 不同之处在于:通过仿真数据引擎与 embodiment 无关的动作 token 预训练,低成本获得实验室领域的多机器人泛化能力,而非依赖昂贵的人工采集或单一 embodiment 微调。
实验
实验设计
基于 RoboGenesis 数据引擎生成的 LabEmbodied-Data 数据集,所有模型在 LabUtopia 基准上进行评估。该基准覆盖多个实验室工作流程,包含分布内(ID)与分布外(OOD)两种设置,以测试对未见任务与机器人形态的泛化能力。LabVLA 采用两阶段训练:先以 FAST action token 预训练注入动作意识,再通过 flow matching 后训练附加 DiT 动作专家,并借助知识隔离保护视觉主干。
关键发现
实验表明,LabVLA 在 ID 和 OOD 设定下均取得最高的平均成功率,显著超越现有 VLA 基线。其优势在于:
- 能有效处理透明液体、精密仪器等实验室特有物体;
- 适应严格的协议步骤,而基线常因缺乏领域监督出现混乱操作;
- 两阶段训练中,FAST 预训练使大语言模型理解连续动作语义,flow matching 则提升了动作生成的多样性与精度。
基线对比
对比的 VLA 模型多基于家务或桌面操作训练,难以应对实验室的固定流程与复杂物体。例如,RT-2 等通用策略常将移液管视为普通抓手,导致操作失败。LabVLA 通过 RoboGenesis 的定向数据合成和跨机器人形态适配,弥补了这一断层。此外,消融实验证实:移除 flow matching 会导致动作抖动增加,而去掉 FAST 预训练则使成功率大幅下降。这表明面向特定场景的数据与训练配方是机器人科学自动化的关键推手。
行业影响
落地场景
LabVLA 瞄准科学实验室自动化,可直接嵌入制药、生物科技、材料化学等企业的研发流程。典型应用包括:机器人自动执行移液、混合、离心等标准操作,根据视觉反馈(如液体颜色、透明度)实时调整动作;处理长周期、高重复性的实验步骤,释放科研人员精力用于方案设计。
商业价值
- 降低重复人工成本:现有实验室大多依赖人工操作,机器人代理可 7×24 运行,将操作员从重复劳动中解放,转向高价值决策,直接减少人力开支。
- 加速研发周期:自动化执行能显著提升实验通量,缩短试剂筛选、配方优化等环节所需时间,从而加快药物或材料上市速度,间接带来增收效应。
- 提升实验一致性与安全性:通过标准化的视觉-语言-动作策略执行协议,降低人为操作偏差带来的失败风险,对处理危险或精密物质的场景尤为关键。
与现有产品/工作流的集成
LabVLA 以通用 VLA 模型形态输出,可对接实验室已有的 LIMS/电子实验记录本(ELN) 系统。工作流层面:
- 上游由协议生成模块(如基于 LLM 的协议规划器)产出文本指令。
- 模型接收指令与视觉流,输出末端执行器位姿等动作向量,通过 ROS 或厂商 SDK(如 Opentrons、Hamilton)驱动机械臂/移液工作站。
- 训练阶段利用 RoboGenesis 模拟器生成跨具身数据,实际部署时可针对具体机器人微调 flow matching 专家模块,适配不同硬件。
具体落地 Use Cases
- 药物发现高通量筛选:大型药企利用自动化实验站进行数百万化合物库的活性测试。LabVLA 可替代人工观看亚微升级移液与板处理操作,通过视觉监控液面高度、气泡等异常并自适应修正动作,避免批间误差,将每日筛选通量提升 3-5 倍,且全程记录结构化数据以便追溯。
- 新能源材料加速合成:材料公司搭建自动化合成平台,机器人按协议混合前驱体溶液并加热搅拌。LabVLA 根据摄像头捕捉的溶液颜色渐变判断反应进程,动态调节搅拌速度或温度,无需人工干预,将数百组并行实验的资源占用降至最低,显著缩短新电解质或催化剂配方的发现周期。
局限
- 训练数据完全来自仿真引擎 **RoboGenesis**,尽管引入了资产生成管线与域随机化,但 **sim-to-real gap** 尚未根本解决。真实实验(§5.2)仅验证了单一技能的迁移,未覆盖完整实验协议,无法充分评估模型对真实仪器误差、动态光照、容器差异和意外干扰的鲁棒性,这延缓了从“在环演示”走向“可靠替代人类操作员”的步伐。
- 模型以 **Qwen3-VL-4B-Instruct** 为 VLM 主干,规模较小,可能难以捕捉透明液体状态、细微颜色变化等实验室关键视觉信号,且对长程实验流程的时序建模有限。两阶段训练中 **knowledge insulation** 策略虽保护了 VLM 预训练知识,但也可能阻断了多模态常识在动作决策中的自然融合,在需要跨领域物理推理的场景中可能性能不足。
- LabVLA 在 **LabUtopia** 基准上达到 SOTA,但该基准场景和任务覆盖范围仍偏窄,模型高度面向科学实验室设计的 **FAST token** 与 **flow matching** 训练方法是否适用于其他机器人环境(如家庭服务、工业装配)尚不明确。与 **RT-2**、**Octo** 等通用 VLA 相比,其跨具身、跨场景的迁移能力缺少系统验证,这限制了它作为通用 VLA 框架的参考价值。