动态

介绍LARY基准,评估具身智能动作编码器

介绍LARY基准,评估具身智能动作编码器
Meituan LongCat
我们推出了LARY,这是具身智能中通用动作编码器的“ImageNet”基准,首次定量评估潜在动作表示在动作泛化和机器人控制方面的表现。

虽然人类动作视频为视觉-语言-动作(VLA)模型提供了可扩展的数据源,但一个关键挑战在于将视觉信号转换为与本体无关的表示,即潜在动作。为了弥合视觉到动作的鸿沟,LARY应运而生。

不再依赖下游任务成功或聚类可视化。LARY将动作表示质量与策略性能解耦,加速了利用大规模人类视频的进化。

综合数据集:
120万+视频片段(超过1000小时),
62万图像对,
59.5万轨迹,
151个动作类别,
11个机器人平台+人类演示。
涵盖各种数据集,包括自我中心、外部中心、模拟和真实。

统一评估框架:
Track1:高层语义理解——能否泛化到不同动作?(注意力探针→Top-1准确率)
Track2:低层控制映射——能否控制机器人移动?(MLP专家→均方误差)
它衡量从视频中学到的动作是否真正捕捉了智能体在做什么以及机器人应该如何移动。

关键见解:
通用视觉基础模型(例如V-JEPA 2,DINOv3)优于专门的具身潜在动作模型——即使没有动作监督。
基于潜在视觉空间从根本上比基于像素空间更好地与物理动作空间对齐。

这些结果表明,未来的VLA系统可能更多地受益于利用通用视觉表示,而非仅依赖稀缺的机器人数据学习动作空间。

了解更多:
论文:https://github.com/meituan-longcat/LARYBench/blob/main/LARYBench.pdf...
GitHub:https://github.com/meituan-longcat/LARYBench...
Hugging Face:https://huggingface.co/datasets/meituan-longcat/LARYBench...
主页:https://meituan-longcat.github.io/LARYBench
动态Meituan LongCat2026-04-13原文

相关内容