LARYBench 发布:定义具身动作表征的 ImageNet,首次度量从人类视频学习的泛化表征
LARYBench 揭示:通用视觉模型无需机器人数据,即可从人类视频中学到通用的动作表征,效果优于专用模型。
LARYBench 是一个系统性评测基准,旨在衡量从人类视频中学到的隐式动作表征(模型内部对动作的抽象表示)是否通用。实验发现,通用视觉模型(如 CLIP)在动作泛化和控制精度上远超专门为具身智能设计的动作专家模型,表明通用动作表征可从大规模人类视频中自然涌现,无需机器人数据。
正文摘录
LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征 如果你看过今年春晚武术节目《武BOT》,一定会对那群与人类武者同台对打的机器人印象深刻。但在流畅的武术动作背后,是一个工程师团队连续数周针对特定舞台、特定灯光反复调试后才可能达到的动作丝滑。 为什么机器人在固定场景下表现良好,但换一个环境、任务,泛化能力就会明显下降? 究其根源,是具身行业缺少带动作标注的训练数据进行泛化学习,而互联网上大规模人类数据是极具潜力的数据来源。为了指引具身智能走向 GPT 时刻,像大模型一样走通大规模数据学习范式,通过人类视频数据学习通用的、跨本体的隐式动作表征是关键。 为此,我们提出了 LARYBench (Latent Action Representation Yielding Benchmark) ,一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。 实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。 01 背景: 缺一把从视频到动作的标尺 当前主流的 Vision-Language-Action(VLA)模型,其泛化能力受限于一个核心矛盾:互联网上存在海量的人类视频,视觉信号极其丰富,但如何将这些视觉信息转化为机器人可用的动作表征,始终缺少高效的路径。具体表现为三个层面: - 数据瓶颈 :带精确动作标注的机器人数据依赖遥操作采集,成本高、规模小;而人类视频虽体量庞大,却天然缺失机器人可执行的动作标签,画面与动作之间存在模态断层。 - 表征瓶颈 :即便从人类视频中提取信息,传统做法输出的本体动作数据高度绑定特定硬件,难以跨形态迁移。