AXIS 基准:5 万条众源轨迹可训练机器人,收益取决于任务覆盖与多样性
机器人数据众包可行,但需任务多样性和数据清洗才能让模型随数据量变强。
网页众源仿真(让普通人通过浏览器远程操作机械臂采集数据)能否训练机器人模型?AXIS 基准用 5 万条轨迹回答:有效,但收益取决于任务覆盖、行为多样性与数据清洗,而非单纯堆积数量。
正文摘录
.jpg)  打开浏览器,屏幕里是一台 Franka Research 3 机械臂。参与者不需要拥有真实机器人,也不必在本地安装复杂的仿真环境,只需使用键盘、鼠标或手柄,就能控制机械臂完成抓取、堆叠、倾倒和工具使用。一次操作结束,一条人类演示轨迹也随之产生。 这就是 AXIS 的数据采集入口。但问题很快出现:来自不同参与者的网页遥操作数据,难免包含停顿、抖动甚至错误。这样的众源仿真轨迹,真的能用来训练机器人基础模型吗? Axis Robotics 与佐治亚理工、加州大学伯克利分校、南洋理工等高校团队通过超过 5 万条人类演示和一组规模实验,给出了一个肯定但更复杂的答案: 众源仿真数据可以有效,但模型能否从数据规模中持续获益,取决于任务覆盖、行为多样性、质量控制和数据增强,而不只是轨迹数量。 这也是 AXIS 背后的核心观点:机器人行业需要的不只是一个更大的静态数据集,而是一套能够持续生成、验证、扩展和评估数据的基础设施。