15 家机构联合发布 TouchScale:500 小时人类视触觉数据集
统一硬件下扩到 500 小时的视触觉数据,做 mid-training 让机器人真机任务成功率从 22.5% 升到 57.5%,第一次看到触觉数据也有 Scaling 收益。
人类拧毛巾、拿鸡蛋靠的是指尖手感,但摄像头只能拍下手部轨迹,拍不到接触位置和力度。此前公开的人类视触觉数据集大多只有几小时到几十小时,且各家传感器和采集流程不统一。15 家机构联合发布 TouchScale:在同一套穿戴设备下采集 500 小时双手视觉-触觉数据。
正文摘录
.jpg)  拿起一枚生鸡蛋,手指需要施加恰到好处的力:既要防止滑落,又不能捏碎。拧一条湿毛巾,指尖的力道也要随着水分挤出不断调整。对人类而言,这些操作几乎出于本能。但如果只依赖视觉,摄像头拍得下手部轨迹,却捕捉不到手指接触的位置与按压的力度。 过去几年,在学术界,第一视角人类视频已经快速扩展到数万小时,越来越多工作也开始看到数据规模增长带来的收益。视觉 — 触觉数据却远没有达到这样的规模:此前公开的人类视触觉数据集大多只有几小时到几十小时。若简单将多个小数据集合并,各家的触觉传感器、采集流程和数据格式又不相同。数据量虽然上去了,硬件和流程也跟着变化,“更多数据” 究竟贡献了多少反而难以单独判断。