讨论 GEN-1.5 成功关键:重复动作数据与 UMI 直接采集。
看到 GEN-1.5 周围掀起了热潮,这理所当然。非常尊重 Pete 和 Andy 执行得如此出色。秘诀在于人类收集的数据中自然重复的动作。这类重复有两个主要来源:
(1) 对称模式。分类、整理和组装几乎从不以一次动作结束。打开宜家的任何组装手册,你会发现大多数物体都是对称的。你拧一个螺栓,然后是它的孪生螺栓,接着是下一对。每对 {螺栓 A,螺栓 B} 都是上下文中的自然延续,第二个实例是模仿第一个(即“提示”)的免费训练信号。
(2) 恢复。人类经常掉落东西,但我们捡起得如此之快,以至于几乎没注意到。这种修复反射占我们身体能力的一半。关键洞察是保留失败的前半部分,而不是修剪掉。如果模型消耗完整的弧线——失误、接住、继续——那么恢复在测试时就会自然地出现。有趣的是,上下文改进源于*不*过度净化你的数据。
另一个关键成分是 UMI。我一直在说,遥操作不会持久,GEN-1.5 正在钉上最后一颗钉子。UMI 本质上是人类佩戴机器人夹爪直接收集数据(人类 → 数据)。遥操作插入了一层分离:人类 → VR/骨骼设备 → 机器人 → 数据,这泄漏了所有人类的“物理直觉”。我们不断用物体进行的微妙手法、微调、零件卡入到位的感觉,在你无法直接感知环境时几乎不可能捕捉。
一旦你有足够的数据,许多行为实际上可以是零样本的。例如,你甚至不需要微调就能拿起一个新物体。模型“就是知道”在训练分布中面对相似场景该做什么。上下文学习是否真正有效也取决于测试与训练的距离。目前,演示还太简单,难以得出结论。
我持谨慎乐观态度。尽管如此,这对机器人来说是伟大的一天。
(1) 对称模式。分类、整理和组装几乎从不以一次动作结束。打开宜家的任何组装手册,你会发现大多数物体都是对称的。你拧一个螺栓,然后是它的孪生螺栓,接着是下一对。每对 {螺栓 A,螺栓 B} 都是上下文中的自然延续,第二个实例是模仿第一个(即“提示”)的免费训练信号。
(2) 恢复。人类经常掉落东西,但我们捡起得如此之快,以至于几乎没注意到。这种修复反射占我们身体能力的一半。关键洞察是保留失败的前半部分,而不是修剪掉。如果模型消耗完整的弧线——失误、接住、继续——那么恢复在测试时就会自然地出现。有趣的是,上下文改进源于*不*过度净化你的数据。
另一个关键成分是 UMI。我一直在说,遥操作不会持久,GEN-1.5 正在钉上最后一颗钉子。UMI 本质上是人类佩戴机器人夹爪直接收集数据(人类 → 数据)。遥操作插入了一层分离:人类 → VR/骨骼设备 → 机器人 → 数据,这泄漏了所有人类的“物理直觉”。我们不断用物体进行的微妙手法、微调、零件卡入到位的感觉,在你无法直接感知环境时几乎不可能捕捉。
一旦你有足够的数据,许多行为实际上可以是零样本的。例如,你甚至不需要微调就能拿起一个新物体。模型“就是知道”在训练分布中面对相似场景该做什么。上下文学习是否真正有效也取决于测试与训练的距离。目前,演示还太简单,难以得出结论。
我持谨慎乐观态度。尽管如此,这对机器人来说是伟大的一天。