动态

潜在动作在机器人学中的应用:从Genie到互联网视频泛化

潜在动作在机器人学中的应用:从Genie到互联网视频泛化
Yann LeCun
RT @aimalysheva: 潜在动作正流行,尤其在机器人学中:不再预测机器人的实际关节指令或游戏控制器输入,而是学习一个紧凑的潜在编码,仅解释两帧之间的变化,训练中无需任何动作标签。

Genie (Bruce et al, DeepMind 2024, https://t.co/ON2xnobW9k) 是一个清晰的证明概念:逆模型查看连续帧,推断出一个小型离散潜在动作来解释转换,仅凭这个学习的动作空间就足以使生成的视频逐帧可控,尽管模型从未见过真实动作标签(同样的潜在空间也证明可转移,你可以用它从未经任何特定机器人标注的视频上训练模仿智能体)。

(同一研究集群:Video as the New Language for Real-World Decision Making, https://t.co/IebxdYwstD by @sherryyangML et al.,论证了视频本身作为通用接口的更广泛案例,而不仅仅是针对潜在动作。)

更难的问题是泛化潜在动作到狭窄领域之外:Genie 在平台游戏视频上训练,具有一致载体和清晰信号,而 FAIR 的新论文 (@garridoq_, Nagarajan, Terver, Ballas, @ylecun, Rabbat, https://t.co/vH2F12E16K) 将潜在动作学习推向真实的互联网视频,这意味着片段之间没有共享载体,并且需要过滤更多环境噪音才能让潜在动作具有一致含义。

为什么机器人学特别关注:动作标签需要远程操作或动作捕捉,无法规模化,而世界上发生的事件的未标注视频几乎是无限的,所以如果潜在动作空间能够泛化,你就可以用所有视频进行训练,而不只是你花钱标注的那些。
动态Yann LeCun2026-07-19原文

相关内容