Skild AI 用自我对弈训练人形机器人,虚拟世界杯踢了 140 年
Skild AI 证明机器人不必靠人逐个教动作:只给进球奖励 + self-play,机器人自己长出盘带护球能力,还能迁移到真身。
Skild AI 把人形机器人放进 NVIDIA Isaac Sim 的虚拟足球场,只给一个目标:进球。盘带、护球、抢断、倒地起身这些动作没有单独奖励,全靠自我对弈(self-play,让模型不断和自己或升级版对手对打来变强)自己摸索出来。140 年虚拟球龄后,策略迁移到了真机上。
正文摘录
视频中的人形机器人“Messinator”穿着阿根廷队服,丝滑地带球过人,一脚射门: 最妙的是奖励函数只给了进球,盘带、护球、倒地爬起来全是自己“悟”出来的。AlphaGo 那套 self-play 方法论又在物理世界又走通了一次;虚拟世界杯踢 140 年,值了! “梅西终结者”,在虚拟世界杯苦练 140 年 Messinator 这个名字拆开看很有意思。 它的前半截是梅西(Messi),后半截来自经典科幻电影《终结者》里的机器 Terminator,把这俩合在一起就是 “梅西终结者” 。(big 胆 hhh) 我们只需给它看一段任务示范视频,它就能把视频当作“提示词”,逐步理解咱们想完成什么任务,并把视频里的意图和动作转换成适合自己身体的执行方式。 Skild AI 认为,像 S1 这样的基础模型主要从人类数据中学习,能力上限难免受人类经验限制。 于是,Skild AI 又在 S1 基础上加入了 强化学习 和 self-play ,也就是自我对弈。 它的整个训练设置并不复杂,团队把机器人放进了 NVIDIA Isaac Sim 搭建的虚拟足球场,并只给它设定了一个最终目标: 进球,拿到高分。 然后,在整个训练过程中,没有人为盘带单独设置奖励,也没有人为护球、抢断、射门和倒地起身逐一打分。 而随着对手不断变强,机器人盘带绕过防守、用身体护球、主动抢断等更复杂的行为也开始陆续出现。 当年,AlphaGo 正是通过与自己对弈,逐渐发现了一些连顶尖棋手都没预料到的下法,并于 2016 年 4:1 一举击败韩国传奇棋手李世石九段,正式拉开了 AI 变革的序幕。 现在,Messinator 也通过自我对弈、在虚拟世界踢了 140 年世界杯,将足球策略迁移到了真实人形机器人上。