探讨机器人学现状,类比NLP 2018,强调非共识创新与具身智能
我最近在X上比较安静。过去一年是变革性的经历。Grok-4和Kimi K2很棒,但机器人世界就像狂野的西部。感觉就像2018年的NLP,当时GPT-1、BERT以及无数其他技术百花齐放。没人知道哪个最终会成为ChatGPT。辩论激烈,熵值极高,想法异常有趣。
我相信机器人的GPT-1已经在Arxiv上了,但我们不知道具体是哪一个。可能是世界模型、强化学习、从人类视频学习、sim2real、real2sim等等,或者它们的组合。辩论激烈,熵值极高,想法异常有趣,而不是在AIME和GPQA上挤压最后几个百分点。
机器人学的本质也大大复杂化了设计空间。与LLM清洁的比特世界(文本字符串)不同,我们机器人专家必须处理混乱的原子世界。毕竟,循环中有一块由软件定义的金属。LLM的普通人可能难以相信,但到目前为止,机器人专家甚至无法就基准达成一致!不同的机器人有不同的能力范围——有些更擅长杂技,而其他则擅长物体操作。有些用于工业,有些用于家务。跨形态不仅是研究的新奇,更是通用机器人大脑的基本特征。
我与来自新旧机器人公司的几十位高管交谈过。有些出售整个身体。有些出售身体部位,如灵巧的手。还有更多出售制造新身体、创建模拟或收集大量数据的工具。商业创意空间与研究本身一样狂野。这是一场新的淘金热,自2022年ChatGPT浪潮以来我们从未见过。
最好的进入时机是非共识达到顶峰的时候。我们仍然处于损失曲线的起点——有强烈的生命迹象,但距离收敛还很远。每一步梯度都带我们进入未知。但我确切知道一件事——没有触觉、感觉和在这个混乱世界中具身化,就没有AGI。
就个人而言——运营一个研究实验室带来了全新的责任。直接向一家4万亿美元公司的CEO汇报,说得客气点,既令人兴奋又占据了我所有的注意力权重。那些我能掌握并深入每一条AI新闻的日子已经一去不复返了。
我会努力抽出时间分享更多我的历程。
我相信机器人的GPT-1已经在Arxiv上了,但我们不知道具体是哪一个。可能是世界模型、强化学习、从人类视频学习、sim2real、real2sim等等,或者它们的组合。辩论激烈,熵值极高,想法异常有趣,而不是在AIME和GPQA上挤压最后几个百分点。
机器人学的本质也大大复杂化了设计空间。与LLM清洁的比特世界(文本字符串)不同,我们机器人专家必须处理混乱的原子世界。毕竟,循环中有一块由软件定义的金属。LLM的普通人可能难以相信,但到目前为止,机器人专家甚至无法就基准达成一致!不同的机器人有不同的能力范围——有些更擅长杂技,而其他则擅长物体操作。有些用于工业,有些用于家务。跨形态不仅是研究的新奇,更是通用机器人大脑的基本特征。
我与来自新旧机器人公司的几十位高管交谈过。有些出售整个身体。有些出售身体部位,如灵巧的手。还有更多出售制造新身体、创建模拟或收集大量数据的工具。商业创意空间与研究本身一样狂野。这是一场新的淘金热,自2022年ChatGPT浪潮以来我们从未见过。
最好的进入时机是非共识达到顶峰的时候。我们仍然处于损失曲线的起点——有强烈的生命迹象,但距离收敛还很远。每一步梯度都带我们进入未知。但我确切知道一件事——没有触觉、感觉和在这个混乱世界中具身化,就没有AGI。
就个人而言——运营一个研究实验室带来了全新的责任。直接向一家4万亿美元公司的CEO汇报,说得客气点,既令人兴奋又占据了我所有的注意力权重。那些我能掌握并深入每一条AI新闻的日子已经一去不复返了。
我会努力抽出时间分享更多我的历程。