机器人 AI 为何比大模型更具挑战?Interlatent 从第一性原理解析
机器人 AI 的核心挑战是实时性与泛化,拆分理解与动作为 VLA 是当前主流应对方案。
机器人控制本质是一个从观测到动作的函数映射,但物理世界的实时性、数据稀缺和泛化要求远超大模型。业界主流方案采用视觉语言模型(VLM)负责理解,加上快速动作模型负责实时控制,构成视觉语言动作模型(VLA)架构。
正文摘录
过去几年,机器人行业最常见的高光时刻,几乎都发生在演示视频里。 一台机械臂听懂指令,伸手拿起杯子;一个人形机器人走进厨房,把杂物收回原位;它可以叠衣服、拉抽屉、倒咖啡,甚至在陌生房间里完成一连串看似自然的动作。 这些画面很容易让人产生一种错觉:机器人已经开始像人一样理解世界了。 但如果把问题拆到最底层,答案反而朴素得多。 这篇来自 Interlatent(一家聚焦具身智能后训练与部署的早期创业公司) 的文章,试图从第一性原理出发,把现代 AI 机器人技术重新讲清楚:一个机器人到底如何理解世界,如何生成动作,又为什么会在数据、延迟和泛化上遇到如此多的困难。 文章给出的切入口非常简单:先把机器人控制问题,看成一个函数。 有一种看似简单、但相当准确的方式,可以用来描述 physical AI 到底在做什么。任何有 STEM 背景的人,应该都能直观理解。和其他所有 AI 模型一样,控制机器人的模型本质上也是一个函数。它接收观测作为输入,比如摄像头像素、关节角度、夹爪感受到的阻力等等;然后输出动作,也就是电机下一步的位置和力矩。除此之外, 所有复杂的算法、训练方法和数据扩展理论,都是为了得到这个函数的一个足够好的版本,并把它写入神经网络的权重之中 。 机器人策略本质上是一个函数。观测从左侧不断输入,网络对其进行处理和细化,随后一组动作指令从右侧输出,对应机械臂每一个关节,也就是它的每一个自由度。这个领域中的其他一切,都是为了让这一个函数变得足够好、足够快 如果你曾经训练过一个将输入映射到输出的模型,就已经能够理解这个问题的大致形态。真正有意思的地方在于:当你把这个熟悉的问题形态,放进一个不断运动、不断响应的真实世界里,会发生什么。