动态

Jim Fan分享2025年机器人领域三大教训:硬件领先但可靠性限制迭代、基准测试混乱、VLM基VLA存在问题。

Jim Fan分享2025年机器人领域三大教训:硬件领先但可靠性限制迭代、基准测试混乱、VLM基VLA存在问题。
Jim Fan
每个人都在为氛围编码而抓狂。趁着节日气氛,请允许我分享我对机器人领域狂野西部的焦虑。2025年我学到的3个教训。

1. 硬件领先于软件,但硬件可靠性严重限制了软件迭代速度。

我们看到了精妙的工程艺术,如Optimus、e-Atlas、Figure、Neo、G1等。我们最好的AI尚未从这些前沿硬件中榨出所有潜力。身体的能力超过了大脑能指挥的。然而,照看这些机器人需要整个操作团队。与人类不同,机器人不会从擦伤中恢复。过热、电机损坏、奇怪的固件问题每天困扰着我们。错误是不可逆且不可原谅的。

我的耐心是唯一能够扩展的东西。

2. 在机器人领域,基准测试仍然是一场史诗般的灾难。

LLM小白认为MMLU和SWE-Bench是常识。但在机器人领域,请放下你的酒杯。没有人在任何事上达成一致:硬件平台、任务定义、评分标准、模拟器或真实世界设置。每个人都是SOTA,根据他们为每次新闻发布临时定义的基准。每个人从100次重试中挑选出最好看的演示。

作为一个领域,我们在2026年必须做得更好,不能再把可重复性和科学纪律当作二等公民。

3. 基于VLM的VLA感觉不对。

VLA代表“视觉-语言-动作”模型,一直是机器人大脑的主流方法。配方很简单:取一个预训练的VLM检查点,在上面嫁接一个动作模块。但仔细想想,VLM被超优化以攀登像视觉问答这样的基准。这意味着两个问题:(1)VLM中的大部分参数用于语言和知识,而不是物理;(2)视觉编码器被积极调整以*丢弃*低级细节,因为问答只需要高级理解。但微小的细节对灵巧操作很重要。

VLA的性能没有理由随着VLM参数规模扩展而扩展。预训练是错位的。视频世界模型似乎是机器人策略更好的预训练目标。我对此下大赌注。
动态Jim Fan2025-12-28原文

相关内容