从ImageNet到NLP基准,机器人缺乏统一评估,BEHAVIOR项目试图解决
关于ImageNet,有一些非常令人满足的东西。它有一个精心策划的训练集,一个清晰定义的测试协议,一个吸引最佳研究者的竞赛,以及一个催生了ResNets和ViTs并最终彻底改变该领域的排行榜。
然后NLP紧随其后。无论OpenAI、Anthropic和xAI有多少分歧,他们至少在一件事上达成一致:基准测试。MMLU、HLE、SWEBench——你无法进步,除非你能衡量它。
机器人领域仍然没有这样的号召。没有人对任何事达成一致:硬件、任务、评分、仿真引擎或真实世界环境。每个人都在他们为每篇论文临时定义的基准上自称SOTA。
来自ImageNet的创造者——BEHAVIOR试图解决在可复现的物理引擎(Isaac Sim)上统一机器人基准测试的艰巨挑战。该项目在我从斯坦福视觉实验室毕业前就开始了,花费了多年的奉献和博士生涯才建成。我希望BEHAVIOR要么是我们需要的爬坡信号,要么是最终让我们开始讨论如何衡量领域真正进步的 sparks。
然后NLP紧随其后。无论OpenAI、Anthropic和xAI有多少分歧,他们至少在一件事上达成一致:基准测试。MMLU、HLE、SWEBench——你无法进步,除非你能衡量它。
机器人领域仍然没有这样的号召。没有人对任何事达成一致:硬件、任务、评分、仿真引擎或真实世界环境。每个人都在他们为每篇论文临时定义的基准上自称SOTA。
来自ImageNet的创造者——BEHAVIOR试图解决在可复现的物理引擎(Isaac Sim)上统一机器人基准测试的艰巨挑战。该项目在我从斯坦福视觉实验室毕业前就开始了,花费了多年的奉献和博士生涯才建成。我希望BEHAVIOR要么是我们需要的爬坡信号,要么是最终让我们开始讨论如何衡量领域真正进步的 sparks。
(1/N) 我们距离让机器人解决日常生活中重要的长时域、复杂任务还有多远?
🚨 我们非常激动地邀请您参加首届BEHAVIOR挑战赛 @NeurIPS 2025,提交截止日期:11/15。
🏆 奖品:
🥇 1,000美元
🥈 500美元
🥉 300美元 https://t.co/W63PyzBcMk