独立物理AI评估正成为新类别,从任务成功率转向系统可靠性、速度与泛化能力
转推 @ShubhamAg0x:物理AI评估开始成为一个真正的类别。直到最近,大多数VLA评估基本上是:LIBERO → 成功率 → 排行榜。现在我们看到更广泛的技术栈涌现:• Allen AI — 跨18+仿真基准的统一VLA评估 • LeRobot — 跨多个仿真基准的统一评估接口 • PhAIL — 真实机器人 + 吞吐量和故障等生产指标 • Robocurve — 独立的真实世界机器人评估 • RoboDojo — 将仿真与真实世界评估相结合。有趣的不只是更多基准,而是从“机器人能完成这个任务吗?”转向“这个系统在物理世界中的可靠性、速度和泛化能力如何?”我认为随着机器人模型在演示上越来越相似,独立的物理AI评估将变得越来越重要。