Meta 开源 HumanCLAW 基准,视觉语言模型交互成功率仅 16.8%
Meta 等推出 HumanCLAW,把行动决策从运动控制中拆出,结果显示 VLM 在真实交互中决策能力仍很弱。
HumanCLAW 是一个新测试基准,专门衡量视觉语言模型(VLM,能同时理解图像和文本的模型)能否通过身体完成真实交互。它将高层动作决策与低层运动控制分离。九款前沿 VLM 中,表现最好的完整交互成功率也只有 16.8%,说明看懂场景不等于知道下一步该做什么。
正文摘录
Meta 全开源 HumanCLAW:基础模型正进入具身智能的决策层   过去,基础模型主要负责理解和描述物理世界。现在,这条边界正在移动:模型开始进入机器人控制栈,参与决定一具身体下一步做什么。 近期,Google DeepMind 在全身控制模型之上加入具身推理层,Anthropic 则把前沿模型接入不同层级的机器人控制接口。两条路线的实现不同,却呈现出相似的系统分工:基础模型负责高层决策,预训练控制器负责平衡、轨迹跟踪和关节执行。 这也带来一个尚未回答的问题。当低层控制器能够可靠执行动作,视觉—语言模型是否真的知道身体下一步该做什么?它不仅需要看见目标,还要根据第一视角持续判断何时探索、如何接近、在哪里停下,以及什么时候完成交互。