行业新闻

VA-Bench 评测:多模态模型完整操作任务成功率约五成

一篇新基准研究指出,大模型"看得懂"和"做得对"之间存在明显断层,物理执行才是当前空间智能的真正瓶颈。

VA-Bench(Vision-Action Benchmark,把空间智能放进"观察—推理—行动—修正"闭环的机器人操作评测)测试了 12 个主流多模态模型。它们在目标识别和操作语义理解上接近满分,但完整任务成功率只有约一半。失败集中在精细空间执行、在线修正和双臂协同三个环节。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/9210a911-8a3a-4c0c-b16c-d6a5e88941b9/07(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 大模型已经越来越会「看懂」空间:它能判断物体在机械臂哪一侧,也能识别该操作哪个目标、理解任务怎么做。但如果真的把机械臂交给它,问题会变得更具体:该移动多少毫米?当前视角够不够?抓空以后,又该怎么调整? VA-Bench 测试了 12 个主要多模态模型。表现最好的几组模型,在目标识别与定位(TL)上达到 100% ,操作语义理解(MS)也达到 99.6%—100% ;但完整任务成功率只有约一半:Qwen3.8-max、Opus-5 和 GPT-5.6-sol 分别为 53.93%、52.86% 和 51.55% 。 目标找对了,任务也看懂了,为什么真正动起来以后,还是只有大约一半能成功?对于这些情况来说,模型真的「理解」了空间吗? 这正是 VA-Bench 想测的问题。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-05原文

相关内容