评测:大模型主动视觉能力远逊人类,最高分仅10.6%
这篇评测指出,大模型缺少“主动视觉”能力,观察图像时无法像人类那样持续获取与验证信息,即便用工具辅助也仍与人类存在近9倍差距。
大模型虽能“看懂”图像,却缺乏主动观察能力——在 ActiveVision 基准测试中,GPT-5.5 最高仅得 10.6%,而人类平均准确率达 96.1%。即便借助代码工具,模型仍难以自主检查视觉错误,差距明显。
正文摘录
.jpg)  [](https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg)  01|视觉,为什么是一条闭环? 人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。 这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。 这种能力和真实应用息息相关。