行业新闻

评测:大模型主动视觉能力远逊人类,最高分仅10.6%

这篇评测指出,大模型缺少“主动视觉”能力,观察图像时无法像人类那样持续获取与验证信息,即便用工具辅助也仍与人类存在近9倍差距。

大模型虽能“看懂”图像,却缺乏主动观察能力——在 ActiveVision 基准测试中,GPT-5.5 最高仅得 10.6%,而人类平均准确率达 96.1%。即便借助代码工具,模型仍难以自主检查视觉错误,差距明显。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/22b3bc28-6429-4be2-a58f-df9074bf2367/02(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) [![](https://image.jiqizhixin.com/uploads/editor/1ce66d32-4283-4596-a8a9-4f221c1746f4/1785900994188.png)](https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg) ![图片](/r/blog/2379fa1934f30c6b57c5a0d71b1ef99adf54cd7567935a58eb06541a527cbd77.jpg) 01|视觉,为什么是一条闭环? 人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。 这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。 这种能力和真实应用息息相关。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-05原文

相关内容