动态

认为当前视觉语言模型智能不足,需要创造新模型

认为当前视觉语言模型智能不足,需要创造新模型
Junyang Lin
对人类的简单任务。今天的视觉语言模型还没展现出足够的智能。得创造一个新的。
Alek Safar
介绍ClockBench,一种专注于模拟时钟识读的视觉推理AI基准:
- 人类平均准确率89.1%,而11个测试领先LLM中最佳模型仅13.3%
- 难度与@fchollet ARC-AGI-2相当,对于https://t.co/oqHTAxSnSU 似乎更难
动态Junyang Lin2025-09-08原文

相关内容