动态

前沿LLM文本知识超人类,但VLM因图文对稀少仍差

François Chollet
前沿LLM具有超人类水平的文本世界知识。前沿图像/视频模型具有超人类水平的视觉世界知识(例如Genie)。但目前前沿VLM仍然绝对是糟糕的。为什么?因为图像-文本对相对稀少(虽然有大量文本和大量图像/视频)。
动态François Chollet2025-08-11原文

相关内容