发布MARBLE基准,测试多模态推理与规划,前沿模型表现不佳。
🚨预印本预警!🚨你知道吗?有一个新的推理基准,即使像o3这样的领先模型也表现不佳(即在困难子任务上准确率为0%或随机表现)。
✨认识一下𝐌𝐀𝐑𝐁𝐋𝐄,一个针对多模态推理和复杂空间约束下规划的🪨硬核基准!✨
受ARC挑战等知名任务的启发,我们思考:我们能否设计一个新的具有挑战性的基准,来测试MLLMs在复杂多模态问题中的推理和多步规划能力?
事实证明,即使是最新模型,这也非常困难!
MARBLE提供了2000多个多模态推理问题,分为两个领域:
𝐌-𝐏𝐨𝐫𝐭𝐚𝐥:基于Portal 2关卡建模的多步空间规划谜题。
𝐌-𝐂𝐮𝐛𝐞:模型需要从拼图碎片中规划3D立方体组装,灵感来自Happy Cube谜题。
MARBLE为测试MLLMs的高级推理能力提供了一个艰巨的基准。对于这些任务,现在瓶中的精灵已经释放——预计在未来几个月内模型性能将快速提升,所以到那时不要过度解读!
🌐 网站:https://t.co/N1cIXQFm0g
📄 论文:https://t.co/Yc6YBgjE8f
💻 代码:https://t.co/UYnh0xDOyW
🤗 数据集:https://t.co/XJsjKDtfzc
与@YulunJiang @ychai1224 @mariabrbic的有趣合作!
✨认识一下𝐌𝐀𝐑𝐁𝐋𝐄,一个针对多模态推理和复杂空间约束下规划的🪨硬核基准!✨
受ARC挑战等知名任务的启发,我们思考:我们能否设计一个新的具有挑战性的基准,来测试MLLMs在复杂多模态问题中的推理和多步规划能力?
事实证明,即使是最新模型,这也非常困难!
MARBLE提供了2000多个多模态推理问题,分为两个领域:
𝐌-𝐏𝐨𝐫𝐭𝐚𝐥:基于Portal 2关卡建模的多步空间规划谜题。
𝐌-𝐂𝐮𝐛𝐞:模型需要从拼图碎片中规划3D立方体组装,灵感来自Happy Cube谜题。
MARBLE为测试MLLMs的高级推理能力提供了一个艰巨的基准。对于这些任务,现在瓶中的精灵已经释放——预计在未来几个月内模型性能将快速提升,所以到那时不要过度解读!
🌐 网站:https://t.co/N1cIXQFm0g
📄 论文:https://t.co/Yc6YBgjE8f
💻 代码:https://t.co/UYnh0xDOyW
🤗 数据集:https://t.co/XJsjKDtfzc
与@YulunJiang @ychai1224 @mariabrbic的有趣合作!