新基准MMGR评估视频和图像模型推理能力,发现逻辑和长期规划弱
像Sora-2和Veo-3这样的视频模型看起来不可思议,但它们真的能推理吗?🤔
📣 介绍𝗠𝗠𝗚𝗥: 𝗠𝘂𝗹𝘁𝗶-𝗠𝗼𝗱𝗮𝗹 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝘃𝗲 𝗥𝗲𝗮𝘀𝗼𝗻𝗶𝗻𝗴,一个新基准,评估视频(Veo-3、Sora-2和Wan-2.2)和图像模型(Nano-banana/Pro、GPT-4o-image、Qwen-image)在5项核心能力:物理、逻辑、3D/2D空间和时间推理,跨越三个领域:抽象逻辑、具身导航和物理常识。
🥁 我们的发现?我们进行了广泛的80多页深度分析:虽然模型擅长视觉物理,但在抽象逻辑(大多数视频模型在ARC-AGI上<10%)和长期规划上惨败。是时候从“看起来真实”转向“行动真实”了。🧵👇
📣 介绍𝗠𝗠𝗚𝗥: 𝗠𝘂𝗹𝘁𝗶-𝗠𝗼𝗱𝗮𝗹 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝘃𝗲 𝗥𝗲𝗮𝘀𝗼𝗻𝗶𝗻𝗴,一个新基准,评估视频(Veo-3、Sora-2和Wan-2.2)和图像模型(Nano-banana/Pro、GPT-4o-image、Qwen-image)在5项核心能力:物理、逻辑、3D/2D空间和时间推理,跨越三个领域:抽象逻辑、具身导航和物理常识。
🥁 我们的发现?我们进行了广泛的80多页深度分析:虽然模型擅长视觉物理,但在抽象逻辑(大多数视频模型在ARC-AGI上<10%)和长期规划上惨败。是时候从“看起来真实”转向“行动真实”了。🧵👇