动态

视频模型擅长生成逼真帧,但缺乏抽象逻辑推理

视频模型擅长生成逼真帧,但缺乏抽象逻辑推理
Christopher Nguyen ⽗
简而言之:这些视频模型擅长生成看起来像时空推理的合理下一帧,但抽象逻辑推理和全局一致性很差——例如穿墙而过。抄送 @ylecun @demishassabis
Haoyi Qiu
像Sora-2和Veo-3这样的视频模型看起来不可思议,但它们真的能推理吗?🤔

📣 介绍MMGR:多模态生成推理,一个新的基准,评估视频(Veo-3, Sora-2和Wan-2.2)和图像模型 https://t.co/RVwkIIkqvj
动态Christopher Nguyen ⽗2025-12-20原文

相关内容