ECCV 2026 | 视频生成模型真的会「推理」吗?303道题全面揭示世界模型的推理短板
<img src="https://image.jiqizhixin.com/uploads/article/coverimage/536dd47a-7433-46b4-bd37-f8572fcfc016/0-2026-06-27T221044(2).955.jpg" referrerpolicy="no-referrer"<section<img data-src="https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0" data-ratio="0.2657407407407407"…
正文摘录
.955.jpg)  视频生成模型(Video Generative Models)是近年最炙手可热的方向。从 Sora、Veo 到 Kling、Seedance,它们能生成以假乱真的画面,对时间动态与物理规律的模拟令人惊叹。越来越多证据表明,它们已在大规模视频数据中隐式学到了某种「世界模型」(World Model)。 但一个关键问题被长期忽视:当模型生成一段看似「合理」的视频时,它真的在一帧帧地连贯推理吗?还是只画出了一个看似正确的结果? 我们把这一维度正式定义为 推理一致性(Reasoning Coherence):生成视频中的事件,能否在帧与帧之间保持因果一致、可信的演化。