行业新闻

新基准 MemoBench 揭示视频生成模型对物体遮挡后状态变化记忆缺陷

MemoBench 通过“可见-消失-重现”范式,发现当前世界模型缺乏对动态遮挡物体的持久表征与推理能力,为模型改进提供了量化诊断工具。

尽管视频生成模型能输出连贯画面,但在物体移出视野再重现时,几乎无法恢复其在消失期间本该发生的物理变化。哈佛、MIT、谷歌等机构提出的 MemoBench 基准专门测试这种“物体恒存”能力,10 个主流模型得分均低于 0.6(满分 1)。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/4af957b7-ae8f-45d0-a3b3-3fdbe3bdec43/035(2).jpg) 编辑|泽南、Panda 世界模型,真的拥有记忆吗? 如果你正把一杯水倒进玻璃瓶,然后扭头看了一眼窗外,再转回来,瓶子里的水位应该已经发生变化。这是任何一个三岁孩子都具备的常识:东西不在眼前,不代表它消失了,更不代表它会停止变化。心理学把这种能力叫做 物体恒存(object permanence) ,是人类最早建立起来的认知能力之一。 但对今天最先进的视频生成模型来说,这个任务却不简单。 过去一年里, 世界模型 成为视频生成领域最热的关键词之一。从 Sora 到国产的多款视频大模型,厂商们争相强调自己的产品不只是 生成好看的画面 ,而是在 模拟真实世界的运行规律 。其中,世界模型是否具备类似人类 物体恒存 的认知能力,正成为衡量建模水平的核心标尺: 当物体暂时离开视野、并在遮挡期间持续发生物理变化时,模型能否记住它的身份、推演它的状态,并在它重新出现时准确还原? 长期以来,业界评测始终未能精准检验这一能力:绝大多数基准只考核物体持续可见时的帧间一致性;少数涉及遮挡的测试,也多针对静态场景(物体消失期间环境没有任何变化),无法验证模型对动态世界的记忆与推演能力。 针对这个问题,来自哈佛大学、MIT、IBM、波士顿大学、谷歌、JHU、CMU 和 Kempner Institute 的研究者提出了一个新的诊断性基准: MemoBench 。这是 首个面向动态环境的「消失-重现」世界建模评测基准,并已被计算机视觉顶会 ECCV 2026 接收 。其一作 Haoyu Chen 为哈佛大学计算科学与工程专业一年级硕士生,师从哈佛大学计算机科学助理教授 Yilun Du。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-06原文

相关内容