动态

Meta视频模型通过观察学习物理规律,无需标注;引申到生产系统可类似发现故障模式。

Meta视频模型通过观察学习物理规律,无需标注;引申到生产系统可类似发现故障模式。
Robert Youssef
🚨 重磅:Meta 研究人员向模型展示了 200 万小时的视频。没有标签。没有物理教科书。没有任何监督。

然后他们向模型展示了一个片段,其中物体消失在墙后,再也没有出现。

模型将其标记为异常。🤯

它学会了物体恒存性。形状一致性。碰撞动力学。完全通过观看学习。

更令人惊讶的是:即使只训练了一周独特视频的模型,在物理违规检测上也取得了高于偶然水平的性能。这不是偶然。这是一个原理。

论文的关键发现:只有当模型在学习的表示空间中预测,而不是在原始像素中预测时,这才有效。模型必须构建一个内部世界模型,压缩且抽象,并据此进行预测。像素空间预测失败。通过文本推理的多模态大语言模型也失败。只有构建抽象表示同时预测缺失感官输入的架构——接近神经科学家描述预测编码的方式——才真正获得物理直觉。

这意味着研究人员曾认为必须硬编码的核心知识可能只是大规模观察的结果。婴儿通过观察事物学习物体恒存性。事实证明同样的原理在这里也成立。

现在,这里是没人讨论的部分。

如果仅靠观察就能教会模型物理世界的规则,那么当你将同样的原理应用于生产系统时会发生什么?

生产系统也有物理规律。

不是重力。但规则同样一致:哪些部署会在凌晨 3 点引发事故,哪些配置组合会危险地交互,哪些代码路径会在负载下悄然降级,哪些服务变更会导致两跳之外的故障。这些模式嵌入在成千上万的轨迹中:代码推送、指标变化、客户工单、事故时间线。大多未被观察。当然没有标签。

没人会写一本手册说:“如果服务 A 在启用标志 X 的情况下部署,且服务 B 的 CPU 超过 70%,那么服务 C 的延迟会在 6 分钟内上升 40%。”但这样的模式是存在的。它是可重复的。它就在你的可观测性数据中,只是目前无人构建模型来发现它。

这正是 @playerzeroai 试图弥补的差距。不是另一个测试运行器。不是另一个告警阈值。而是一个生产世界模型,通过累积的观察学习哪些事物会崩溃,就像 Meta 的模型学习重力一样。它不检查你的测试覆盖率。它预测故障轨迹。

一周的视频足以学习固体物体不会穿过墙壁。

问题是你的生产系统需要多少观察数据,模型才能开始预测下一个故障点。

Meta 的论文表明,这个门槛可能比任何人预期的都要低。
动态Robert Youssef2026-03-20原文

相关内容