LeCun提出评估世界模型的核心在于潜在变量演化结构
🚨🚨🚨一个研究项目想法!如何衡量世界模型?
如今每个人都在谈论世界模型。世界模型这里,世界模型那里。我们可以争论“世界模型”到底意味着什么,并且我们已经有一些有趣的结果,但暂且先假设一个模糊的定义。真正的问题是如何区分好的世界模型和坏的世界模型。
我赌真正重要的东西——不是视频看起来多真实,或者你是否能从某个巨大的潜在变量中读出物理量。而是潜在变量如何演化的结构。假设一块石头朝你飞来,你想计划逃跑——你在乎它的速度吗?它的能量?它的速度在二维平面上的投影?它们都是非线性相关的,所以追求任何一个都是错误的目标。更重要的是,潜在变量的运动是否有简单、可解释的规则。而且必须是潜在变量——真正的自由度不是像素。写下从过去潜在变量到未来潜在变量的映射:它的雅可比矩阵是什么?世界是有噪声的,所以误差是以合理均匀的方式传播,还是存在微小误差立即爆炸的点?另外,找到仍然有效的最小潜在空间,并检查其维度是否与物理学预期一致。
与此同时,该领域以十几种方式衡量世界模型,它们之间悄无声息地存在分歧。表征探测在表征上放置线性探针,询问什么是可解码的。基于信息的方法试图测量潜在变量携带的关于未来的预测信息。展开误差使模型向前运行,并跟踪它偏离现实的速度。然后还有下游任务成功——它是否有助于某项任务——与闭环效用对比,即智能体实际用它进行规划,并观察是否成功。不同的东西,它们经常不一致。
所以有两种方法理清混乱。一种是经验性的:采用多种设置和多种模型,测量所有这些指标,并绘制它们如何相关,类似于“Fantastic Generalization Measures and Where to Find Them”论文,但针对世界模型。另一种是根本不再将它们视为独立的基准。实际上只有一件事:一个随时间变化的系统,你可以对其施加行动,而且你只能看到它的一部分。每个指标只是它的一个影子——真实性检查帧,展开误差检查预测,探测检查状态,闭环检查规划。每个都隐藏着关于何时才是公平测试的假设。让这些显式化,并问真正的问题:一个指标表现好何时真正保证另一个指标也表现好,以及它们何时只是碰巧一致?
我很想听听大家的想法,并告诉我你是否想合作。
如今每个人都在谈论世界模型。世界模型这里,世界模型那里。我们可以争论“世界模型”到底意味着什么,并且我们已经有一些有趣的结果,但暂且先假设一个模糊的定义。真正的问题是如何区分好的世界模型和坏的世界模型。
我赌真正重要的东西——不是视频看起来多真实,或者你是否能从某个巨大的潜在变量中读出物理量。而是潜在变量如何演化的结构。假设一块石头朝你飞来,你想计划逃跑——你在乎它的速度吗?它的能量?它的速度在二维平面上的投影?它们都是非线性相关的,所以追求任何一个都是错误的目标。更重要的是,潜在变量的运动是否有简单、可解释的规则。而且必须是潜在变量——真正的自由度不是像素。写下从过去潜在变量到未来潜在变量的映射:它的雅可比矩阵是什么?世界是有噪声的,所以误差是以合理均匀的方式传播,还是存在微小误差立即爆炸的点?另外,找到仍然有效的最小潜在空间,并检查其维度是否与物理学预期一致。
与此同时,该领域以十几种方式衡量世界模型,它们之间悄无声息地存在分歧。表征探测在表征上放置线性探针,询问什么是可解码的。基于信息的方法试图测量潜在变量携带的关于未来的预测信息。展开误差使模型向前运行,并跟踪它偏离现实的速度。然后还有下游任务成功——它是否有助于某项任务——与闭环效用对比,即智能体实际用它进行规划,并观察是否成功。不同的东西,它们经常不一致。
所以有两种方法理清混乱。一种是经验性的:采用多种设置和多种模型,测量所有这些指标,并绘制它们如何相关,类似于“Fantastic Generalization Measures and Where to Find Them”论文,但针对世界模型。另一种是根本不再将它们视为独立的基准。实际上只有一件事:一个随时间变化的系统,你可以对其施加行动,而且你只能看到它的一部分。每个指标只是它的一个影子——真实性检查帧,展开误差检查预测,探测检查状态,闭环检查规划。每个都隐藏着关于何时才是公平测试的假设。让这些显式化,并问真正的问题:一个指标表现好何时真正保证另一个指标也表现好,以及它们何时只是碰巧一致?
我很想听听大家的想法,并告诉我你是否想合作。