LeWorldModel 论文评论:端到端 JEPA 世界模型,性能良好
论文评论:LeWorldModel:像素级稳定端到端联合嵌入预测架构
https://t.co/TpFFnwPWkc
整洁的 GitHub 仓库:https://t.co/HOuqE0fHaF
这是 LeJEPA 结果在世界模型上的应用,基于三个不同机器人风格测试的经验离线训练,每个数据集含一到两百万步。重申了 SigReg 损失相比先前世界模型方法的优势。
使用未经修改的 HuggingFace ViT-Tiny 视觉变换器,输入 ImageNet 标准的 224x224 RGB 像素图像以生成潜在表示。由于 ViT 以层归一化层结束,需要额外的后投影步骤使 SigReg 能自由地将潜在表示扰动为独立高斯分布。还测试了 ResNet-18,性能良好但略差。
使用 192 维潜在表示。将潜在维度加倍至 384 时性能略有下降;了解其是否稳定或随着潜在过大而继续恶化会很有帮助。批次大小与 SigReg 之间存在关系,更大的潜在表示若配合更大的批次大小可能提升性能。
预测器使用 ViT-S 骨干——当潜在表示是扁平时为何用视觉变换器?两个基准测试使用 3 组历史潜在表示,另一个使用 1 组。“小”模型性能明显优于“微小”模型,但较大的“基础”模型性能显著下降,这很有意思。
预测器上 0.1 的 dropout 显著提升了性能。0.2 仍比 0.0 好,但 0.5 更差。
使用 128 x 4 轨迹的批次训练。希望他们的训练损失图能更放大并带网格线。
在测试时进行规划,而不是像 Dreamer / Diamond 那样通过想象训练构建策略。最多推出 300 个初始随机动作序列,规划范围 H 为 5(帧跳跃 5)。使用交叉熵方法迭代最多 30 次。论文主体提到使用模型预测控制策略,仅执行前 K 个规划动作后重新规划,但附录 D 说他们执行所有 5 个规划动作。
训练后,他们探测潜在空间以证明其捕获并表示了物理有意义的量。还实现了一个从潜在空间回到像素的解码器——算法未使用,但有助于观察潜在空间实际表示的内容。他们测试了将重建损失纳入训练,但性能有所下降。
最终 SigReg 的 λ 为 0.1,而 LeJEPA 论文中为 0.05。1024 个 SigReg 投影,但观察发现数量影响可忽略。
我喜欢 JEPA 框架,但到目前为止,我将其用于 Atari 游戏价值函数的尝试未能与其他工作匹敌。
https://t.co/TpFFnwPWkc
整洁的 GitHub 仓库:https://t.co/HOuqE0fHaF
这是 LeJEPA 结果在世界模型上的应用,基于三个不同机器人风格测试的经验离线训练,每个数据集含一到两百万步。重申了 SigReg 损失相比先前世界模型方法的优势。
使用未经修改的 HuggingFace ViT-Tiny 视觉变换器,输入 ImageNet 标准的 224x224 RGB 像素图像以生成潜在表示。由于 ViT 以层归一化层结束,需要额外的后投影步骤使 SigReg 能自由地将潜在表示扰动为独立高斯分布。还测试了 ResNet-18,性能良好但略差。
使用 192 维潜在表示。将潜在维度加倍至 384 时性能略有下降;了解其是否稳定或随着潜在过大而继续恶化会很有帮助。批次大小与 SigReg 之间存在关系,更大的潜在表示若配合更大的批次大小可能提升性能。
预测器使用 ViT-S 骨干——当潜在表示是扁平时为何用视觉变换器?两个基准测试使用 3 组历史潜在表示,另一个使用 1 组。“小”模型性能明显优于“微小”模型,但较大的“基础”模型性能显著下降,这很有意思。
预测器上 0.1 的 dropout 显著提升了性能。0.2 仍比 0.0 好,但 0.5 更差。
使用 128 x 4 轨迹的批次训练。希望他们的训练损失图能更放大并带网格线。
在测试时进行规划,而不是像 Dreamer / Diamond 那样通过想象训练构建策略。最多推出 300 个初始随机动作序列,规划范围 H 为 5(帧跳跃 5)。使用交叉熵方法迭代最多 30 次。论文主体提到使用模型预测控制策略,仅执行前 K 个规划动作后重新规划,但附录 D 说他们执行所有 5 个规划动作。
训练后,他们探测潜在空间以证明其捕获并表示了物理有意义的量。还实现了一个从潜在空间回到像素的解码器——算法未使用,但有助于观察潜在空间实际表示的内容。他们测试了将重建损失纳入训练,但性能有所下降。
最终 SigReg 的 λ 为 0.1,而 LeJEPA 论文中为 0.05。1024 个 SigReg 投影,但观察发现数量影响可忽略。
我喜欢 JEPA 框架,但到目前为止,我将其用于 Atari 游戏价值函数的尝试未能与其他工作匹敌。
JEPA 终于可以轻松端到端训练,无需任何技巧!
兴奋地介绍 LeWorldModel:一个稳定、端到端的 JEPA,直接从像素学习世界模型,无需启发式方法。
1500 万参数,1 块 GPU,完整规划时间 <1 秒。
📑:https://t.co/cpTzgvbTS0 https://t.co/Z2De9ASzcW