动态

LeWM 基于 JEPA 和 SIGReg 实现稳定端到端世界模型

LeWM 基于 JEPA 和 SIGReg 实现稳定端到端世界模型
Junfan Zhu 朱俊帆
🦤 LeWorldModel: 从像素学习物理——仅需两个损失的稳定世界模型
世界模型:
1️⃣ DINO-WM: 预训练 ViT 编码器(来自 ImageNet)→ 特征 → 预测器。但编码器冻结,无端到端学习。其“视觉基因”针对粗粒度分类(猫 vs 狗)调优,而非物理:难以分辨毫米级变化(如 2 mm 块运动)。在“短视”编码器上的强大预测器 = 盲目的物理推理。
2️⃣ PLDM: 端到端,但不稳定且易崩溃。依赖奖励作为预测目标,因此仅在有显式奖励的环境(如游戏)中有效。
3️⃣ JEPA(联合嵌入预测架构):预测下一潜在表示而非像素。两个难题:
崩溃(编码器 → 常数向量,如全零)
同时实现像素级 + 端到端 + 稳定

💡 LeWM 解决:
👉 JEPA 从原始像素稳定端到端训练
👉 单一超参数 λ:
下一嵌入预测
SIGReg(高斯正则化)

🧠 #1: 真正的端到端
无冻结编码器。感知 + 动力学共同进化 → 表示与细粒度物理对齐,而非 ImageNet 偏差。
🧠 #2: “仅”一个超参数
PLDM 需要 ~6 个。LeWM 需要 1(λ)→ SIGReg 的权重。即插即用,稳定。

⚠️ 崩溃问题
编码器可能将所有输入映射到同一向量 → 平凡预测 → 零损失 → 无用模型。
🧩 SIGReg(高斯积分签名正则化)
核心:通过分布约束防止崩溃。
采样 1024 个随机方向
投影嵌入 → 1024 个一维“影子”
每个必须通过 Epps–Pulley 检验(≈ 标准正态)
损失推动检验统计量 → 0
任何失败的投影 ⇒ 惩罚
为何有效:
Cramér–Wold 定理 → 高维分布由其 1D 投影决定。
👉 在 1D 投影上强制高斯性可防止在投影约束下发生退化崩溃

🧪 物理探测
在 PushT(推块到目标)中训练,然后:
线性探针恢复:块位置、角度、末端执行器
👉 物理可线性解码
🚨 传送块(物理上不可能):
嵌入异常急剧尖峰
👉 模型内化约束:物体不能传送
👉 并非从像素表面特征推断,而是编码为潜在约束

📈 时间直线性
无平滑性损失,但潜在空间中的轨迹接近直线
👉 无先验,纯粹来自“预测下一嵌入”
👉 暗示物理一致的运动,而非模糊插值

⚡ 性能
规划:0.98s vs 47s(DINO-WM)
成功率:96% vs 78%(PLDM)
为何更快?
DINO-WM:冻结编码器 → 信息损失 → 额外的在线传递
LeWM:端到端 → 表示已与任务对齐
👉 0.98s = 足够快以处理动态障碍和实时控制
⚠️ 局限性
~1500万参数(“蚂蚁级”)→ 在 OGBench-Cube(复杂物理)上失败
尚未在真实机器人上测试

🔥LeWM 表明:
👉 JEPA + SIGReg = 稳定的世界模型
👉 原始像素 → 物理感知潜在空间
👉 最小设计(2 个损失,1 个超参数)
下一步:扩展 + 真实世界部署 🤖
Junfan Zhu 朱俊帆
https://t.co/fZtneVW7Wk
动态Junfan Zhu 朱俊帆2026-04-22原文

相关内容