D-JEPA:决策对齐的潜在世界模型
潜在世界模型能够预测动作的后果,但预测准确并不保证潜在距离能反映哪个候选会被成功执行。我们识别出一种决策局部预测差(decision-local prediction gap):在少数几个竞争执行的未来中,被预测更接近目标的候选,其实际结果可能比可用的替代方案更差。 我们提出 D-JEPA,一种决策对齐的潜在世界模型,它从已执行的结果中学习候选未来之间的决策相关关系。一个有界、置换等变 的算子联合推理目标相对的预测特征与序数证据,在动作选择最关键的处所精细化预训练的预测几何;受限的预测器适配与共享的序数接口将这种对齐扩展到互补的预测几何之上。D-JEPA 进一步在 JEPA 兼容的未来表征中实现所学到的决策结构,从而可经由原生潜在距离规划进行部署。 在潜在控制、操作、预训练动作生成模型、真实机器人与自动驾驶等任务上的评估显示动作选择得到改善:PushT 上成功率达 87.89%,RoboTwin 上平均提升 15.04 点,真实机器人任务提升 17 点。 这些结果确立了决策相关的关系结构是连接预测世界建模与有效控制的直接桥梁。
论文精读
TL;DR D-JEPA 在潜世界模型中引入决策对齐,直接学习候选未来间的决策相关关系,修复预测准确但选择失误的问题,在 PushT、RoboTwin 和物理机器人任务上显著提升动作选择成功率。
问题
问题背景
潜在世界模型(latent world model)通过预测未来状态支持行动选择,核心假设是潜在空间距离与执行结果排序一致。
现有方法局限
现有方法通常优化预测精度或重建损失,但决策局部预测差距 (decision-local prediction gap) 表明:在少数竞争性未来中,预测距离更近的候选可能实际执行更差。具体技术局限包括:
- 预测误差最小化对齐全局统计特性,不保证决策边界的局部序数关系;
- 潜在几何缺乏对执行结果的显式建模,无法从成功/失败中学习相对偏好;
- 基于价值函数的方法需要额外奖励标定,对稀疏奖励和复杂环境适应性差。
accurate prediction does not guarantee that latent distance reflects which candidate will execute successfully.
为什么难/重要
难点在于决策相关的候选未来通常数量极少,且结果噪声大,样本效率要求高;同时需要保持预测能力与决策对齐的平衡,避免过拟合特定任务。机器人操作、自动驾驶等场景中,错误的行动选择代价高昂,而现有预测模型在真实部署中往往排序不稳定。
行业类比
类似推荐系统中点击率预估准确但排序结果差,需要引入 learning to rank 的序数学习;D-JEPA 相当于为世界模型添加决策排序层。
核心洞察
- 决策对齐的潜在世界模型需要优化候选动作之间的相对排序,而非仅优化预测精度。现有 latent world models 普遍假设 latent 距离与执行成功率单调相关,但 D-JEPA 揭示的 **decision-local prediction gap** 表明,在少数候选动作竞争时,预测距离更近的候选可能在实际执行中表现更差。D-JEPA 直接从历史执行结果中提取 **ordinal evidence**(序数证据),并与目标相对特征联合建模,将 latent 几何对准决策需求。不同于事后调整 planner 或强化学习奖励塑形,它把决策结构直接嵌入表示学习,因此对 latent-distance planning 的干预最小,且不牺牲预测模型的泛化能力。
- 通过有界置换等变算子和受限制的预测器适配,D-JEPA 实现了跨预测几何的决策对齐,且部署轻量。D-JEPA 使用一个 **bounded, permutation-equivariant operator** 融合 goal-relative predictive features 和 ordinal evidence,仅对预训练预测器的少量部分进行调整(**restricted predictor adaptation**),并通过共享的序数接口将同一决策结构迁移到多个互补的预测几何。这与重新训练世界模型或引入额外策略网络的方法形成对比:它在保持各预训练模型原有预测能力的同时,仅在动作选择最关键的局部区域重构 latent 距离,因此可灵活适配不同来源的 action-producing models(如 PushT、RoboTwin、物理机器人等),并在多平台上取得一致提升。
方法
输入与问题定位
D-JEPA 面向预训练 latent world model,输入为候选动作序列产生的未来潜在表示、目标相对特征,以及从实际执行结果获得的序数证据(哪个候选成功/失败)。核心识别到 决策局部预测差距:多个候选未来中,预测距离目标更近的候选可能实际执行结果更差。
关键模块
- 有界排列等变算子:在有限的候选集合上联合处理目标相对预测特征与序数证据,输出决策敏感的几何调整。算子有界,避免过度扭曲原始预测空间;排列等变性保证候选顺序不影响学习。
- 受限预测器适应:仅对预训练预测器做小幅调整,保留原始预测能力,同时将决策结构推广到互补预测几何。
- 共享序数接口:统一不同预测器输出的序数证据格式,使对齐模块可跨几何复用。
- 表示提升:将学习到的决策关系映射到 JEPA 兼容的未来表示中,使决策对齐后的潜在距离可直接用于规划。
输出
输出为决策对齐的 latent world model,支持原生 latent-distance planning,无需额外策略网络。
与同类方法差异:D-JEPA 不是重新训练预测模型,而是在预训练预测几何上叠加有界、决策感知的关系学习,从执行结果中直接塑造潜在距离,实现预测精度到决策效用的桥接。
实验
实验设计
D-JEPA 在四类决策场景中评测:PushT 推动任务、RoboTwin 双臂操作、真实机器人任务、自动驾驶轨迹选择。核心流程是生成多个候选未来,用潜伏距离排序,再与实际执行结果对比,量化 decision-local ranking 一致性。针对预训练动作生成模型和预测几何做受限适配。
关键发现
- PushT 成功率 87.89%;
- RoboTwin 平均提升 +15.04 点;
- 物理机器人任务提升 +17 点;
- 结果表明“预测更近”不等于“执行更好”,决策对齐的潜几何能修正排序。
与基线对比
相比纯预测损失训练的世界模型,D-JEPA 通过 ordinal evidence 与 permutation-equivariant operator 显式学习候选未来间的相对优劣,而不仅是重建误差。其对齐模块仅做受限适配,保留原预测泛化能力。工程启示:可在现有预测世界模型上轻量插入决策对齐模块,不必推翻重训;开放源码见 项目主页 与 GitHub。
行业影响
落地场景
D-JEPA 可落地于具身智能控制、自动驾驶决策与机器人操作。例如在电商仓储场景,机械臂抓取与放置任务中,使用 D-JEPA 的世界模型预测候选动作的未来潜状态,并基于决策对齐的潜距离选择成功率更高的动作,减少错误抓取和物品损坏。在自动驾驶中,变道与汇入场景下,模型可从大量候选轨迹中筛选出实际可执行且靠近目标的轨迹,提升安全性。
商业价值
主要体现为降低机器人/自动驾驶系统的试错成本。传统世界模型仅优化预测精度,但预测接近的潜表示未必对应更高的执行成功率,导致物理部署需要大量真实环境调参。D-JEPA 通过学习执行结果中的序数关系,直接对齐决策目标,使动作选择更可靠。论文显示 PushT 成功率 87.89%,物理机器人任务增益 17 点,意味着可缩短开发到部署周期,减少现场干预。对自动驾驶,可提升复杂场景下的通行效率与安全性,降低事故率。
与现有工作流集成
D-JEPA 可作为现有 JEPA 类世界模型 的决策对齐插件。其设计保持 JEPA 兼容的未来表示,支持通过潜距离规划直接部署。工程上可先基于预训练潜世界模型提取特征,再接入 D-JEPA 的 bounded permutation-equivariant operator 和 ordinal evidence 模块,用少量执行数据微调对齐。对于已使用动作生成模型的系统,D-JEPA 提供互补预测几何的适应,可作为候选重排序组件,无需替换原有规划器。推荐参考 项目主页 和 GitHub 获取实现细节。
局限
- **依赖预训练表示质量与序数证据的收集成本**:D-JEPA 在预训练潜在几何上做决策对齐,其效果受限于原始世界模型的预测精度和表征可辨别性。序数证据来源于执行候选动作后的实际结果,在真实机器人或自动驾驶场景中需要额外在线交互,样本效率可能不足。论文虽用离线数据或仿真,但未充分讨论如何低成本获取足够且多样的序数对,可能限制其在数据稀缺任务上的应用。
- **任务与领域泛化边界尚未明确**:实验覆盖 PushT、RoboTwin、物理机器人、自动驾驶等,但每个任务均需定制候选生成与执行接口,方法是否对未见任务分布、动力学变化或跨 embodiment 泛化仍存疑。对比基线未必覆盖所有近期决策感知表示学习工作,且缺少大规模基准(如 DMControl 多样任务)验证,可能夸大决策对齐增益的普适性。
- **理论性质与实际收益的关联尚待加强**:论文附录给出有界对齐、置换等变等理论性质,但实验中的提升是否直接归因于这些性质(而非超参数调优或候选构造)未做充分消融。此外,原生潜在距离规划的实现依赖 JEPA 兼容表示,对非 JEPA 类世界模型迁移性有限。