论文

DSReg: 可证明地恢复个体世界潜变量,无需重建

DSReg: 可证明地恢复个体世界潜变量,无需重建

从非线性 ICA 到字典学习与因果表征学习,恢复世界个体潜变量的方法通常依赖 重建、辅助监督或非高斯性等分布不对称性,把潜变量锚定到观测上。而 JEPA 这类缺少锚点的方法只能将潜状态辨识到线性变换,个体潜变量依旧混杂。 本文的关键条件是 Structural Diversity(结构多样性):不同潜变量在观测上留下各不相同的依赖足迹。基于 LeJEPA 提供的线性可辨识性,作者证明在该条件下,DSReg(Dependency-Sparsity Regularization)可把个体世界潜变量恢复到符号置换,且无需重建、无需解码器、无需标签。 DSReg 可事后应用于任意线性可辨识表征,复用已训练的 checkpoint,且相较联合训练无损失,由此建立起首个完全可辨识、能恢复每个世界潜变量的 JEPA。作为对依赖足迹的条件,Structural Diversity 严格弱于此前所有可辨识潜变量模型的结构条件。 在合成场景、世界模型探针、学习到的视觉编码器与外部渲染器上,DSReg 在保持 稠密预测 的同时,随规模提升 个体潜变量恢复 与下游使用效果。

论文精读

TL;DR DSReg 利用 Structural Diversity(不同隐变量有不同依赖足迹)对线性可识别表示做依赖稀疏正则化,无需重建或解码器即可恢复个体世界隐变量至带符号排列,首个完全可识别 JEPA。

问题

问题背景

表示学习领域的目标是从高维观测中恢复产生数据的独立潜在因子(world latents)。传统方法依赖重构损失、辅助监督或非高斯性等分布假设来锚定潜在变量;而联合嵌入预测架构(JEPAs) 通过自监督预测任务,无需重构即可获得观测的线性可识别表示,但只能将潜在状态恢复到一个可逆线性变换内。

现有方法局限

  • 重构型方法(如 VAE、非线性 ICA)强制解码器还原观测,但现实应用中重构目标往往不可行或代价高昂(如视频预测、高维感知输入)。
  • 基于分布不对称的方法(如非高斯 ICA)依赖特定统计假设,在自然数据中常被违反。
  • JEPAs 虽然绕开重构,但其线性识别结果意味着潜在变量仍被任意旋转混合,无法分离出个体潜在因子(如光照、姿态、纹理)。从工程角度看,混合表示无法支持稀疏操控、因果干预或可解释推理,限制了下游任务(如世界模型、机器人控制)的可用性。

为什么这个问题难且重要

从线性识别到分量级识别(signed permutation)存在根本障碍:旋转不变性。任何旋转后的表示都保持同一线性子空间,因此需要额外结构来打破旋转对称。本文提出的 Structural Diversity(结构多样性)要求不同潜在变量在观测上留下不同的依赖足迹,从而利用依赖稀疏性正则化(DSReg) 从线性表示中恢复个体变量。这一条件被证明严格弱于以往所有可识别潜在变量模型的结构条件,且无需重新训练,可事后应用于任意线性识别表示。

业界对可解释、可操控的世界模型需求强烈:例如在自动驾驶或机器人仿真中,需要分离控制变量(如转向角、速度)与干扰变量(如天气、光照),以便进行安全策略学习或域迁移。

行业类比

类似视觉 Transformer 的特征解耦:如果自监督预训练模型输出的特征能将“物体类别”与“拍摄角度”自然分离,无需额外标注即可用于零样本操控或公平性审计,将大幅降低下游适配成本。

核心洞察

  • 将线性可识别表示中的旋转不变性转化为可利用的信号,通过 Structural Diversity(不同潜变量在观测上留下不同依赖足迹)和 Dependency-Sparsity Regularization,无需重建即可恢复个体潜变量到 signed permutation。与依赖非高斯性、重建或辅助监督的非线性 ICA、字典学习等方法不同,DSReg 不需要解码器或标签,且 Structural Diversity 严格弱于以往所有结构条件,扩展了可识别潜变量模型的适用范围。
  • DSReg 是一种后处理方法,可应用于任何线性可识别表示(如 LeJEPA),直接复用训练好的 checkpoint,无需联合训练即可实现个体潜变量恢复,且理论证明无性能损失。这在实际工程中显著降低计算成本,避免重新训练大型 JEPA 模型的负担,同时实验表明在密集预测任务上保持性能,并提升潜变量恢复和下游任务表现。
  • 论文证明 Structural Diversity 是基于依赖足迹的条件,严格弱于此前可识别潜变量模型(如非线性 ICA、字典学习、因果表示学习)的结构假设。这意味着更多真实世界的数据分布可能满足该条件,从而扩大了无重建、无监督个体潜变量恢复的适用场景,对部署世界模型和表示学习具有重要启示。

方法

输入

方法接收一个线性可识别表示(如 LeJEPA 或其他 JEPA 架构输出),其中个体世界隐变量仅恢复至未知线性混合(旋转/缩放)。

关键模块

DSReg(Dependency-Sparsity Regularization) 是一个后处理步骤,不修改编码器或重新联合训练。它施加依赖稀疏正则化:在观测数据上估计每个隐变量对观测的依赖结构(依赖足迹),利用 Structural Diversity(不同隐变量产生不同的依赖模式)来搜索一个旋转矩阵。具体做法是最小化旋转后各坐标的依赖结构之间的重叠,使每个坐标的依赖集尽量稀疏且互不相同,从而将混合表示旋转到个体隐变量的自然轴。

输出

输出为 signed permutation 恢复的个体世界隐变量,每个坐标对应一个真实世界因子(允许符号翻转和排列)。整个过程无需重建、解码器或标签。

与同类方法的差异:相较于 非线性 ICA(依赖非高斯性)、字典学习(依赖重建)或有监督解耦,DSReg 仅利用观测与隐变量之间的依赖结构多样性,且作为后处理可复用任意已训练好的线性可识别 checkpoint,不损失原始任务性能。

实验

实验设计

作者在四个层级验证 DSReg:合成数据、世界模型探针、已学习的视觉编码器、外部渲染器。从 LeJEPA 得到的线性可辨识表示出发,后处理应用 DSReg,检验能否将个体潜在变量恢复至符号置换。评估指标包括恢复度量(如 MCC)、稀疏使用探针在下游任务中的性能,以及消融实验、维度扩展至 d=8192 的算力测试。每组实验均与理论预测的 regime 进行对照。

关键发现

  • DSReg 在合成数据和世界模型探针上端到端恢复个体潜在变量,理论与实验吻合。
  • 稀疏模块可以通过恢复的潜在变量起作用,验证了物理基的合理性。
  • 在已学习的视觉编码器和外部渲染器上,DSReg 仍能提升个体潜在变量恢复,且不损害稠密预测性能。
  • 单 GPU 可处理高维(d=8192),成本不随观测维度 p、m 增长(使用无偏估计器)。

与基线对比

与需要重建、辅助监督或非高斯性的非线性 ICA 等方法相比,DSReg 首次在 JEPA 框架下实现完全可辨识,无需解码器或标签。它作为后处理步骤,不损失联合训练已获得的表征质量,且结构性多样性条件弱于所有先前可辨识潜在变量模型的结构条件,适用面更广。相较于标准 JEPA 仅达线性可辨识,DSReg 进一步解混线性混合,直接恢复个体维度,为下游编辑、控制等任务提供物理可解释的操作单元。

行业影响

落地场景

DSReg 的核心能力是无重建、无标签地恢复个体世界隐变量,这直接服务于三类产品:自动驾驶 / 机器人世界模型(从预测性表示中解耦出道路几何、障碍物速度、光照等因子)、内容平台与电商推荐(将用户行为序列的 JEPA 表示分解为价格敏感度、品类偏好等独立因子)、医疗影像与工业质检(从自监督特征中提取可解释的病理或缺陷因子)。它不依赖重建或标签,可后处理已有模型。

商业价值

  • 降本:复用训练好的 checkpoint,无需重新训练或引入解码器,节省标注与算力成本。
  • 增收 / 体验提升:可解释因子提升产品合规与用户信任;下游少样本学习、稀疏探针性能提升,直接改善推荐点击率、自动驾驶安全性等业务指标。

与现有工作流集成

DSReg 作为后处理步骤,只需给定线性可识别表示(如 LeJEPA 输出),通过估计 Jacobian 依赖结构并施加依赖稀疏正则化,即可得到解混矩阵。可与现有推理管线无缝结合,无需改变预训练模型架构。对大规模部署,可选用流式估计或分块模式,已在 d=8192 维度验证可扩展性。

具体落地 Use Case

  1. 电商推荐:用户行为序列经过 JEPA 得到表示,用 DSReg 恢复“价格敏感度”“品类偏好”“活跃时段”等因子,推荐策略可直接调整对应因子权重,实现可解释的个性化。
  2. 自动驾驶感知:视觉编码器的中间表示经 DSReg 分解后,世界模型预测模块可分别针对“道路曲率”“障碍物速度”因子做鲁棒推断,便于调试与安全验证。

局限

  • - **Structural Diversity 条件可验证性有限**:该条件要求不同 latent 在观测上留下可区分的依赖足迹,但真实世界高维数据中这一假设难以先验验证,论文仅在合成与小型探针环境验证;若条件不成立,理论保证退化。
  • - **依赖线性可辨识基座**:DSReg 需要 LeJEPA 提供的线性辨识表示作为起点,若基座模型不满足线性可辨识假设或 Jacobian 估计误差较大,permutation 恢复可能失败;虽然提出无偏估计,但高维下稳定性仍待检验。
  • - **实验与工程规模有限**:论文未在大规模视觉或世界模型(如 V-JEPA、I-JEPA 的完整规模)上验证,恢复的 signed permutation 仍需额外对齐才能用于因果推理或操控,且 GitHub 仅有 3 stars,社区验证不足。
论文Yujia Zheng2026-10-07原文

相关内容