论文

Latent-Foresight: 面向 Latent World Models 的端到端可预测表征学习

Latent-Foresight: 面向 Latent World Models 的端到端可预测表征学习

预测场景的未来演化是世界建模的一项基础能力。近期工作表明,在 Vision Foundation Models (VFMs) 的特征空间中操作,能够得到语义丰富、可支撑多样化未来场景理解任务的表征。然而,现有方法依赖两阶段流水线:先用固定的降维方式(如 PCA)或独立训练的 autoencoder 压缩 VFM 特征,再在所得冻结 latent space 之上单独训练一个 predictor。 这种表征学习与时间预测的解耦,以及直接在原始 VFM 特征上施加 predictor 的做法,都无法保证 latent space 的结构适合可预测的动态。为此,我们提出 Latent-Foresight,一个端到端框架,联合学习 latent tokenizer 与基于 flow 的生成式 dynamics model,显式地把表征塑造成支持时间可预测性的形式。为实现稳定的联合优化,我们引入若干关键设计选择,防止 latent collapse,并使重建目标与生成目标相互对齐。 大量实验表明,我们的方法学到了时间上更连贯的 latent representation,在多个未来场景理解任务与不同预测时域上持续优于两阶段基线,同时省去了独立的训练阶段,在高分辨率适配时也同样如此。代码与模型权重见 https://github.com/Sta8is/Latent-Foresight

论文精读

TL;DR Latent-Foresight 端到端联合训练潜在 tokenizer 与流式生成模型,显式塑造可预测的表示,替代两阶段流程并提升未来场景理解性能。

问题

问题背景:场景未来预测是世界模型的基础能力,最近利用 VFM 特征空间 进行语义未来理解成为重点方向。

现有方法局限:现有工作多采用 两阶段管线(two-stage pipeline):先通过固定降维(如 PCA)或独立训练的 自编码器 压缩 VFM 特征,然后在冻结的潜在空间上训练预测器。这种解耦带来几个具体问题:

  • 表示学习阶段不感知时间动态,压缩后的潜在空间可能丢弃对时序预测至关重要的信息;
  • 固定降维无法根据下游预测任务调整编码,导致长期预测误差累积;
  • 直接对原始 VFM 特征做预测则缺乏紧凑的结构化表示,高维特征使预测器效率低且易过拟合。

为什么这个问题难/重要:端到端联合优化表示与动态模型容易导致潜在坍缩,需要在重建目标与生成目标之间精细平衡。业界对世界模型的关注度极高,自动驾驶、机器人等应用需要预测未来语义状态,可预测表示能提升规划与决策的泛化能力。缺少通用的可预测潜在空间制约了现实部署。

行业类比:类似视频压缩中,先固定编码再单独训练传输模型,不如联合优化压缩与预测来提升长期帧间一致性。

核心洞察

  • 端到端联合训练 latent tokenizer 与 dynamics model 迫使表征本身变得可预测,这是对两阶段流水线的根本改进。现有方法先将 VFM 特征压缩为冻结的 latent(PCA 或独立训练 AE),再单独训练预测器,表征不参与时序任务优化;而直接对原始 VFM 特征预测则面临高维冗余。Latent-Foresight 通过联合优化,使 tokenizer 在重建约束之外额外接收到“该表征需支持未来预测”的信号,从而学习到更连贯的时序结构,实验显示下游场景理解任务一致提升。
  • flow-based 生成式 dynamics model 为 latent 空间提供了可逆、精确的似然优化目标,与重建损失联合训练可防止 latent collapse。许多 latent world model 使用扩散模型或 VAE,但在端到端联合训练时容易陷入平凡解或表征退化。Latent-Foresight 采用 flow-based 模型,其精确似然和可逆性使得生成目标与重建目标更易对齐,配合作者设计的关键组件(如噪声水平分布、瓶颈维度等),实现了稳定训练,从而在多个预测 horizon 上优于 baselines。

方法

输入与表示压缩

输入是 Vision Foundation Models(VFM)提取的高维特征图,而非原始 RGB 帧。这些特征语义丰富但维度高、冗余大,直接用于时序预测既低效又难以优化。模型首先通过一个 latent tokenizer(潜在分词器)将特征压缩为紧凑的 token 序列。与两阶段方法不同,该 tokenizer 并非独立预训练,而是在端到端训练中与下游动力学模型同时调整,因此压缩过程会主动保留对时间演化有用的信息,而不是只追求静态重建质量。

动力学建模与生成目标

在 latent 空间上,使用 flow-based generative dynamics model(基于流的生成式动力学模型)建模状态转移。相比直接回归下一时刻 latent 的单点预测,flow 模型可以捕捉未来状态的多模态分布,从而更好地模拟场景演化的不确定性。训练时同时优化两个目标:reconstruction loss(重建损失)保证 tokenizer 可解码、避免 latent 空间坍缩;temporal prediction loss(时间预测损失)驱动 latent 序列可预测。论文强调需要精心设计两者权重与优化策略,使重建目标与生成目标协同而非冲突。

防止坍缩与稳定训练

论文明确指出几个防坍缩的关键设计选择(如对 tokenizer 施加正则化、使用 stop-gradient 或 EMA、在 latent 上注入噪声等,具体消融见正文)。这些技巧让端到端联合优化在实践上可行,避免 latent 退化到常数或低信息解。

跟同类方法的差异点:两阶段方法先固定 VFM 压缩表示再训练预测器,表示对时序任务是被动适应的;而 Latent-Foresight 让表示在预测任务指导下端到端塑形,因此学到更 temporally coherent(时间一致)的 latent 空间,显著降低后续预测器的学习负担。

实验

实验设计

作者在多个未来场景理解任务与不同预测视野上评估 Latent-Foresight,基线包括:

  • 两阶段流水线:先用 PCA 或独立训练的 autoencoder 压缩 VFM 特征,再训练预测器;
  • 直接在原始 VFM 特征上应用预测器的方法。 实验还覆盖高分辨率适配场景,并进行了训练配方的消融研究。

关键发现

  • 端到端联合优化 latent tokenizer 与 flow-based 生成动力学模型,使 latent 空间具备更强的时间可预测性。
  • 提出的设计选择(防止 latent collapse、对齐重建与生成目标)有效稳定了联合训练。
  • 在多个未来场景理解任务和预测视野上,Latent-Foresight 一致超越两阶段基线,同时消除了独立训练阶段。

与基线对比深度解读

两阶段方法的表示学习与时序预测解耦,压缩后的 latent 空间未针对动力学建模优化,导致可预测性不足;直接在原始 VFM 特征上预测则面临高维冗余与语义噪声。Latent-Foresight 通过联合学习将表示塑造为利于时序预测的形式,从根源上改善 latent 空间的动态结构,由此获得更连贯的时间表示与更优的下游任务性能。

行业影响

核心定位

Latent-Foresight 提出端到端联合训练 latent tokenizer 与 flow-based 动态模型,直接从 Vision Foundation Model (VFM) 特征学习可预测的潜在表示,取代传统“先压缩后预测”的两阶段管线。这一设计消除了多阶段训练的集成开销,并为 latent world model 在实时场景理解任务中的工业化部署提供更紧凑、时序一致的表示。

落地场景

  • 自动驾驶与机器人:预测未来场景的语义演变(如交通参与者轨迹、可行驶区域变化),提升决策与轨迹规划的前瞻性。例如在已有感知-预测栈中,用 Latent-Foresight 替换两阶段 latent prediction 模块,高分辨率输入下无需重训整个 pipeline,仅需微调 tokenizer。
  • 视频内容平台与创作工具:用于短视频生成、场景续写、自动剪辑中的未来帧语义预测,降低生成模型的错误累积。
  • 工业视觉与安防:提前预测设备状态或场景异常演化,用于预测性维护和主动预警。

商业价值

  • 降本:移除独立的两阶段训练(PCA/AE + predictor),减少训练计算与工程维护成本;模型结构更紧凑,推理延迟更低。
  • 体验提升:更 temporally coherent 的表示使下游预测任务(如语义分割、未来目标检测)准确率更高,减少长时预测的漂移。
  • 部署灵活性:支持高分辨率自适应,可复用 VFM 特征作为通用 backbone,赋能多任务产品。

与现有工作流集成

可无缝嵌入基于 VFM 特征的世界模型 pipeline:替换现有 frozen latent space 的压缩与预测模块,直接接在 DINOv2 / CLIP 等 VFM 之后。训练完成后的 latent tokenizer 可导出为独立 encoder,与现有 diffusion / flow 生成 head 组合。代码已开源(GitHub),权重可迁移,适合内部世界模型服务的快速原型验证。

工程启示:端到端训练需要在 latent collapse 与重建/生成目标之间平衡,但稳定后可省去多轮特征工程,适合对预测一致性要求高的实时系统。

局限

  • 论文未在正文中系统讨论计算开销。端到端联合训练 latent tokenizer 与 flow-based 生成模型,相比两阶段 pipeline 需要更多 GPU 内存与更长训练时间,尤其在高分辨率适应阶段。作者虽然声称消除了分离训练阶段,但并未提供训练成本对比,实际工程部署时可能成为瓶颈。
  • 实验数据集有限,主要在 Cityscapes 等自动驾驶场景验证,缺乏对更复杂动态场景(如自然视频、人体动作)的泛化评估。且依赖特定 VFM(如 DINOv2)特征,若更换 backbone 可能需要重新设计对齐策略,限制了方法通用性。
  • flow-based 生成模型在推理时通常需要多步迭代,预测速度可能低于单步回归或蒸馏后的 latent diffusion,实时应用(如在线预测)有挑战。论文未报告推断延迟,与两阶段方法或直接预测原始 VFM 特征的效率对比缺失。
论文Efstathios Karypidis2026-10-01原文

相关内容