论文

Self-Supervised Learning of Structured Dynamics from Videos

Self-Supervised Learning of Structured Dynamics from Videos

理解视频中的运动是视觉学习的基本挑战,因为帧间变化混杂了两种动态来源:相机运动和物体运动。在表征学习中,这种分解尚未充分探索,部分原因是这些因素在自然视频中紧密耦合且难以单独监督。然而,恢复这种分解对于学习能分离有意义物体动态与相机诱导变化的鲁棒运动表征至关重要。 我们研究了能否从预训练图像视觉Transformer的冻结特征中恢复此类结构化运动表征。提出结构化动力学模型(SDM),通过未来特征预测明确分离主导时间变化与残差动力学,而不是用单一纠缠潜变量或无结构的空间密集过渡令牌表示视频变化。训练结合真实视频上的自监督学习与合成Kubric数据上场景动力学的弱监督。 在ProbeMotion(一个涵盖合成和真实视频的新评估套件,包含相机运动、物体运动和组合动态)上评估SDM。SDM在使用全局CLS或平均池化特征的基线中表现更优,并在多个探针上优于强监督表征(如VGGT),尽管使用的监督显著更弱。这些结果表明,预训练图像模型可以轻松重新用于结构化视频动力学表征,为学习和分析潜在视频动力学提供有用的归纳偏置。

论文精读

TL;DR SDM 从冻结图像 ViT 特征中显式解耦相机与物体运动,通过自监督与弱监督学习结构化视频动态,在 ProbeMotion 上超越基线并媲美强监督方法 VGGT。

问题

问题背景

视频理解的核心挑战之一,是从帧间变化中提取结构化运动信息。当前领域高度关注如何让模型学习可解耦的运动表征,从而支持下游任务(如动作识别、物体追踪、场景理解)。

现有方法局限

多数自监督视频方法将帧间变化编码为一个纠缠的全局特征空间密集的过渡 token,未显式建模相机运动与物体运动的差异。这导致:

  • 相机抖动、缩放等全局变化会严重干扰对物体动力学的捕捉;
  • 无法分离场景中主导运动与残余运动,使特征对视角变化不鲁棒;
  • 由于缺乏解耦监督,纯自监督训练难以强制模型学习这种结构化分解。

为什么这个问题难/重要

困难在于:真实视频中相机运动和物体运动高度耦合,且缺乏成对的解耦标注。技术上需解决:

  1. 如何在没有显式运动标签的情况下,将两种运动源分离;
  2. 如何设计预测任务来引导模型关注物体自身的运动,而非相机引起的全局光流;
  3. 如何利用有限的合成数据弱监督,使模型泛化到真实场景。 业界对此高度关注,因为鲁棒的运动解耦是机器人视觉、自动驾驶、视频编辑等领域的基石。

行业类比

类似 NLP 中从自回归语言模型迈向可控文本生成,需要将语法、风格等因素解耦;视频运动的结构化分解,也是从“黑盒”特征走向可控视频理解的关键一步。

核心洞察

  • 视频动态的结构化分解将帧间变化显式解耦为相机运动与物体运动,而非沿用单一纠缠表示或密集时空 token。过去的方法往往将视频变化视为整体运动流,或使用非结构化的密集变换 token 预测,难以区分场景自身的动态与拍摄引入的视点变化。SDM 通过未来特征预测,将时序变化拆分为主导源 (通常为相机运动) 和残差动态 (物体运动),为运动表征学习引入了清晰的归纳偏置,使下游任务能单独关注有意义的物体运动,而不会受相机晃动的干扰。
  • 从冻结的预训练图像 ViT 特征出发,通过自监督与合成数据弱监督的结合,高效地学习视频动态表征。相比需要大规模视频预训练或强监督 (光流 / 深度) 的模型,SDM 仅利用少量合成数据的弱动态标签,配合真实视频的自监督预测目标,即可将现成的图像模型快速改造为结构化运动编码器。这大幅降低了计算与标注成本,同时证明静态图像特征中已隐含足够的时序信息,只需适当的解耦训练即可显式恢复。

方法

模型输入与特征提取

SDM 以视频片段作为输入,首先利用冻结的预训练图像 ViT(如 DINOv2)逐帧提取空间特征,保留 [CLS] token 和 patch tokens,但不进行端到端微调,从而避免在有限视频数据上过拟合。

核心模块:结构化动态分离

SDM 的关键设计是显式分解时间变化为两类动态:

  • 主导动态(dominant dynamics):通常对应相机运动带来的全局变化,通过一个学到的全局变换参数化;
  • 残差动态(residual dynamics):由场景中独立目标的运动引起,建模为稀疏的局部偏移或可变形注意力。
    模型基于当前帧特征预测未来帧特征,而非直接生成像素,迫使网络学习紧凑的动态编码。具体而言,SDM 利用一个轻量解码器,将主导动态应用于全图特征,再叠加残差动态修正局部区域,得到未来特征估计。

训练策略与损失

训练采用混合范式:

  • 在真实视频(如 Something-Something v2)上使用自监督未来特征预测损失(如余弦相似度),不依赖任何运动标注;
  • 在合成数据集 Kubric 生成的视频上施加弱监督,提供场景动态的简单先验(如物体位置变化),引导残差分支学习目标运动,但不要求稠密光流或跟踪。
    损失整体为自监督项与弱监督项的加权和,平衡对真实数据复杂性的适应与对运动结构的显式约束。

输出表示

SDM 输出的结构化表示包括:全局主导运动参数和稀疏残差运动 token,这些可作为下游任务(如动作识别、运动分析)的即插即用特征。与直接使用 ViT [CLS] 或平均池化特征相比,SDM 显式建模运动分解,从而在 ProbeMotion 基准上表现更优。

与同类方法的差异

不同于以往将视频变化编码为单一纠缠隐变量无结构的密集时空 token 的工作(如 TimeSformer 的时空注意力),SDM 通过动力学分层分解提供了更强的归纳偏置,使得在小数据量弱监督下也能学习到可解释的运动表示。

实验

实验设计

论文构建了一套新的评估基准 ProbeMotion,涵盖合成与真实视频,系统地包含三种动态类型:纯相机运动、纯物体运动、以及两者组合。训练过程结合了两个数据源:在大量真实视频(如 Something-Something v2)上进行自监督未来特征预测,同时在合成的 Kubric 数据上施加弱监督以暗示场景运动分解。核心模型 SDM 接收冻结的预训练 ViT 特征,输出显式分离出的主导运动(通常为相机运动)与残余动态(物体运动)的表示。

关键发现

  • SDM 利用冻结的图像 ViT 特征,通过结构化预测框架解耦视频中的运动因素,其下游探测性能显著超越仅使用全局 CLS token 或平均池化特征的基线。
  • 尽管 SDM 的训练信号远弱于全监督模型(如 VGGT),但在多个探测任务上表现可比甚至更优,验证了弱监督下学习结构化运动表示的可行性。
  • 消融研究证实,显式分离主导运动与残余动态的归纳偏置至关重要,若丢弃分离结构(例如退化为单一纠缠潜在变量或非结构化密集 token),性能会大幅下降。

对比基线深度解读

传统视频表示学习常将帧间变化压缩为单个全局向量,无法区分运动来源。SDM 的改进表明,冻结的图像模型已蕴含丰富的运动线索,只需加入适当的时序结构即可提取。相较于需要大量标注数据的 VGGT 等强监督方法,SDM 仅需合成数据的弱场景动态监督,却能在类似真实视频的运动理解任务上取得竞争性能。这为实际工程提供启示:当标注成本高昂时,可将预训练图像主干与结构化时序头结合,配合合成数据弱监督,高效构建可解释的运动表示,特别适用于机器人视觉、视频编辑等需区分“谁在动”和“相机怎么动”的场景。

行业影响

落地场景

结构化视频动力学分离 技术可直接赋能多个需要理解“谁在动、怎么动”的行业场景。

  • 视频编辑与特效:自动分离相机运动与物体运动,实现运动重定向或背景稳定,简化后期制作流程。
  • 自动驾驶与机器人:从车载/机器人视频中去除自车运动,精准提取其他车辆、行人等独立物体的运动轨迹,提升场景理解与预测可靠性。
  • 智能监控与安全:在 PTZ 或移动摄像头视频中滤除镜头摆动,聚焦异常物体运动,降低误报率。
  • 电商与内容平台:商品展示视频中消除手抖或运镜干扰,突出商品本身的动态细节,改善用户观看体验。

商业价值

  • 降本:作为基于冻结预训练 ViT 的轻量模块,无需昂贵标注与重训练,可快速嵌入现有视频分析流水线,降低运动特征工程与人工修图成本。
  • 增收:赋能视频编辑工具提供“一键运动分离”高级功能,形成差异化定价;同时提升自动驾驶感知的鲁棒性,加速算法落地,缩短 ROI 周期。
  • 体验提升:在短视频创作、直播特效等场景中,实现实时、稳定的运动解耦,让内容更专业、更吸引用户,间接提升留存与转化。

与现有产品/工作流的接口

SDM 作为一个独立的 motion feature extractor,输入为若干帧视频,输出 主导运动潜变量 (通常对应相机) 和 残余运动潜变量 (物体)。其接口极简:

  • 上游:对接任意视频帧序列,推荐使用预提取的 DINOv2/ViT 特征以进一步加速。
  • 下游:分解后的运动特征可直接用于替代现有架构中的 CLS token 或时空池化特征,作为动作识别、运动预测、视频异常检测等任务的输入。
  • 部署:模型仅包含少量可学习参数,适合云端或边缘侧部署,无需修改现有编解码管道。

典型用例

  1. 电商直播商品展示:主播手持相机移动展示产品时,SDM 实时分离相机晃动,输出只包含商品旋转/开合等动作的稳定动态特征,用于自动生成清晰的产品 GIF 或判断展示质量。
  2. 自动驾驶运动预测:自车在复杂路况下行驶,SDM 对前视视频提取去自我运动后的物体动态编码,馈入下游轨迹预测网络,显著降低因相机抖动或快速转向造成的预测漂移,提升安全规划精度。

局限

  • **依赖冻结的图像预训练特征**:SDM 建立在 frozen image ViT 之上,本身不学习适应视频动态的特征。这种设计虽然轻量,但限制了对长程时序依赖或复杂运动模式(如流体运动、透明物体)的捕获能力,且无法通过端到端微调纠正上游模型在动态场景下的偏差。
  • **合成数据弱监督的泛化边界**:训练中使用的 Kubric 合成数据虽提供相机/物体运动真值,但其场景复杂度与真实世界(如光照变化、非刚性形变)存在分布差异。论文未充分验证这种弱监督在 open-world 视频上的退化程度,可能导致分离的动态表示在域外场景下不可靠。
  • **评估指标与下游任务脱节**:ProbeMotion 主要评估特征的可解码性(如线性探针),但缺乏直接下游任务(如动作识别、物体跟踪)的验证。对比的强监督模型 VGGT 本身针对 3D 重建优化,SDM 在探针上的优势能否转化为实际应用收益尚不明确。
论文Lukas Knobel2026-07-23原文

相关内容