论文

PhysStream: 结合结构化场景记忆与细粒度运动控制的流式物理驱动视频生成

PhysStream: 结合结构化场景记忆与细粒度运动控制的流式物理驱动视频生成

交互式视频生成的控制正从粗粒度提示,转向对动态场景进行细粒度、具有物理意义的操控。但现有的可控方法要么在生成开始前就要求给出完整的控制调度,要么依赖像素空间信号——这类信号只规定物体位置,而非物理动力学。 为此,我们提出 PhysStream,一个面向物理落地的图像到视频合成自回归模型。它引入 结构化场景记忆,即从已生成帧在线推导的位置图与物体跟踪图;并通过稀疏速度增量信号实现细粒度运动控制,这些信号编码了物理量,让模型学习背后真正的动力学。 训练分两个阶段:先对双向模型进行运动控制条件微调;再训练因果自回归模型,并额外加入结构化场景记忆,进一步提升物理一致性。 PhysStream 支持多物体桌面刚体场景的生成中途交互控制——这是此前方法不具备的能力。在合成基准上,相比最强基线,其运动分布距离(FVMD)降低 33%,轨迹误差降低 12%;在真实场景对比中,超过 85% 的人类评估者更偏好我们的结果。更多细节见项目网站:https://czzzzh.github.io/PhysStream

论文精读

TL;DR PhysStream 是流式物理基础视频生成模型,通过结构化场景记忆与稀疏速度增量信号实现交互式运动控制,在刚体场景上将运动分布距离降低 33%、轨迹误差降低 12%。

问题

可控视频生成正从粗粒度文本提示转向细粒度、物理驱动的动态场景交互控制。

现有方法局限:

  • 完整控制序列前置:多数方法要求用户在生成开始前一次性提供全部控制信号(如关键点轨迹、光流序列),无法在生成中途实时干预。
  • 像素空间控制:基于光流、关键点或边界框的方法实质是直接指定物体位置,而非编码物理量(如速度、加速度),导致模型难以学习真实动力学,且无法表达速度变化等高层运动意图。
  • 缺乏场景记忆:流式生成时没有维护跨帧的物体位置与追踪信息,容易造成物体漂移、碰撞穿透或物理不一致。

为什么难/重要: 物理一致的交互式视频生成是迈向通用世界模型的关键一步。技术挑战在于如何在自回归框架中注入稀疏、异步的速度增量控制,并保持动力学连贯;同时需要维护结构化场景记忆,以支持长期一致性,并平衡生成质量、物理准确性与推理延迟。业界对数字内容创作、物理仿真、机器人学习等场景有强烈需求。

行业类比:类似自动驾驶仿真 中,用户通过稀疏高级指令实时干预车辆轨迹,而非预先规划整个路径。

核心洞察

  • 稀疏速度增量控制实现物理量驱动的交互式生成,而非像素级位置或预设轨迹。现有可控视频生成要么需要完整控制序列在生成前给定,要么使用像素级信号直接指定物体位置,都缺乏对物理动态的建模和生成中途的交互能力。PhysStream 让用户只需在选中时间步给出稀疏速度方向,模型就能根据底层物理推断后续运动和多物体碰撞,支持生成过程中实时修改指令,这一能力是此前方法所不具备的。
  • 在线构建的结构化场景记忆(位置地图与目标跟踪图)为自回归生成提供显式状态表示。长时视频生成容易因误差累积导致物体漂移和物理不一致,PhysStream 从已生成帧中实时提取位置图与跟踪图,作为显式条件注入下一帧生成,相比隐式记忆或循环状态方法更稳定、可解释,能有效约束物体轨迹与交互,从而在长时程生成中保持物理一致性。

方法

方法概述

输入:单张 RGB 图像 + 用户稀疏速度控制指令,即指定物体在特定时间步的速度增量(编码物理量)。

关键模块:

  1. 结构化场景记忆:从已生成帧在线提取位置图(positional maps)和对象跟踪图(object tracking maps),为模型提供空间布局与运动历史上下文。
  2. 运动控制条件注入:速度增量信号通过 shifted channel concatenation 方式注入网络,使模型学习底层动力学而非显式位置操纵。

训练流程(两阶段):

  • Stage 1:微调双向生成模型,以运动控制为条件,建立速度指令与像素动态的关联。
  • Stage 2:训练因果自回归模型,额外加入结构化场景记忆,进一步提升物理一致性。

输出:物理可信的多物体桌面刚体场景视频,支持生成过程中的交互式控制。

与同类方法的差异:PhysStream 无需在生成前给定完整控制计划,也不依赖像素空间位置信号,而是通过速度增量与在线场景记忆实现中途物理级操控。

实验

实验设计

PhysStream 在合成刚体场景和 in-the-wild 真实视频上进行评估。训练分两阶段:首先双向模型以运动控制条件微调,然后因果自回归模型加入结构化场景记忆进一步训练。评估指标包括 FVMD(流视频运动分布距离)、轨迹误差、人类偏好等。

关键发现

  • 支持交互式 mid-generation 控制,用户可在生成过程中指定每个物体的速度方向。
  • 物理一致性显著提升:FVMD 降低 33%,轨迹误差降低 12%。
  • 人类评估中超过 85% 的对比中胜出。

基线对比解读

与 strongest baselines 相比,PhysStream 在合成基准上大幅降低运动分布距离,表明生成的运动更符合物理规律。轨迹误差的降低说明物体运动轨迹更准确。人类偏好高比例胜出验证了交互式物理控制在真实场景中的实用价值。相比需要完整控制计划的现有方法,PhysStream 的流式控制能力是核心差异。

行业影响

落地场景

  • 交互式视频创作工具:面向内容平台和广告团队,提供 mid-generation 物理控制,如让物体按指定速度碰撞、堆叠,生成符合物理规律的短视频素材。
  • 产品动态展示:电商平台可使用该模型将静态商品图转为多物体交互视频(如餐具滑过桌面撞倒花瓶),增强商品详情页吸引力。

商业价值

  • 降本:替代传统关键帧动画或物理模拟软件的人工操作,单一图片输入 + 稀疏速度控制即可生成多物体刚体动态,降低 CG 制作门槛与时间成本。
  • 差异化体验:提供流式交互(可中途干预),显著提升用户参与度;论文显示人类偏好超过 85%,适合订阅制创意工具或 API 计费。

与现有工作流的接口

  • 模型可封装为 推理 API 或 本地插件,输入首帧图像和用户控制轨迹(速度增量),输出视频帧序列;现有视频编辑软件(如 Premiere、DaVinci)可通过扩展调用。
  • 可作为 预训练组件 嵌入更大的视频生成流水线,例如与 diffusion 模型协同,用于生成物理一致的训练数据供机器人仿真或自动驾驶场景增强。

具体 use case:

  1. 电商产品动态展示:家具品牌可上传单张桌子照片,通过绘制速度箭头让餐具滑过桌面撞倒花瓶,生成逼真的短视频用于商品详情页或社交媒体广告。
  2. 教育物理仿真工具:在线教育平台集成该模型,学生输入初始画面并施加力,实时观察刚体碰撞与运动轨迹,辅助理解牛顿力学,无需专业仿真软件。

局限

  • **场景与物理范围受限**:PhysStream 的主要实验集中在桌面刚体多物体场景,虽然附录提到可变形球与布料数据集,但核心模型和结果仍以刚体为主。对于更复杂的物理现象(如流体、颗粒、断裂、堆叠不稳定平衡),模型能否保持物理一致性尚未验证。此外,真实场景中的光照变化、遮挡、材质差异会严重影响在线提取的位置图与跟踪图质量,进而降低控制精度。结构化场景记忆依赖可靠的检测/跟踪模块,这些模块在复杂场景下的错误会被传播到后续生成。
  • **推理开销与实时性**:自回归生成逐帧预测,叠加在线结构化场景记忆的提取与条件注入,推理延迟显著高于一次性生成模型。论文未提供详细的端到端延迟指标,但运行时分析(附录)可能表明长视频生成时计算成本线性增长。对于需要实时交互的应用(如游戏、仿真预览),当前框架可能无法满足低延迟要求。另外,两阶段训练流程(先双向微调再因果自回归)增加了训练复杂度和资源消耗,较难快速适配新场景。
  • **用户交互负担与泛化性**:速度增量信号要求用户显式指定每个物体在特定时间步的速度向量,虽然物理意义清晰,但操作负担较重,非专家用户难以高效表达意图。论文未讨论如何从自然语言或更直观的演示自动推断速度控制。此外,训练数据来自合成引擎,虽然能覆盖部分物理多样性,但与真实世界物理(如非均匀摩擦、空气阻力、碰撞恢复系数变化)仍有差距,导致在 in-the-wild 场景下可能出现不合理的动态,尽管人类偏好率较高,但定量指标如 FVMD 和轨迹误差仍存在优化空间。
论文Chuhao Chen2026-09-15原文

相关内容