DreamWorld:用 3D 几何先验驱动视频扩散,提升新视角生成一致性
DreamWorld 用两阶段生成:先预测 3D 几何结构,再据此合成视频,解决大视角下几何不稳定问题。这项研究让视频生成更符合真实空间规律。
视频扩散模型能按指定相机轨迹生成新视角视频,但缺少显式 3D 几何约束,大角度下易出现形变和空间不一致。智象未来提出 DreamWorld,先让 3D 基础模型生成目标视角的几何结构,再以它为条件合成 RGB 视频,实现几何与外观解耦,在多个基准上取得领先。
DreamWorld 用两阶段生成:先预测 3D 几何结构,再据此合成视频,解决大视角下几何不稳定问题。这项研究让视频生成更符合真实空间规律。
视频扩散模型能按指定相机轨迹生成新视角视频,但缺少显式 3D 几何约束,大角度下易出现形变和空间不一致。智象未来提出 DreamWorld,先让 3D 基础模型生成目标视角的几何结构,再以它为条件合成 RGB 视频,实现几何与外观解耦,在多个基准上取得领先。