腾讯开源 SCoPE:以射线空间位置编码提升视频生成相机控制
用射线坐标替代像素网格,让视频模型知道每个 token 看向哪里,从而在单张图片上实现稳定的相机控制和多视角一致性。
视频生成模型通常用像素网格定位 token,但镜头移动时难以保持三维一致性。腾讯等机构提出 SCoPE,将每个 token 转换为相机射线坐标,注入注意力机制,使模型在比较内容的同时判断几何对应。新增参数不足 0.1%,即可实现单图交互式相机控制,并随模型规模扩大优势增强。
正文摘录
.jpg)  视频模型与世界模型,究竟应该在什么坐标系里工作? 现有视频 DiT 通常以 (u, v, t) 张量网格组织位置。它能标出 token 位于哪一帧、哪一行、哪一列,却没有编码一次观察来自世界中的哪里、朝向哪里。镜头移动或出现重复纹理时,网格地址与场景位置之间的对应很快变得含混。 香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding) ,一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。[](https://mp.weixin.qq.com/s/-TVlKRJLZVCCOyWtpVKhUg) 视频 1:SCoPE 从单张输入图生成的交互式相机控制结果。画面左下为 WASD 指令,右下为对应相机轨迹。