行业新闻

腾讯开源 SCoPE:以射线空间位置编码提升视频生成相机控制

用射线坐标替代像素网格,让视频模型知道每个 token 看向哪里,从而在单张图片上实现稳定的相机控制和多视角一致性。

视频生成模型通常用像素网格定位 token,但镜头移动时难以保持三维一致性。腾讯等机构提出 SCoPE,将每个 token 转换为相机射线坐标,注入注意力机制,使模型在比较内容的同时判断几何对应。新增参数不足 0.1%,即可实现单图交互式相机控制,并随模型规模扩大优势增强。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/55002590-1485-44a5-a09b-bf5ac2af59de/019(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) 视频模型与世界模型,究竟应该在什么坐标系里工作? 现有视频 DiT 通常以 (u, v, t) 张量网格组织位置。它能标出 token 位于哪一帧、哪一行、哪一列,却没有编码一次观察来自世界中的哪里、朝向哪里。镜头移动或出现重复纹理时,网格地址与场景位置之间的对应很快变得含混。 香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding) ,一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。[![](https://image.jiqizhixin.com/uploads/editor/ee03b0d0-1e06-4754-9c39-f18822e28a13/1787538096719.png)](https://mp.weixin.qq.com/s/-TVlKRJLZVCCOyWtpVKhUg) 视频 1:SCoPE 从单张输入图生成的交互式相机控制结果。画面左下为 WASD 指令,右下为对应相机轨迹。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-24原文

相关内容