行业新闻

国产世界模型UniWorld-View登顶李飞飞团队榜单,全开源适配昇腾算力

国产团队发布可控视角生成的视觉模型UniWorld-View,登顶权威榜单并全开源,展现精确相机控制能力。

你随手拍段视频或给一张图,UniWorld-View就能生成一段“相机轨迹任你指定”的新视角视频,推拉摇移甚至360°环绕都可以。它采用遮挡感知点云渲染解决视角切换时的纹理错误,相关代码和权重已全部开源。

正文摘录

登顶的是 兔展智能 团队联合北大、鹏城实验室研发的 UniWorld-View (模型已适配国产昇腾算力) : 你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频—— 推、拉、摇、移,甚至“绕着场景 360° 转一圈”都可以,提供“精确听话的相机位姿控制”。 真 · Uni(统一)World-View 了,本次世界模型的训练数据来自北大系初创企业 元空智能 ,代码和权重也已 全部开源 : 官方地址:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View 新视角合成(Novel View Synthesis),本质上是让 AI “脑补”没拍到的角度。 可随手拍的单目视频,视角覆盖约等于没有。喂给它们,轻则空洞伪影满天飞,重则直接摆烂。 生成式路线倒是敢画。但大多数方法只是把相机位姿当个“口头指令”(一个抽象的条件向量)塞进扩散模型—— 几何归几何,生成归生成,相机控制一下子准了。ViewCrafter 、英伟达 GEN3C ,走的都是这条路。 深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。 点云没有“面”的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。 可一旦上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。 UniWorld-View 的第一板斧,就砍向这里——“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。 把这些区域沿相机轨迹逐帧累积成遮挡 mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。 这里还有个巧思。

阅读原文(qbitai.com)→

行业新闻思邈2026-07-24原文

相关内容