论文

NAMVIS: 下一尺度自回归多视角图像合成

NAMVIS: 下一尺度自回归多视角图像合成

稀疏视角新视角合成 是 3D 内容生成中的核心问题,但基于 diffusion 的方法受限于迭代去噪,使多视角生成在推理阶段代价高昂。 我们提出 NAMVIS,一个无需 diffusion 的框架,将多视角图像合成重新表述为 几何条件化的下一尺度自回归。它不再依靠反复去噪生成目标视角,而是通过少量由粗到细的尺度步骤预测离散视觉 token,并在每个尺度内部以及跨目标视角并行采样所有 token。为把生成过程锚定到显式相机几何,我们提出 Multi-scale Projective Pose Encoding,在每一分辨率上都将源相机与目标相机的变换注入目标视角自注意力与源到目标交叉注意力。NAMVIS 进一步结合全局条件与稠密的几何感知交叉注意力,使模型在保持源视角外观的同时维持目标视角一致性。 在 Objaverse、GSO 与 OmniObject3D 上,NAMVIS 在 PSNR、SSIM 与 LPIPS 上均优于基于 diffusion 的基线,且在相同评测设置下运行速度超过其 3 倍。这些结果表明,几何条件化的下一尺度自回归是稀疏视角多视角合成中一个有前景且高效的替代方案。更多定性结果、视频与资源见 https://corl-team.github.io/namvis/

论文精读

TL;DR NAMVIS 将稀疏多视图合成重构为几何条件 next-scale 自回归,通过多尺度投影姿态编码注入相机几何,在 Objaverse、GSO、OmniObject3D 上超越扩散基线,推理速度快 3 倍以上。

问题

问题背景

稀疏视图新视角合成(NVS)是 3D 内容创建的核心任务,目标是从 2-4 张已知视角图像恢复任意相机位姿下的新视图,广泛应用于数字资产生成、增强现实预览与交互式建模。

现有方法局限

当前主流扩散模型范式在推理效率与一致性上存在明确短板:

  • 扩散模型依赖 迭代去噪,通常需要 20-50 步甚至更多网络前向,每步都需处理全部目标视图与时间步条件,推理延迟高;
  • 多视图一致性通常通过 跨视图注意力 或联合噪声预测实现,计算量随视图数近似二次增长,难以扩展到更多视角;
  • 基于优化的方法(如 NeRF / 3DGS)质量较高,但每个场景需单独训练,无法满足实时或准实时生成需求。

为什么难且重要

该问题的难点在于:一方面要将 相机位姿 显式编码进生成过程,避免生成视图之间的几何错位;另一方面需要在少量采样步内同时保持 源视图外观保真 与 目标视图一致性。业界对低延迟多视图生成有强烈需求,因为它是 3D 资产生成管线的前置步骤,延迟直接决定交互式工具的可用性。

行业类比

这类似于从扩散视频生成转向 next-token / next-scale 自回归 的趋势:用离散 token 逐步细化替代逐时间步去噪,可显著降低推理开销,但 NVS 还需要额外注入投影几何约束。

核心洞察

  • 以几何条件化的 next-scale 自回归替代扩散去噪,使稀疏视角多视图合成摆脱迭代推理瓶颈。扩散模型需要几十步串行去噪,而 NAMVIS 用少量 coarse-to-fine 尺度步生成离散 token,且每个尺度内所有 token(跨目标视图)并行采样,推理速度比同设置扩散基线快 3 倍以上。这种将视觉 token 生成与相机几何解耦但条件化的思路,为高效多视图生成提供了新的工程范式。
  • Multi-scale Projective Pose Encoding 将相机变换注入每个分辨率的 target-view 自注意力和 source-to-target 交叉注意力。与仅在输入层嵌入全局位姿或使用稀疏几何条件的方法不同,NAMVIS 在每个尺度都显式投影相机几何关系,使模型在生成过程中始终保持对视角变换的感知,从而在多视图一致性与重建质量上显著优于扩散基线。
  • 全局 conditioning 与 dense geometry-aware cross-attention 结合,解决了源视图外观保持与目标视图一致性之间的权衡。常规自回归视觉生成方法通常依赖全局条件向量或稀疏交叉注意力,难以在细节保真和多视图几何一致性间平衡;NAMVIS 采用密集的几何感知交叉注意力逐 token 聚合源视图特征,同时保留全局初始化,使生成的目标视图既忠实于输入外观又彼此一致。

方法

方法概述

NAMVIS 将稀疏视角新视图合成定义为几何条件化的 next-scale 自回归 任务,替代扩散式迭代去噪。输入为源视图图像及对应相机位姿、目标视图相机位姿,输出为目标视图图像。

核心流程

  1. 离散 token 化:图像经视觉 tokenizer 转换为多尺度离散 token 金字塔,由粗到细逐尺度生成。
  2. Next-scale 自回归:每个尺度内所有 token 及所有目标视图并行预测;跨尺度按粗细顺序自回归,大幅减少推理步数。
  3. Multi-scale Projective Pose Encoding:在每一分辨率将源/目标相机变换投影编码后注入 target-view self-attention 与 source-to-target cross-attention,使生成过程显式感知相机几何。
  4. 条件融合:全局条件(如 [SOS] token 或源视图全局特征)与密集几何感知交叉注意力 结合,保留源外观并维持跨视角一致性。

训练目标

模型通过 next-scale 自回归损失(预测每个尺度的离散 token)端到端训练,多视图序列采用特定布局与掩码。推理时从最粗尺度开始逐级预测,每个尺度一次并行解码所有 token。

与同类方法差异

与扩散基线(如 Zero123 等)相比,NAMVIS 无需数百步去噪,推理速度提升 3 倍以上;与一般 next-scale 自回归(如 VAR)相比,显式相机几何编码和多视图并行采样是核心区别。

实验

实验设计

NAMVIS 在 Objaverse、GSO、OmniObject3D 三个数据集上评估稀疏视角新视角合成能力,对比 diffusion-based baselines(具体模型未在摘要中列出)。指标采用 PSNR、SSIM、LPIPS,同时测量推理效率。评估设置保持一致,重点验证几何条件自回归范式能否替代迭代去噪。

关键发现

  • NAMVIS 在三个数据集上 PSNR、SSIM、LPIPS 均优于 diffusion-based baselines。
  • 与 diffusion 基线相比,推理速度快 3 倍以上,这得益于 coarse-to-fine 尺度预测与每个尺度内所有 token 并行采样,避免多次去噪。
  • Multi-scale Projective Pose Encoding 将源/目标相机变换注入注意力机制,提升几何一致性且不牺牲源视图外观保真。

与基线对比解读

Diffusion 模型通过多次去噪步骤生成多视图,推理成本高。NAMVIS 用少量尺度步替代去噪,既保持生成质量,又大幅降低延迟。这为实时 3D 内容生成提供了一条工程上可落地的路径:当场景对多视图一致性要求高且计算预算有限时,几何条件自回归可作为 diffusion 的高效替代。

行业影响

落地场景

NAMVIS 作为 diffusion-free 的稀疏视角重建方法,可直接嵌入 3D 内容生成管线:电商商品 3D 展示、游戏资产生成、AR/VR 预览、自动驾驶仿真场景构建等场景均需从少量图像快速合成多视角。其并行采样特性适合实时交互式 3D 建模工具。

商业价值

  • 降本:相比扩散模型,推理速度提升 3 倍以上,降低 GPU 算力与等待时间成本;
  • 体验提升:多视角一致性更好,减少人工修正与重生成次数;
  • 增收:支持更高吞吐的内容生产,可扩展到大规模 3D 资产库构建。

与现有工作流集成

NAMVIS 可包装为 REST API 或无服务器推理服务,输入源视图与相机位姿,输出多视角图像或 token 序列。其自回归结构天然兼容 vLLM / TensorRT-LLM 等推理优化框架;输出 token 可直接对接现有 3D GS / NeRF 重建后端,形成“多视图生成→重建”流水线。

具体落地 use case

  1. 电商 3D 商品展示:商家上传 2-3 张商品照片,NAMVIS 快速生成环绕视图,用于商品详情页 360° 旋转预览,减少专业 3D 建模外包成本。
  2. 游戏资产生成:开发者从概念草图或少量截图快速生成多视角一致的游戏道具或场景,加速原型验证,配合现有 DCC 工具(如 Blender)导入。

局限

  • 论文未展示在复杂真实场景(如室内全景、大尺度室外)上的效果,当前实验集中在物体级合成(**Objaverse**、**GSO**、**OmniObject3D**),物体通常有干净背景与完整 3D 模型,这简化了多视图一致性问题;此外,依赖显式相机姿态意味着输入姿态误差会直接影响投影编码质量,实际应用中由 **SfM** 或里程计估计的姿态往往带有噪声,模型鲁棒性有待验证。
  • 虽然 **NAMVIS** 推理速度比扩散基线快 3 倍,但 **next-scale autoregression** 仍需要多步(coarse-to-fine)串行预测,无法单步出图;相比单步前馈模型(如某些 **LRM** 变体)延迟更高。同时,自回归生成存在误差累积风险:早期尺度预测错误会在后续尺度放大,导致几何变形或纹理模糊。训练时大规模离散 token 词典和多尺度序列也带来较高计算开销,训练成本可能显著高于同规模的扩散模型。
  • 与扩散模型相比,**NAMVIS** 的自回归采样确定性更强,多样性有限(除非引入温度或 top-k 采样,但论文未详细分析采样策略),因此不适合需要多样化输出的生成任务(如 3D 资产生成中的创意探索)。另外,当前模型仅在三个基准数据集上评估,跨数据集泛化虽做了初步测试,但未涉及真实拍摄图像或类别外物体,实际部署到生产环境前还需更多验证。
论文Ramil Khafizov2026-10-03原文

相关内容