论文

HorizonStream: 面向流式3D重建的长视野注意力

HorizonStream: 面向流式3D重建的长视野注意力

在线3D重建需要在严格因果和有限内存约束下估计相机位姿和场景几何。现有方法在处理长序列时常常出现漂移、抖动甚至崩溃。我们追溯这些失败到根本失配:流式几何本质上是时间异质的,证据涵盖从短期对应到持久全局尺度,而当前架构强制统一且病态的影响模式,例如滑动窗口硬截断、无门控循环和因果注意力导致缓存饱和及尖峰状注意力汇聚。 为解决这一问题,我们将几何传播形式化为证据影响核,并提出HorizonStream——一个显式分解该核的长视野Transformer。对于长程时间因子,几何线性注意力学习通道级衰减率,实现有界多时间尺度的几何证据传播;对于短程空间因子,几何局部注意力采用时空RoPE进行可靠3D匹配,同时抑制注意力汇聚。最后,度量读取令牌直接从持久几何状态恢复稳定尺度和刚体位姿。 大量实验表明,仅用48帧片段训练的HorizonStream能稳定泛化到超过10000帧序列,保持恒定内存和线性时间,达到流式3D重建的最先进性能。项目页面:https://3dagentworld.github.io/horizonstream/

论文精读

TL;DR HorizonStream 将流式 3D 重建的几何传播显式建模为证据影响核,用几何线性注意力实现多尺度、有界传播,仅训练 48 帧即可稳定重建超 10k 帧,内存恒定、线性时间,性能 SOTA。

问题

在线 3D 重建(Online 3D Reconstruction)是实时从视频流中估计相机位姿和场景几何的关键任务,支撑着机器人、自动驾驶和具身智能等应用。当前领域聚焦于如何严格遵循因果约束和固定内存预算,实现长时间序列下的稳定推理。

现有方法受限于对时空几何传播的病态建模。滑动窗口 通过硬截断粗暴丢弃窗口外的历史证据,导致长程几何信息(如全局尺度、回环一致性)缺失,引发漂移。无门控循环 网络无法主动遗忘冗余状态,使得记忆缓存逐渐饱和,干扰新证据融合。因果注意力 则在长序列中产生注意力汇(attention sink),模型过度聚焦少数帧而忽略其余上下文,造成抖动甚至重建崩溃。这些架构共同的问题是:将时间上高度异质的几何证据——既有帧间短时对应,也有跨数百帧的持久尺度信息——强制统一在相同的衰减或保留模式下传播,完全忽略了证据影响的多时间尺度特性。

该问题的核心难处在于,需要一种能自适应调节信息遗忘与保留的机制:短程空间匹配要求精细的局部注意力以抑制噪声并可靠配准,而长程全局尺度则依赖跨时域的稳定积累。此外,流式处理严格限定线性时间复杂度和恒定内存,进一步增加了设计高效传播核的挑战。业界对此高度关注,因为长序列下的不稳定会直接导致机器人迷失位姿、自动驾驶建图失败等安全关键后果。

类比 NLP 领域中处理超长文本时的状态空间模型或记忆增强注意力,3D 重建同样需要一种能够随帧动态调整几何证据传播的"长视野"机制,这正是 HorizonStream 所要解决的核心问题。

核心洞察

  • **将流式几何重建形式化为证据影响核的显式分解**,从而统一长程尺度传播与短程匹配。现有方法(滑动窗口、无门控循环)对异构时序几何证据施加统一的硬截断或病态影响模式,导致严重漂移或注意力汇聚点。HorizonStream 将几何传播拆解为长程时间因子(几何线性注意力,学习通道级衰减率)和短程空间因子(时空RoPE的局部注意力),实现了证据影响的有界、多时间尺度传播,从根本上消除了缓存饱和与注意力汇聚点,仅用48帧训练即可稳定泛化至超万帧序列。

方法

流式三维重建的形式化

流式在线重建输入为连续视频帧,需在严格因果与恒定内存下输出相机姿态与场景几何。现有方法常因时序证据异质性——短程对应与长程尺度共存——而漂移或崩溃。HorizonStream 将几何传播形式化为证据影响核 (evidence influence kernel),并将其分解为长程时间因子与短程空间因子,分别显式建模。

长程时间建模:Geometric Linear Attention

长程因子采用几何线性注意力,通过为每个通道学习独立的衰减率 (channel-wise decay rates),控制历史证据的保留强度。这种有界状态递推自然形成多时间尺度记忆:部分通道快速遗忘局部对应,另一些则保持全局尺度。相比滑动窗硬截断或无门控循环,该机制从根本上避免缓存饱和与注意力尖峰下沉,在 48 帧片段训练后即可泛化至 10,000+ 帧,内存恒定,时间线性。

短程空间匹配:Geometric Local Attention

短程因子负责相邻帧间的稠密三维匹配。引入时空旋转位置编码 (Spatiotemporal RoPE) 来增强局部注意力对相对位移与时间间隔的感知能力,同时网络自身学习抑制注意力下沉,确保可靠配对。

度量读出:Metric Readout Tokens

持久化的几何状态经度量读出令牌直接回归刚体姿态与绝对尺度,无需传统后端的解算器优化,端到端可微,杜绝累积误差。

方法差异点:HorizonStream 的核心贡献在于将证据影响核显式分解,用可学习的通道衰减律代替启发式遗忘机制,使网络自主适配异构几何证据的存活周期,这是以往线性注意力或状态空间模型未做到的。

实验

实验设计

HorizonStream 仅在 48 帧片段 上完成训练,没有使用任何长序列微调或课程学习。测试时直接评估在 超过 10,000 帧 的视频流上,检验模型在真实因果、有界内存条件下的泛化能力。评估覆盖三个子任务:相机轨迹估计稠密深度重建3D 场景重建

关键发现

模型凭借显式分解的 证据影响核 (evidence influence kernel),在长序列上实现零遗忘 (zero-forgetting) 的稳定传播,彻底克服了以往方法中常见的漂移、抖动或崩溃。几何线性注意力 (Geometric Linear Attention) 学到的频道级衰减率 (channel-wise decay rates) 支持有界、多时间尺度的几何证据积累,而 几何局部注意力 (Geometric Local Attention) 有效抑制了传统注意力中的 sink 现象,保证匹配可靠性。测试全程保持 恒定内存线性时间复杂度

与基线对比深度解读

与传统滑动窗口或无门控循环相比,HorizonStream 从根源上解决了注意力的 稀释 (dilution)饱和 (saturation) 问题,因此在超长序列上性能无衰减。相比于之前最佳的在线重建方法,HorizonStream 在保持实时能力的同时,轨迹估计和重建精度均达到最先进水平,且不依赖任何全局优化后处理。这种端到端的架构设计为机器人、自动驾驶等需要终身在线建图的场景提供了更可靠的工程路径。

行业影响

落地场景

HorizonStream 为在线流式 3D 重建提供了恒定内存、线性时间的大场景解算能力,适用于所有需要 因果实时三维感知 的系统:

  • 机器人导航与操作:对连续视频流实时估计相机位姿和场景几何,支撑 SLAM、避障、抓取等任务。
  • 自动驾驶与 ADAS:在有限算力下处理长序列传感器数据,减少漂移,提升高精地图构建和定位的稳定性。
  • AR/VR 与空间计算:在移动端或头显上实现超长序列的实时三维重建,满足虚拟物体与真实环境无缝融合的需求。
  • 工业数字孪生与巡检:利用无人机或手持设备对大型设施进行流式扫描,直接生成可量测的三维模型。

商业价值

  • 降本增效:恒定显存与线性时间复杂度,使模型可在边缘设备(如 Jetson、车载芯片)上处理超过 10,000 帧的序列,显著降低云端传输和高性能 GPU 依赖,减少基础设施成本。
  • 体验提升:通过 几何线性注意力度量读出令牌,有效抑制长序列下的漂移、抖动和崩溃,直接输出稳定且具有真实尺度的位姿与几何,提升下游应用(如 AR 定位、机器人抓取)的成功率与用户信任。
  • 数据飞轮:训练仅需 48 帧片段即能泛化至万帧级序列,大幅缩短模型训练和迭代周期,加速产品上市。

与现有工作流的集成

HorizonStream 可作为即插即用的 视觉 SLAM 骨干网络

  • 替换现有 SLAM 系统中的前端特征匹配或后端优化模块,直接输出位姿与深度,与现有 VIO、回环检测框架兼容。
  • 支持 因果注意力 和严格有界内存,可直接接入 ROS、GStreamer 等流媒体管道,无需修改时序处理逻辑。
  • 提供标准化接口:输入连续图像序列,输出每帧位姿、深度图及持久几何状态,可无缝对接 NeRF/3DGS 等神经渲染管线,形成实时重建与渲染闭环。

具体落地用例

  1. 电商/AR 试穿试戴:消费者使用手机摄像头在房间内走动,HorizonStream 可实时、稳定地重建环境并保持真实尺度,虚拟家具或鞋服能准确贴合地面与人体,无尺度漂移导致的错位感,提升转化率和购物满意度。
  2. 自动驾驶/高精地图维护:车队利用前视摄像头在长时间行程中持续更新局部地图,HorizonStream 在车规级芯片上以恒定内存运行,无累积漂移地输出道路几何与车道线语义,大幅降低众包地图更新的云端融合成本。

局限

  • **训练序列长度与泛化边界未充分探索**:论文声称仅用 48 帧片段训练即可泛化至 10,000+ 帧,但未讨论该泛化的理论上界或失效条件。当场景纹理贫乏、运动模式剧烈变化或存在严重遮挡时,几何线性注意力的通道衰减率能否自适应调整仍待验证;若证据传播出现系统性偏差,可能累积为长程漂移。
  • **对动态场景与非刚性物体的适用性存疑**:方法假设静态场景下的刚性位姿估计与稠密重建,未处理移动物体或非刚体变形。尽管流式重建常用于自动驾驶等动态环境,HorizonStream 并未讨论动态前景的过滤或建模,可能导致位姿估计被动态目标干扰,在真实混合场景中的鲁棒性有待评估。
  • **计算高效性与实现复杂度的权衡**:虽然声称恒定内存和线性时间,但几何局部注意力与时空旋转位置编码(Spatiotemporal RoPE)的引入增加了推理时的计算负担,实际吞吐量可能低于简化的滑动窗口或递归方法。此外,度量读出令牌需要额外的持久几何状态维护,可能对端侧部署的时延敏感应用不够友好。
论文Chong Cheng2026-05-22原文

相关内容