论文

Honeycomb: 面向视频世界模型的恒定大小场景记忆表示

Honeycomb: 面向视频世界模型的恒定大小场景记忆表示

视频世界模型需要持久的场景记忆,才能在长时序视频生成中保持一致。现有空间记忆会不断累积 RGB 观测或 latent 特征,随着生成推进,存储需求持续增长。 我们提出 Honeycomb ,一个基于 HexMemory 的视频世界模型。HexMemory 是我们提出的低秩表示,用固定大小的记忆存储场景特征,共包含六个空间与时空平面。前馈 writer 将每个生成的 chunk 映射为新的平面特征;当空间覆盖或时间范围扩展时,我们对先前的平面进行 warp 并保持其维度,再通过置信度加权池化与可学习残差校正将其与新特征融合。reader 从 HexMemory 中检索 latent,用于条件化后续视频生成。writer 仅处理新 chunk 的观测,避免逐场景优化,也无需重复处理完整历史。 在 WorldScore 与 RealEstate10K 上的实验表明,该方法兼具出色的视频生成质量与稳健的重访一致性,同时在整个生成过程中保持 HexMemory 特征存储恒定。代码与更多可视化见项目主页 https://jackswl.github.io/honeycomb/ 。

论文精读

TL;DR Honeycomb 用固定大小的 HexMemory(六平面)存储视频世界模型场景记忆,通过 warp 与置信融合更新,解决长时生成中存储膨胀与回访不一致。

问题

问题背景

视频世界模型要在长时程 rollout 中生成一致场景,依赖持久场景记忆来保持布局、外观和物体一致性。

现有方法局限

现有 spatial memory 通常直接累积 RGB 观测或 latent 特征,存储量随生成步数线性增长。例如,基于特征队列或 3D 体素累积的方法需要缓存整个历史观测,导致长视频生成时显存/内存不可控。另一些方法采用 per-scene optimization 或回放全部历史,增加推理延迟与算力开销。核心矛盾:存储与计算不能随场景扩展无界增长,而现有方案无法在固定预算内可靠保留全局信息。

为什么这个问题难/重要

长时程生成要求记忆同时覆盖不断扩大的空间区域与较长时间跨度,且支持高保真回访一致性(revisit consistency)。如果记忆容量固定,就需要自动聚合与压缩新旧特征,同时避免灾难性遗忘。这在技术上涉及可微 warping、confidence-weighted fusion 与低秩表示设计,极具挑战。业界对视频世界模型在自动驾驶、机器人仿真和交互式内容生成中的可扩展性高度关注,固定内存的持久记忆是关键使能技术。

行业类比

类似 自动驾驶在线建图:车辆需要在持续探索中维护紧凑的环境地图,既要更新新观测,又要保持旧区域一致性,同时内存占用不随行驶里程无限增加。

核心洞察

  • 固定尺寸场景记忆。 Honeycomb 采用 HexMemory 以固定尺寸的六个平面存储场景特征,消除了视频生成长度与内存需求之间的线性耦合。现有 persistent memory 方法通常累积 RGB 或 latent 特征,导致存储随生成步数增长,长时程推理时显存压力大。HexMemory 通过低秩空间平面和时空平面表示场景,无论 rollout 多长,存储占用恒定,使得超长 horizon 的世界模型推理具备可扩展性。工程上直接减少长视频生成的显存瓶颈,且避免因历史帧过多而导致的精度下降。
  • 前馈写入与置信度加权融合。 Honeycomb 的记忆更新采用前馈 writer 处理新 chunk,并通过置信度加权池化与可学习残差校正融合历史平面,无需 per-scene 优化。传统方法在写入新观测时需要重新处理全部历史或执行在线优化(如 test-time optimization),导致推理延迟高。Honeycomb 的 writer 仅编码新 chunk,利用 warp 对齐旧平面,再用置信度融合,使记忆更新成为恒定开销的前馈计算。这大幅提升了实时性,同时保留了对旧区域的 consistency,适合流式生成和交互式应用。与需要梯度更新的场景优化方法形成鲜明对比。

方法

输入与生成流程

Honeycomb 接收相机轨迹与首帧观测作为输入,以 chunk 为单位逐步生成视频。在每步推理中,生成器基于当前 HexMemory 中的场景记忆预测下一段视频 latents,同时将新生成 chunk 的 latents 作为观测发送给 memory writer。整个过程构成一个循环:生成 → 写入记忆 → 读取记忆 → 条件化下一段生成。

HexMemory 固定尺寸记忆

核心组件 HexMemory 用六个平面存储场景特征:其中三个是空间平面(对应空间坐标的 XY / XZ / YZ 投影),三个是时空平面(在空间平面基础上引入时间维度,用于捕捉动态信息)。每个平面是低秩参数化表示,整体参数量固定,不随生成时长或相机覆盖范围增长。相比现有方法累积 RGB 或 latent 特征导致存储线性增长,HexMemory 在长 horizon 下保持恒定内存占用。

Feed-Forward 写入与更新

Memory Writer 是前馈网络,输入为新 chunk 的 latents 和对应相机位姿,输出投影到六个平面上的新特征。写入时先将上一时刻的平面根据相机运动做 warp,保持平面分辨率不变;随后通过 confidence-weighted pooling 将新旧特征按置信度融合,再用一个可学习的残差校正模块修正融合误差。整个过程仅处理当前 chunk,不需要重新编码历史所有帧,也无需测试时优化。

读取与条件生成

Memory Reader 根据当前相机位姿从 HexMemory 的六个平面中采样并解码出条件 latents,注入到视频生成器(基于预训练 video diffusion model 的条件分支)。生成器利用这些 latents 保持跨时刻的场景一致性,包括相机回到已观测区域时的外观与布局一致性。

差异点

与需要存储全部历史特征或对每场景做优化的方法不同,Honeycomb 通过固定尺寸的低秩平面表示和前馈写入机制,在不牺牲一致性的前提下将长视频生成的内存复杂度从线性降为常数,同时避免测试时繁琐的 per-scene 优化。

实验

实验设计

Honeycomb 在 WorldScore 与 RealEstate10K 两个数据集上评估,重点考察长时程视频生成中的 场景一致性 与 回访一致性。实验采用生成式视频世界模型的标准流程,将生成过程划分为多个 chunk,每个 chunk 由 feed-forward writer 写入 HexMemory,reader 再从记忆中读取条件特征。训练与推理设置未披露具体算力。

关键发现

实验表明 Honeycomb 在保持 HexMemory 特征存储大小恒定的前提下,取得了较强的视频生成质量和鲁棒的回访一致性。与现有空间记忆方法(如逐步累积 RGB 特征或 latent 特征)相比,Honeycomb 的固定尺寸记忆避免了存储随生成时长线性增长,同时 writer 仅处理新 chunk 的观测,无需逐场景优化或重复处理完整历史,因此在长 horizon 生成中更加高效。

与基线的深度对比

传统空间记忆(如基于 recurrent 累积或 dense memory map)通常随着生成推进不断增加存储开销,且后处理需要回看全部历史。Honeycomb 通过 低秩六平面表示(6 个空间与时空平面)和 置信度加权池化 + 残差修正 的融合机制,将新观测信息不断压缩进固定维度,有效平衡了记忆容量与信息保持。这一设计对实际工程部署尤其重要:恒定内存意味着可预测的资源占用,适合长视频流式生成和边缘设备推理。

行业影响

落地场景

Honeycomb 的恒定大小场景记忆适合需要 长视频一致性 的产品,如 自动驾驶仿真 中的多视角场景重建、电商虚拟空间漫游、室内设计预览、游戏世界生成 和 影视预演。

典型 use case:自动驾驶数据闭环中,生成多样化的 long-horizon 驾驶视频,保持道路、建筑、车辆外观在回环时一致,用于训练感知模型而无需昂贵实车采集;电商虚拟试衣间中,用户上传房间照片,系统生成可自由漫游的虚拟空间,转一圈回到原点时家具布局和纹理不变。

商业价值

核心价值在于 存储成本恒定 和 推理时延可控。传统空间记忆随视频长度线性增长,长视频生成计算和存储开销不可控;Honeycomb 通过六平面低秩表示将记忆大小固定,使 long-horizon 生成可扩展到分钟级甚至更久,直接降低云端推理的显存和存储成本。

同时,revisit consistency 显著提升生成内容的可用性,减少人工修复和重生成次数,提高内容生产流水线的吞吐量。对面向客户的生成式产品(如虚拟看房、自动生成产品展示视频),一致性提升直接带来体验和转化率提升。

与现有工作流集成

Honeycomb 可作为 plug-in memory module 接入现有视频扩散模型(如 SVD、CogVideoX 等)的 conditioning 流程。集成点包括:

  • 特征提取层:在生成 chunk 后,将新帧的 latent 输入 feed-forward writer 写入 HexMemory;
  • 条件注入层:reader 从 HexMemory 采样得到空间/时空特征,通过 cross-attention 或 adapter 注入生成模型;
  • 更新策略:通过 warping 和 confidence-weighted pooling 实现增量更新,无需重算历史,适合部署在实时或准实时的推理服务中。

局限

  • **表示容量受限**:HexMemory 固定为六个空间 / 时-空平面,虽然存储恒定,但低秩表示可能难以捕捉高频细节或动态物体的精细变化。在复杂动态场景(如行人密集、形变大)中,六个平面可能不足以编码所有必要特征,导致生成质量下降。论文未在更具挑战性的数据集(如包含丰富动态元素或遮挡的场景)上验证,现有 WorldScore 和 RealEstate10K 主要偏向静态室内外场景,因此该限制可能被低估。
  • **依赖相机位姿估计**:warp 操作需要已知相机内 / 外参或估计的位姿来对齐先前平面与新观察。若位姿不准,warp 误差会累积,影响记忆融合和后续生成。论文未讨论在未知相机轨迹或位姿噪声下的鲁棒性,实际应用中(如 AR/VR、机器人导航)位姿估计本身可能不可靠,限制了方法的适用范围。
  • **缺乏与最新基线全面对比**:论文声称 strong quality,但实验部分可能未与最新的视频世界模型(如基于 Transformer 的记忆机制或生成式先验)进行广泛对比,例如仅用 WorldScore 和 RealEstate10K 评估,未展示在更多样化的长时程视频基准上的性能。此外,缺少对内存更新机制的消融深入分析(如不同平面数量、置信度函数设计对一致性的影响),难以判断改进是否普遍有效。
论文Jack Wei Lun Shi2026-09-30原文

相关内容