论文

Hierarchical Denoising 用于多步视觉推理

Hierarchical Denoising 用于多步视觉推理

视频模型正演变为视觉基础模型,但仍缺乏类人的多步推理能力。现有方法存在两难:流式自回归扩散模型推理高效但逻辑一致性差;双向扩散模型通过密集帧级去噪实现全局修正,但推理成本极高。两者均难以在复杂推理任务中兼顾低延迟与逻辑连贯性。 本文提出 HDR(Hierarchical Denoising for Visual Reasoning),一个统一框架,将层次化潜变量集成到因果视频生成中。HDR 将视频潜变量组织成树状层次,实现从粗到细的推理:粗去噪层保留多种假设用于全局规划,精细层逐步将其细化为具体的视觉状态。为降低计算量,引入稀疏层次注意力模式(SHAP),减少时序注意力成本。 我们在新提出的层级分层多步视频推理基准上评估 HDR,该基准涵盖6种分布外任务:迷宫导航、汉诺塔、一笔画、滑动谜题、推箱子、倒水。与流式自回归扩散基线相比,HDR 将成功率从 34.22 提升至 60.29(相对提升 76.2%),平均进度从 76.00 提升至 89.56。推理延迟仅 0.70 秒/潜变量,比双向扩散快 54.2 倍。在仅使用 2% 训练数据时,HDR 仍保留 82.9% 的全数据性能(双向扩散仅 52.0%)。真实机器人实验进一步验证了其在物理交互与世界建模中的潜力。

论文精读

TL;DR HDR 通过树状分层潜在表示与稀疏注意力实现粗到细的视觉推理,在保持低延迟流式生成的同时,将多步推理成功率相对提升 76%,推理速度比双向扩散快 54 倍。

问题

问题背景

视频生成模型正逐步成为视觉基础模型,但多步推理能力仍远落后于人类。当前研究聚焦于如何让模型在连续视觉任务中维持长程逻辑一致性,并实现低延迟流式输出,这对具身智能、世界模型等应用至关重要。

现有方法局限

流式自回归扩散模型 (streaming autoregressive diffusion) 虽然推理快,但缺乏全局规划,因为在生成过程中只能单向依赖已生成帧,无法修正早期的错误,导致推理链容易累积偏差,在需要回溯或全局约束的任务(如迷宫导航、汉诺塔)中成功率低。
双向扩散模型 (bidirectional diffusion) 允许对完整序列进行全局修正,但推理时需对所有帧密集去噪,计算成本极高,延迟大,无法满足实时交互需求。两种范式都无法同时保证推理精度和流式效率,在多步推理任务上形成瓶颈。

为什么这个问题难且重要

多步视觉推理要求模型既能生成高层计划又能逐步执行,在不确定环境中需动态调整预测。技术挑战在于:如何在保持因果生成的低延迟特性的同时,引入层次化规划能力?此外,层次化结构与注意力机制如何结合才能高效处理长序列?该问题直接关系到具身智能体的物理交互质量、视频预测的可靠性,受到学界和工业界(如机器人、自动驾驶)高度关注。

行业类比

如同自动驾驶系统需要全局路径规划(粗粒度)与实时局部轨迹修正(细粒度)分层协作,视觉推理模型也需类似机制,才能兼顾长远逻辑一致性与流式响应的敏捷性。

核心洞察

  • **层次化去噪统一了流式生成与全局推理**:现有流式自回归扩散虽低延迟但缺乏全局修正能力,双向扩散可全局推理却牺牲流式效率且推理成本高。HDR 通过在因果生成中引入树结构层次潜在变量,先粗粒度规划形成假设,再逐层细化成确定视觉状态,既保持流式输出的低延迟,又获得全局一致的推理能力,从根本上弥合了两类范式的鸿沟。
  • **视频生成作为多步推理的通用框架**:HDR 将迷宫导航、汉诺塔等逻辑规划任务建模为视频生成问题,凭借层次化去噪机制自然处理长期依赖与状态一致性,在分布外测试中显著领先基线(成功率从 34.22 提升到 60.29)。这证明精心设计的层次生成结构能使视频模型超越表象生成,内化可泛化的推理能力,为视觉推理提供了一条不同于符号规划或纯序列模型的路径。
  • **极高数据效率的归纳偏置**:HDR 仅需 2% 训练数据即可保留 82.9% 的全数据性能,远超双向扩散的 52.0%。这种样本效率源于层次结构对多步推理的天然适配——粗粒度规划与细粒度演化分开建模,迫使模型学习更本质的状态转移规律,而非记忆帧序列,对数据稀缺的物理交互与机器人场景极具工程价值。

方法

输入与任务设定

HDR 面向多步视觉推理任务(如迷宫导航、汉诺塔、滑动拼图等),输入为任务的初始视觉状态(例如一张或多张图像)与对应的目标描述,输出是一个因果生成的视频序列,逐步展示推理过程。模型以流式自回归方式工作,每步生成一个潜变量帧,要求低延迟且逻辑一致。

层次潜变量构建

视频潜变量被组织成树状层级结构。高层潜变量编码粗粒度的、不确定的全局计划(保留多种假设),低层潜变量则逐渐细化为具体的视觉状态。这种设计允许模型先在高层进行全局推理,再逐步完善细节,从而在流式输出的同时保持长程的推理连贯性。

分层去噪与生成

生成过程采用分层去噪:粗粒度的去噪层在高层潜变量上保留多模态分布的不确定性,为全局规划提供“思维草图”;层次越接近输出端,去噪过程越强地锐化分布,将假设固定为确定的视觉状态。训练时采用分层流匹配目标,在不同粒度级别上监督扩散过程,确保每个层次学到合适的去噪程度。

稀疏层次注意力模式 (SHAP)

为降低自回归生成中帧间注意力的计算开销,HDR 引入稀疏层次注意力,仅允许每个潜变量关注其邻近层次或同一粗级节点下的帧,将时间注意力复杂度从二次降为线性,同时不损失层次推理所需的上下文交互。

与同类方法的差异

与纯流式自回归扩散(缺乏全局规划,推理易偏离)相比,HDR 通过层次潜变量注入全局推理能力;与双向扩散(需要反复全序列去噪,推理慢)相比,HDR 仅需单次前向流式生成,实现 54.2 倍 推理加速,兼顾了推理质量与流式效率。

实验

实验设计

论文构建了一个多步视觉推理基准,包含六项需要多步规划的任务:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子、倒水问题,并设计了分布外(OOD)的测试样例。

实验主要对比三类模型:

  • 流式自回归扩散(streaming AR):逐帧生成,低延迟但缺乏全局推理能力
  • 双向扩散(bidirectional diffusion):允许全局修正,但密集帧去噪导致高推理成本
  • HDR:通过层次化潜变量实现粗到细推理,融合全局规划与流式输出

评估指标包括成功率(Success Rate)、平均任务进度(Average Progress)、推理延迟和数据效率。

关键发现

  1. 推理一致性显著提升:HDR 将成功率从流式 AR 的 34.22% 提高到 60.29%(76.2% 相对提升),平均进度从 76.00 提升至 89.56,证明层次化去噪能有效维持长期逻辑一致性。
  2. 保持低延迟流式推理:HDR 单潜变量推理耗时仅 0.70 秒,比双向扩散快 54.2 倍,同时保持了流式输出的实时性。
  3. 卓越的样本效率:仅使用 2% 训练数据,HDR 仍能保留全数据性能的 82.9%,而双向扩散仅保留 52.0%,表明层次化结构天然具备强归纳偏置。
  4. 真实世界迁移:在 RoboDojo 机器人交互任务中,HDR 展示了物理世界建模和动作生成的潜力,验证了框架的泛化性。

与基线的深度对比

流式 AR 模型由于逐帧自回归,无法回溯修正早期错误,导致在迷宫、推箱子等需要全局规划的任务中性能低下。双向扩散虽能全局重规划,但必须在所有帧上执行完整去噪过程,推理成本极高,且难以流式输出。

HDR 在两者间取得了平衡:通过树状潜变量层次,粗层保留不确定假设用于全局推理,细层逐步具象化视觉状态,实现了“先规划后输出”。稀疏层次注意力(SHAP)进一步削减了时序计算开销。因此,HDR 既获得了类似双向扩散的全局规划能力(成功率大幅超越流式 AR),又保持了接近流式模型的低延迟。在低数据场景下,其层次化先验也更强韧,印证了结构设计比单纯增加数据更高效的观点。

行业影响

落地场景

HDR 的核心能力是将复杂多步视觉推理任务分解为“全局规划 + 逐步细化”的层次化去噪过程,天然适配需要长程逻辑一致性低延迟流式输出的产品场景:

  • 交互式教学/演示生成:步骤类操作视频自动生成(如数学几何作图、物理实验模拟),模型先规划出关键中间状态,再逐帧流畅渲染,确保动作序列在物理上合理。
  • 机器人任务规划与仿真:在仓储、家庭服务机器人中,HDR 可直接从目标状态生成操作视频作为运动规划参考,再映射到真实控制,降低对真实数据采集的依赖。
  • 视频内容创作工具:为视频编辑软件提供“多步特效序列”自动生成与预览,创作者通过自然语言描述复杂操作链,模型一次性输出层次清晰、步骤连贯的视频草稿。

商业价值

  • 降本增效:HDR 的稀疏层次注意力(SHAP) 将推理延迟控制在每个潜变量仅 0.70 秒,比双向扩散快 54.2 倍,同时仅用 2% 的训练数据即可保持 82.9% 的全量性能,大幅减少标注成本与计算资源。这意味着在视频理解与生成服务中,能以更低 GPU 投入提供实时或准实时推理。
  • 体验升级:成功率从 34.22% 跃升至 60.29%(相对提升 76.2%),平均进度由 76.00 提至 89.56,显著减少推理中断或逻辑混乱的失败案例(如推箱子任务中的无效移动)。对于依赖连续视觉推理的产品,可直接转化为更可信的用户体验与更高的任务完成率。

与现有产品/工作流的接口

HDR 以层次化潜变量树作为统一表示,可无缝嵌入现有流式视频生成框架:

  • 在已有的自回归扩散模型(如视频预测模型)前端插入 HDR 规划模块,将原先逐帧预测替换为“粗粒度全局预测 → 细粒度局部精修”的两阶段流程,无需重构整体架构。
  • 输出端可直接对接现成的 VAE 解码器或视觉 tokenizer,保持与下游应用(如视频播放器、机器人控制器)的接口不变。
  • 训练阶段可与主流 flow-matching 目标结合,易于在现有的视频生成训练代码基础上扩展。

具体落地用例

  1. 电商场景:多步组装动画生成 – 家具、玩具等需要逐步拼装的产品展示页,传统做法需人工制作动画或拍摄分段视频。HDR 可根据组装说明书(步骤序列)直接生成连贯的 3D 操作动画,每步逻辑正确且镜头语言流畅,将内容生产成本降至原来的 1/10 以下,同时支持个性化变体(如不同颜色、配件组合)。
  2. 企业培训:流程仿真与异常预演 – 在工厂操作培训中,HDR 可根据 SOP 文本生成多步骤设备操作仿真视频,并模拟误操作后的连锁反应,使培训素材的更新从“美术逐帧制作”变为“模型一键合成”,大幅缩短内容迭代周期。

局限

  • **合成基准的泛化局限**:实验主要基于六个合成多步推理任务(迷宫、汉诺塔等),虽然引入了分布外案例,但任务空间仍高度结构化且视觉复杂度有限,与开放域真实视频推理(如自动驾驶、复杂机器人操作)差距显著。机器人实验仅在部分场景初步验证,扩展至更丰富物理交互时,模型对遮挡、光照变化等扰动的鲁棒性未知,泛化能力有待进一步检验。
  • **层次结构的任务依赖性**:HDR 的树状层次设计依赖预先定义的粗到细粒度划分,这种静态结构可能无法最优适配所有推理任务。例如,需要全局细粒度一致性的长链因果推理任务中,早期粗粒度假设若不够准确,后续细化难以完全纠正,而调整层级超参数需要额外人工调试,增加了实际部署的复杂性。
  • **长程依赖与计算代价权衡**:尽管 SHAP 稀疏注意力大幅降低时序注意成本,但稀疏化不可避免地牺牲了部分长程依赖建模精度。在极端长序列(如数百步)推理中,信息丢失可能导致逻辑断裂或状态遗忘;同时,层次去噪虽延迟低,但整体预训练仍需大量计算资源,端到端训练成本未显著低于双向扩散模型。
论文Zezhong Qian2026-07-16原文

相关内容