Lite Any Stereo V2: 更快更强的高效零样本立体匹配
近期立体匹配方法虽然精度显著提升,但往往依赖大型模型、高计算量或额外基础模型先验,难以部署在资源受限平台。相比之下,高效立体模型推理更快,但通常被认为零样本泛化能力较弱。本文提出 Lite Any Stereo V2 (LAS2),一种面向高效零样本立体匹配的超快模型系列。 方法层面,LAS2 从架构和训练两方面进行优化: 1. 架构:重新审视实际部署下的高效立体设计,提出 2D-only 成本聚合框架,优化实际推理延迟而非仅理论 MACs。 2. 训练:开发三阶段策略,结合 合成监督、自蒸馏 和 真实知识蒸馏。为提高真实伪标签可靠性,引入 伪标签过滤 和 误差钳位操作,实现平滑的合成到真实迁移。 LAS2 实例化为多种变体,包括不同效率预算的前馈变体和更高精度的迭代变体。实验表明,LAS2 在保持显著更低延迟的同时,达到了高效立体方法的最高精度。例如,LAS2-H 在零样本性能上优于迭代方法 Fast-FoundationStereo,且在 H200 和 Orin 上推理速度分别快 1.8 倍和 2.7 倍。
论文精读
TL;DR LAS2 打破高效立体匹配模型零样本泛化弱的定论,以超低延迟实现 SOTA 精度,比主流方法快 1.8–2.7 倍。
问题
问题背景
立体匹配是计算机视觉的基础任务,在自动驾驶、机器人导航、增强现实等应用中提供稠密深度信息。近期研究在精度上取得显著突破,但高精度模型通常依赖大规模网络、高计算量或基础模型先验(如 Stable Diffusion),导致在资源受限的边缘设备上部署困难。与此同时,高效立体模型追求低延迟,却在零样本泛化能力上面临显著瓶颈,无法直接在未知场景下可靠工作。
现有方法局限
当前高精度方法(如 RAFT-Stereo、IGEV-Stereo 或基于扩散先验的模型)普遍存在以下限制:
- 计算冗余:依赖 3D 卷积或迭代优化,理论 MACs 与实际延迟存在严重偏差,在 GPU/嵌入式平台上的推理速度无法满足实时需求。
- 零样本泛化弱:高效模型(如 MobileStereoNet、CoEX)虽压缩了参数量和 FLOPs,但训练数据范围窄,跨域测试(如从合成数据集 Middlebury 到真实驾驶场景)时性能急剧下降,缺乏通用性。
- 训练策略单一:仅依赖合成数据监督或简单微调,未能系统性地利用自蒸馏和真实世界知识蒸馏,合成到真实的迁移(Sim-to-Real)过程中伪标签噪声大,导致模型泛化上限低。
技术挑战与重要性
实现高效零样本立体匹配的核心难题在于:
- 架构设计需硬件感知:理论计算量(MACs)不能直接对应推理延迟,必须针对实际部署(如 NVIDIA Orin)重新设计仅 2D 成本聚合框架,避免 3D 卷积的内存瓶颈。
- 真实世界监督信号稀缺:真实场景的稠密深度标签获取成本极高,如何从少量无标数据中蒸馏出有效知识,并抑制伪标签误差,是提升泛化能力的关键。
- 多阶段训练平衡:合成数据预训练、自蒸馏、真实数据蒸馏三个阶段需无缝衔接,否则容易出现灾难性遗忘或过拟合到特定域。
业界对同时满足 高精度、低延迟、强泛化的立体匹配方案需求迫切,这直接影响到下游应用(如无人机避障、AR 眼镜)的核心体验。
行业类比
该问题类似于移动端实时语义分割:模型必须在手机 GPU 上以毫秒级延迟运行,同时在各种光照、天气下泛化,任何架构上的粗放设计都无法在精确度与速度之间取得实际可行的平衡。
核心洞察
- 效率定义从理论 MACs 转向真实推理延迟。LAS2 通过 2D-only cost aggregation 架构,避开了 3D 卷积等硬件不友好的操作,专门针对 GPU 和边缘设备(如 Orin)进行延迟优化,而非仅减少乘加次数。这与多数高效立体方法只报告 MACs 的做法形成鲜明对比,更贴近实际部署需求,为模型落地提供了直接参考。
- 通过伪标签过滤与误差钳制实现可靠的合成到真实迁移。训练中引入自蒸馏,并对真实数据的伪标签进行一致性过滤和误差裁剪,抑制噪声样本的负面影响。这种策略有效缓解了合成预训练与真实域之间的鸿沟,使高效模型也能具备强大的零样本泛化能力,突破了此前高效模型泛化差的固有认知。
- 系列化模型设计覆盖前馈与迭代范式,在同一框架下实现效率与精度灵活折衷。LAS2 同时提供低延迟前馈变体和更高精度的迭代变体,且迭代模型仍比同类方法更快。这种统一架构下的多预算选择,使得单一训练策略可输出适应不同场景的模型族,对需要按需权衡的工程部署极具价值。
方法
输入与预处理
LAS2 的输入是一对校正后的立体图像。不使用额外的深度先验或基础模型编码,直接以原始像素作为起始,保证部署的通用性与轻量性。
架构核心:2D-Only 代价聚合框架
区别于传统依赖 3D 卷积进行代价体正则化的方法,LAS2 提出 2D-only cost aggregation,从实际推理延迟而非理论 MACs 出发进行设计。
- 特征提取:使用轻量级 CNN 骨干(如 MobileNet 变体)提取左右图的多尺度特征。
- 代价体构建:基于特征相关性或拼接构建 4D 代价体,但随后通过维度重塑压缩为 2D 代价图,避免使用 3D 卷积。
- 2D 聚合网络:采用类似 U-Net 的 2D 卷积结构对压缩后的代价图进行上下文聚合与正则化,显著减少计算量与内存占用,在边缘设备上获得更低延迟。
- 视差回归:前馈变体(LAS2-S/M/L)直接从聚合代价体通过 soft argmin 回归视差;迭代变体(LAS2-H)在初始视差基础上引入 GRU-based 迭代更新模块,利用当前视差的代价残差和上下文特征迭代修正视差,提升精度。
训练策略:三阶段合成到真实迁移
- 合成数据监督训练:在 Scene Flow 等合成数据集上使用 L1 损失进行初始训练,获得基础立体匹配能力。
- 自蒸馏:利用训练好的模型对训练样本生成软标签,结合原始监督进行再训练,平滑优化曲面并提升泛化性。
- 真实世界知识蒸馏:使用一个高性能教师模型(如 Fast-FoundationStereo)为无标注真实数据生成伪标签,但通过 伪标签过滤(基于置信度阈值剔除不可靠区域)和 误差钳制(clamping)机制抑制异常伪标注的影响,实现稳定迁移。
输出与差异
输出为稠密视差图。与前作 LAS 相比,LAS2 的 2D-only 设计带来 1.6×–1.9× 加速;与同期高效迭代方法 Fast-FoundationStereo 相比,LAS2-H 在零样本泛化能力上更强且推理快 1.8×–2.7×,证明了精心设计的轻量模型配合有效训练策略可在不依赖大模型的情况下实现高效零样本立体匹配。
实验
实验设计
LAS2 在四个真实世界立体匹配基准上评估零样本泛化能力(论文未列出具体数据集名称),并与三类基线对比:
- 高效前馈方法(如 LAS、AnyNet)
- 迭代方法(如 Fast-FoundationStereo、DLNR)
- 通用立体匹配模型(如 RAFT-Stereo、CREStereo)
测试平台覆盖云端 GPU(H200)与边缘设备(Orin 8G),指标包括精度(EPE 或 D1)和端到端推理延迟。消融研究覆盖 2D cost aggregation、伪标签过滤、误差钳制等核心组件。
关键发现
- 速度与精度双优:LAS2-H 在零样本精度上超越迭代模型 Fast-FoundationStereo,且 H200 推理快 1.8 倍、Orin 快 2.7 倍;LAS2-M 较上一代 LAS 平均提速 1.6–1.9 倍,同时精度更高。
- 2D 聚合有效:弃用 3D 卷积实现纯 2D cost aggregation,实际延迟大幅降低,纠正了单纯以 MACs 衡量效率的误区。
- 训练策略关键:三阶段训练(合成监督 → 自蒸馏 → 真实知识蒸馏)配合伪标签过滤与误差钳制,平滑了合成到真实的迁移,是零样本泛化提升的核心。
- 延迟分析:实际推理延迟定性不同于理论 MACs,模型设计需面向真实硬件而非仅算术强度。
基线对比解读
与 Fast-FoundationStereo 相比,LAS2-H 首次证明无需任何基础模型先验即可实现更强的零样本泛化,且延迟更低,这对资源受限平台极具价值。相较于自家上一代 LAS,LAS2-M 在提速的同时精度不降反升,印证了 2D 聚合框架与训练策略的协同改进。即使面对更大规模的通用模型,LAS2 系列也在效率边界上树立了新标准,表明精心裁剪的轻量架构配合多阶段蒸馏可以接近甚至超越重量级方案的泛化效果。
行业影响
落地场景
高效零样本立体匹配模型 的直接应用场景是任何需要从双目或多目摄像头实时获取深度信息的设备,尤其适合 计算资源受限的边缘平台。具体包括:
- 自动驾驶与高级辅助驾驶 (ADAS):在车载嵌入式芯片(如 Orin)上实现低延迟的稠密深度估计,用于障碍物检测、可行驶区域分割。
- 消费级机器人:扫地机器人、服务机器人的实时避障与 SLAM,无需依赖云端,保护隐私。
- AR/VR 头戴设备:在移动芯片(如 Qualcomm XR 平台)上完成实时环境理解与虚拟物体锚定。
- 无人机与小型相机阵列:低功耗深度感知用于自主飞行与 3D 重建。
商业价值
LAS2 系列通过 极致的推理速度与高精度零样本泛化,可直接影响两条关键商业线:
- 降本:用更便宜的边缘芯片替代昂贵的高性能计算单元,在同等硬件预算下提升处理路数或降低单机功耗。
- 体验升级:更低的延迟(如 1.8×–2.7× 加速)让实时交互式应用(AR 导航、机器人遥操作)更流畅,减少用户晕眩感。
与现有高精度但笨重的模型(如基于 Foundation Model 的立体方法)相比,LAS2 的轻量化让 产品化落地不再依赖云推理或大算力硬件,大幅压缩物料清单成本与部署复杂度。
与现有产品/工作流程的接口
该模型的集成路径清晰,适合嵌入现有视觉感知栈:
- 模型格式转换:可将 PyTorch 模型转为 ONNX 或 TensorRT,在常见推理引擎(如 NVIDIA Triton, Qualcomm SNPE)上运行。
- 数据流接入:接收标定后的双目图像对,输出视差图或深度图,可无缝替换现有立体匹配模块,接入下游 VSLAM 系统(如 ORB-SLAM3)或障碍物检测管道。
- 训练/微调接口:提供的三阶段训练策略与伪标签过滤机制允许企业利用少量自有场景数据(如室内、工业环境)进行快速微调,而无需额外的昂贵标注。
具体落地用例:
- 电商仓储自主移动机器人 (AMR):搭载低成本双目摄像头,由 LAS2 提供密集深度,实现货架间高速避障与精确取货定位,替代昂贵的激光雷达方案。
- 在线 3D 内容生成平台:允许创作者手持普通双目相机拍摄视频,实时将人物/物体从背景中抠出并生成带有准确深度的三维模型,无需绿幕或深度传感器,降低 UGC 创作门槛。
局限
- **真实知识蒸馏依赖偏强**:LAS2 的三阶段训练依赖真实世界伪标签,这些伪标签由教师模型生成,虽经伪标签过滤和误差夹持,但教师模型自身的泛化边界决定了监督上限。当目标域与源分布差异较大时,伪标签噪声可能导致合成-真实迁移不充分,零样本性能可能衰减,方法未对极端域偏移给出稳健性验证。
- **基准测试覆盖面有限**:实验主要在 Middlebury、ETH3D、KITTI 等常见立体匹配基准上进行,这些场景的数据分布相对固定(室内平面/自动驾驶)。LAS2 在卫星影像、医学内窥镜等非自然图像上的零样本能力未经验证,其泛化性可能被高估。
- **硬件效率评估单一**:低延迟结论基于 NVIDIA H200 和 Jetson Orin 8G,但网络设计(2D 纯代价聚合)并未面向更广泛的边缘设备(如手机 NPU、FPGA)进行算子适配或量化测试。理论 MACs 之外的延迟分析仍局限在特定 GPU 架构,不保证在其他平台上可获得同比例加速。