悉尼大学提出LinStereo,用线性全局注意力突破立体匹配瓶颈
LinStereo用线性复杂度的全局注意力替代传统迭代中的局部卷积,在遮挡和退化场景中大幅提升立体匹配精度。
传统立体匹配(从左右图像算出每点深度)的后端靠卷积GRU逐步传播信息,遇到大面积弱纹理或水下场景就很吃力。LinStereo用位置感知线性注意力(PALA)替换卷积,每次迭代能聚合全图上下文,复杂度仍是线性的;同时引入多尺度代价体积和单目深度初始化。在Sceneflow合成数据训练后零样本泛化,将Middlebury遮挡区域误差压低了37%,甚至在跨域水下场景也明显领先,用ViT-B小模型即可超越更大参数量的方法。
正文摘录
.jpg)  立体匹配的前端已经进入视觉基座模型时代,后端却还停留在基于卷积的局部递归更新。LinStereo 关注的正是这个断层:当 Depth Anything V3 已经能提供全局语义和多尺度表征时,ConvGRU 式的局部传播反而成了遮挡、弱纹理和水下退化场景中的瓶颈。 悉尼大学澳大利亚机器人中心的 Yiran Wang、Oliver Turner 和 Viorela Ila 在 ECCV 2026 论文中提出用位置感知线性注意力模块替代卷积迭代,让每轮迭代都能聚合全图上下文,并辅以多尺度代价体积和单目深度初始化提升几何收敛。 更关键的是, LinStereo 在冻结视觉基座模型编码器,仅用 Scene Flow 合成数据训练下游 stereo 模块,其零样本泛化能力就将 Middlebury 遮挡区域把误差压低了 37%,在多项标准评估数据上以 ViT-B 的体量战胜了更大参数量的模型,甚至在在水下等跨域场景也展现了明显的优势。