行业新闻

悉尼大学提出LinStereo,用线性全局注意力突破立体匹配瓶颈

LinStereo用线性复杂度的全局注意力替代传统迭代中的局部卷积,在遮挡和退化场景中大幅提升立体匹配精度。

传统立体匹配(从左右图像算出每点深度)的后端靠卷积GRU逐步传播信息,遇到大面积弱纹理或水下场景就很吃力。LinStereo用位置感知线性注意力(PALA)替换卷积,每次迭代能聚合全图上下文,复杂度仍是线性的;同时引入多尺度代价体积和单目深度初始化。在Sceneflow合成数据训练后零样本泛化,将Middlebury遮挡区域误差压低了37%,甚至在跨域水下场景也明显领先,用ViT-B小模型即可超越更大参数量的方法。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3ac13ea6-9dd8-4433-a80a-27badb0f8ee0/013(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 立体匹配的前端已经进入视觉基座模型时代,后端却还停留在基于卷积的局部递归更新。LinStereo 关注的正是这个断层:当 Depth Anything V3 已经能提供全局语义和多尺度表征时,ConvGRU 式的局部传播反而成了遮挡、弱纹理和水下退化场景中的瓶颈。 悉尼大学澳大利亚机器人中心的 Yiran Wang、Oliver Turner 和 Viorela Ila 在 ECCV 2026 论文中提出用位置感知线性注意力模块替代卷积迭代,让每轮迭代都能聚合全图上下文,并辅以多尺度代价体积和单目深度初始化提升几何收敛。 更关键的是, LinStereo 在冻结视觉基座模型编码器,仅用 Scene Flow 合成数据训练下游 stereo 模块,其零样本泛化能力就将 Middlebury 遮挡区域把误差压低了 37%,在多项标准评估数据上以 ViT-B 的体量战胜了更大参数量的模型,甚至在在水下等跨域场景也展现了明显的优势。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-05原文

相关内容