Yann LeCun介绍SAM 3从指代像素到命名概念的创新及性能提升
如果你花时间阅读了SAM 2的论文,你会了解到,在SAM 2中,用户点击对象上的一个点或在其周围绘制一个边界框,模型就会返回该特定对象的分割掩码。要分割场景中的五个相似物体,需要五个独立的提示。
SAM 3从“指向”像素转向“命名”概念。像“戴眼镜的人”这样的文本提示会返回图像或视频中所有匹配对象的掩码。点击一个“生锈的螺栓”会将检测泛化到所有生锈的螺栓——这是SAM 2所缺乏的能力。
作者构建了一个自动流水线,生成了包含400万个独特概念的训练数据。SAM 3在概念分割上将先前准确率提升了一倍。在MOSEv2(一个包含严重遮挡、小物体、恶劣天气和低光照场景的视频基准)上,SAM 2.1得分为47.9%,而SAM 3达到了60.3%。
阅读并提问于
@ChapterPal
:
https://chapterpal.com/s/ed50e3cc/sam-3-segment-anything-with-concepts
…
下载PDF:
https://arxiv.org/pdf/2511.16719
SAM 3从“指向”像素转向“命名”概念。像“戴眼镜的人”这样的文本提示会返回图像或视频中所有匹配对象的掩码。点击一个“生锈的螺栓”会将检测泛化到所有生锈的螺栓——这是SAM 2所缺乏的能力。
作者构建了一个自动流水线,生成了包含400万个独特概念的训练数据。SAM 3在概念分割上将先前准确率提升了一倍。在MOSEv2(一个包含严重遮挡、小物体、恶劣天气和低光照场景的视频基准)上,SAM 2.1得分为47.9%,而SAM 3达到了60.3%。
阅读并提问于
@ChapterPal
:
https://chapterpal.com/s/ed50e3cc/sam-3-segment-anything-with-concepts
…
下载PDF:
https://arxiv.org/pdf/2511.16719
原始的Segment Anything Model(SAM)论文于2023年发表,彻底改变了图像分割,但视频分割仍然困难。现有解决方案需要将SAM与单独的视频跟踪器结合,导致错误传播,并且无法交互式地细化。