行业新闻

小红书提出全闪存向量检索系统 HELMSMAN,硬件成本降低90%

HELMSMAN用聚类索引+SSD优化,解决了大规模向量检索成本高的问题,在毫秒级延迟下实现90%成本节省。

小红书团队在OSDI 2026发表HELMSMAN,一种面向全闪存服务器的向量近似最近邻搜索系统。它用聚类索引替代传统图结构,通过定制存储栈和学习式剪枝,在保持毫秒级延迟的同时,将硬件成本削减90%以上,吞吐达纯内存方案的85%。

正文摘录

小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施 - sourcecompany: 机器之心 ![](https://image.jiqizhixin.com/uploads/article/coverimage/ff96a786-e9de-4a39-bb99-a5e5a2ff5a94/011(2).jpg) 近日,围绕搜索、推荐、广告等核心业务中的大规模向量检索成本与性能问题,小红书引擎架构团队 在 OSDI 2026 会议上发表了论文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with HELMSMAN》。 该工作提出了 面向全闪存的高性能向量近似最近邻检索系统 —— HELMSMAN ,通过 ANNS 定制化存储栈、分层学习式搜索剪枝,以及 GPU 加速和弹性分布式构建流水线,在严格保障毫秒级延迟约束的条件下,将原本依赖海量 DRAM 的向量检索服务迁移到 NVMe SSD 阵列之上,实现了成本、性能与构建效率的系统性突破。 在小红书搜推广业务中,HELMSMAN 使用约 40 台全闪存服务器稳定承载了过去约 35000 CPU Core 和约 350 TB DRAM 才能支撑的在线高吞吐低延迟向量检索负载,硬件成本节省超过 90%。相比现有 DRAM-SSD ANNS 系统如 DiskANN 和 SPANN 获得 2-16× 吞吐提升,最高达到纯内存部署 85% 的吞吐能力,同时满足在线服务对毫秒级别的平均延迟和长尾延迟要求;在构建侧,10B 规模索引可在数小时内完成重建,为高频模型更新和向量数据更新提供了可落地的基础设施能力。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-22原文

相关内容