小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

一句话看懂:小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。

事件核心:发生了什么

小红书引擎架构团队在学术会议OSDI 2026上发表了论文《The Clustering Strikes Back》,介绍了HELMSMAN系统。该系统专门为全闪存(NVMe SSD)服务器设计了一套面向向量近似最近邻搜索(ANNS)的定制化存储栈和搜索策略。与当前主流的DRAM-SSD混合系统(如DiskANN、SPANN)不同,HELMSMAN没有采用串行依赖的图索引结构,而是回归了聚类索引,并使用SPDK用户态驱动绕过传统Linux内核I/O路径,将单次查询的批量读取效率提升至接近纯内存部署的85%。同时,系统引入了分层学习式搜索剪枝(LLSP),根据查询难度动态调整搜索范围,避免了固定策略下的性能浪费或召回损失。

为什么重要

向量检索是搜索、推荐、广告和RAG系统的底层基础设施。随着多模态数据量和embedding维度的暴涨,纯内存路线(如HNSW)的成本已经失控,小红书自身的DRAM占用量已达PB级别。HELMSMAN证明了在严格保证5-10毫秒延迟SLA和低长尾延迟的生产环境下,用相对廉价的NVMe SSD阵列替代海量DRAM是可行的。这不仅直接挑战了“在线检索必须全内存”的行业默认假设,也为其他面临同样成本压力的平台(如抖音、淘宝、TikTok)指明了一条技术替代路径。其二阶段分布式构建流水线(GPU粗聚类+CPU细切分)将百亿级索引的构建时间压缩到数小时,使得embedding更新能更快闭环进入在线效果。

对用户/开发者/创作者的影响

对开发者和平台技术团队而言,这意味着硬件采购逻辑可能发生变化:未来部署大规模ANNS系统时,可以更多考虑全闪存服务器配置而非昂贵的内存服务器,并且可以引入GPU加速构建流程。对普通用户和创作者而言,小红书搜索、推荐和广告系统的硬件成本降低,有望支持更大规模、更新更频繁的向量数据库,从而提升内容召回的质量和实时性。具体到效果上,用户可能会发现无论是搜图、搜视频还是看推荐流,系统都能更快、更准地理解意图,且随着embedding模型更新,体验改进的延迟更短。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,HELMSMAN已在小红书生产环境稳定运行,其开源仓库已发布,关注其他头部互联网公司(如字节、阿里、腾讯)是否跟进类似的全闪存ANNS路线。第二,系统对GPU的依赖程度以及大规模部署下Gen5 SSD的实际表现,将是衡量其可复现性的关键变量。第三,随着PCIe Gen5及未来Gen6的普及,SSD带宽进一步提升,聚类式ANNS的带宽利用率能否长期保持优势,将决定图式ANNS是否会彻底被边缘化,还是会在特定场景(如低基数查询)保留阵地。

来源:公众号:小红书技术(dots.llm)

celebrityanime
celebrityanime
文章: 14834

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注