
一句话看懂:小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。
事件核心:发生了什么
小红书引擎架构团队在学术会议OSDI 2026上发表了论文《The Clustering Strikes Back》,介绍了HELMSMAN系统。该系统专门为全闪存(NVMe SSD)服务器设计了一套面向向量近似最近邻搜索(ANNS)的定制化存储栈和搜索策略。与当前主流的DRAM-SSD混合系统(如DiskANN、SPANN)不同,HELMSMAN没有采用串行依赖的图索引结构,而是回归了聚类索引,并使用SPDK用户态驱动绕过传统Linux内核I/O路径,将单次查询的批量读取效率提升至接近纯内存部署的85%。同时,系统引入了分层学习式搜索剪枝(LLSP),根据查询难度动态调整搜索范围,避免了固定策略下的性能浪费或召回损失。
为什么重要
向量检索是搜索、推荐、广告和RAG系统的底层基础设施。随着多模态数据量和embedding维度的暴涨,纯内存路线(如HNSW)的成本已经失控,小红书自身的DRAM占用量已达PB级别。HELMSMAN证明了在严格保证5-10毫秒延迟SLA和低长尾延迟的生产环境下,用相对廉价的NVMe SSD阵列替代海量DRAM是可行的。这不仅直接挑战了“在线检索必须全内存”的行业默认假设,也为其他面临同样成本压力的平台(如抖音、淘宝、TikTok)指明了一条技术替代路径。其二阶段分布式构建流水线(GPU粗聚类+CPU细切分)将百亿级索引的构建时间压缩到数小时,使得embedding更新能更快闭环进入在线效果。
对用户/开发者/创作者的影响
对开发者和平台技术团队而言,这意味着硬件采购逻辑可能发生变化:未来部署大规模ANNS系统时,可以更多考虑全闪存服务器配置而非昂贵的内存服务器,并且可以引入GPU加速构建流程。对普通用户和创作者而言,小红书搜索、推荐和广告系统的硬件成本降低,有望支持更大规模、更新更频繁的向量数据库,从而提升内容召回的质量和实时性。具体到效果上,用户可能会发现无论是搜图、搜视频还是看推荐流,系统都能更快、更准地理解意图,且随着embedding模型更新,体验改进的延迟更短。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,HELMSMAN已在小红书生产环境稳定运行,其开源仓库已发布,关注其他头部互联网公司(如字节、阿里、腾讯)是否跟进类似的全闪存ANNS路线。第二,系统对GPU的依赖程度以及大规模部署下Gen5 SSD的实际表现,将是衡量其可复现性的关键变量。第三,随着PCIe Gen5及未来Gen6的普及,SSD带宽进一步提升,聚类式ANNS的带宽利用率能否长期保持优势,将决定图式ANNS是否会彻底被边缘化,还是会在特定场景(如低基数查询)保留阵地。


