产品派
返回

Pinterest以量化与SPANN支撑数百亿向量搜索

后端InfoQ 中文站2026/9/23 12:07:13
AI 导读

Pinterest持续升级分布式搜索平台Manas,目前已部署在80个集群,为首页信息流、站内搜索、相关内容、广告和通知等场景提供向量检索服务。随着语料规模扩大到数十亿条目,传统HNSW索引的高内存占用开始推高成本,也限制了硬件资源配置和基础设施弹性。

团队在包含1亿个嵌入向量的GraphSage数据集上测试标量量化(SQ)和乘积量化(PQ)。PQ将浮点向量编码为紧凑字节,在HNSW和IVF上的索引压缩率分别为74%和93%,召回率约70%至80%;SQ将向量分量转换为低比特整数,压缩率分别达到59%和75%,并在不同负载下维持90%以上召回率。

离线测试中,原始HNSW索引为121GB,Recall@100为93.72%,吞吐量302.5 QPS;加入PQ后缩至32GB,召回率77.25%,吞吐276.4 QPS。加入SQ后索引为50GB,召回率92.92%,吞吐305.2 QPS。原始IVF索引为97GB、召回91.69%、吞吐1659.8 QPS;IVF+PQ缩至6.8GB,召回76%、吞吐1747.9 QPS;IVF+SQ为25GB,召回95.71%,吞吐1588.8 QPS。针对量化解码带来的CPU开销,团队利用SIMD实现线性缩放SQ,使查询计算资源减少10%至15%。

在线实验显示,SQ和PQ让生产工作负载的服务成本下降20%至30%。在面向SSD的方案中,采用PQ的SPANN吞吐量达到DiskANN的3倍,延迟降至约三分之一,召回率仅下降5%。定制架构把小型质心索引保留在内存中,用于快速定位分区,再将大型倒排列表放入SSD,以降低内存需求并利用高IOPS。

针对超过50亿个嵌入向量的Pin推荐索引评估,SPANN相比完全驻留内存的HNSW,为生产查询节省了超过40%的CPU时间。与此同时,Pinterest正从单向量双塔模型转向ColBERT等多向量后期交互方案,通过MaxSim聚合Token级匹配得分,以提升细粒度相关性判断。

为支持多向量检索,Manas需要改造查询解析器,将包含多个Token的查询拆分为多个向量,并在不同索引上并行执行近似最近邻搜索。目前该能力已由内部客户团队进行试点,正在真实生产环境中验证高级多嵌入查询。

向量检索PinterestHNSWSPANN量化

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文