像 Wholembed v3 这类后期交互模型通过保留细粒度的文档信息,显著提高了检索精度,但由于每个文档会生成数百个向量,导致其存储成本高昂。 为了使该技术在十亿级文档规模下具备实用性,Mixedbread Search 团队在其“Silo”引擎中实现了**非对称量化**。通过保持查询向量的高精度(int8),并将文档向量存储为 1 位二进制符号,该系统实现了每个文档 32 倍的存储缩减,从 393 KiB 降至 12.28 KiB。 这种方法在极小程度降低 NDCG@10(从 90.26 降至 89.65)的同时保留了排名质量,并显著提升了性能。由于文档向量是持久的而查询是短暂的,这种权衡优化了系统的主要成本驱动因素:存储、IO 和缓存空间。此外,二进制文档格式允许使用优化的评分内核,以简单的选择与求和操作取代复杂的乘法运算。最终,该方法在利用高质量多向量表示的同时,保持了大规模生产搜索系统所需的高效率和低成本。