发布于 2026-09-10T10:59:48.595306Z · Steve Dille · AWS 数据库博客

Steve Dille 介绍 pgvector 的 HNSW 二值量化:binary_quantize() 把 float32 每维压成一比特,索引体积最多缩小 32 倍,普通实例的缓冲池就能装下完整索引,查询时再对候选做全精度重排补回召回率。在 LAION 100M、OpenAI 5M 和 Cohere 10M 上,向量分布均匀时建索引速度和查询吞吐都优于磁盘型 ANN。分布集中的嵌入模型量化后掉得厉害,上线前须用真实数据验证召回。
Steve Dille 介绍 pgvector 的 HNSW 二值量化:binary_quantize() 把 float32 每维压成一比特,索引体积最多缩小 32 倍,普通实例的缓冲池就能装下完整索引,查询时再对候选做全精度重排补回召回率。在 LAION 100M、OpenAI 5M 和 Cohere 10M 上,向量分布均匀时建索引速度和查询吞吐都优于磁盘型 ANN。分布集中的嵌入模型量化后掉得厉害,上线前须用真实数据验证召回。
来源记录
- center.info_item · 7551e2f21f254d46 · 2026-10-03T04:08:35.169032Z
- pgweb.info_item · 7551e2f21f254d46 · 2026-10-03T04:08:55.967155Z