↑↓ 选择↵ 打开⌫ 切换范围完整搜索

PG.CENTER 连接 PostgreSQL 文档、百科与生态知识。由 Pigsty 维护。

Aurora 上用二值量化把 pgvector 索引缩小 32 倍 RSS

Steve Dille 介绍 pgvector 的 HNSW 二值量化:binary_quantize() 把 float32 每维压成一比特,索引体积最多缩小 32 倍,普通实例的缓冲池就能装下完整索引,查询时再对候选做全精度重排补回召回率。在 LAION 100M、OpenAI 5M 和 Cohere 10M 上,向量分布均匀时建索引速度和查询吞吐都优于磁盘型 ANN。分布集中的嵌入模型量化后掉得厉害,上线前须用真实数据验证召回。

发布于 2026-09-10T10:59:48.595306Z · Steve Dille · AWS 数据库博客
Aurora pgvector 向量

Steve Dille 介绍 pgvector 的 HNSW 二值量化:binary_quantize() 把 float32 每维压成一比特,索引体积最多缩小 32 倍,普通实例的缓冲池就能装下完整索引,查询时再对候选做全精度重排补回召回率。在 LAION 100M、OpenAI 5M 和 Cohere 10M 上,向量分布均匀时建索引速度和查询吞吐都优于磁盘型 ANN。分布集中的嵌入模型量化后掉得厉害,上线前须用真实数据验证召回。

Steve Dille 介绍 pgvector 的 HNSW 二值量化:binary_quantize() 把 float32 每维压成一比特,索引体积最多缩小 32 倍,普通实例的缓冲池就能装下完整索引,查询时再对候选做全精度重排补回召回率。在 LAION 100M、OpenAI 5M 和 Cohere 10M 上,向量分布均匀时建索引速度和查询吞吐都优于磁盘型 ANN。分布集中的嵌入模型量化后掉得厉害,上线前须用真实数据验证召回。

原始来源 ↗

来源记录
  • center.info_item · 7551e2f21f254d46 · 2026-10-03T04:08:35.169032Z
  • pgweb.info_item · 7551e2f21f254d46 · 2026-10-03T04:08:55.967155Z