↑↓ 选择↵ 打开⌫ 切换范围完整搜索

PG.CENTER 连接 PostgreSQL 文档、百科与生态知识。由 Pigsty 维护。

checkpointer 无限重试导致的一次生产停摆 RSS

Warda Bibi 复盘了一次事故:checkpointer 卡了几个小时。原因是 fsync 请求队列没有上限,在大 shared_buffers 和重写入负载下越涨越大,超过 1 GB 的内部分配上限后申请内存失败;checkpointer 捕获错误后不断重试,而两次尝试之间队列毫无变化,于是陷入死循环。13 到 16.9 都受影响,16.10 给队列加了一千万条的硬上限。临时办法是调小 shared_buffers。

发布于 2026-09-10T10:59:44.750813Z · Warda Bibi · Stormatics 博客
检查点 缺陷 运维

Warda Bibi 复盘了一次事故:checkpointer 卡了几个小时。原因是 fsync 请求队列没有上限,在大 shared_buffers 和重写入负载下越涨越大,超过 1 GB 的内部分配上限后申请内存失败;checkpointer 捕获错误后不断重试,而两次尝试之间队列毫无变化,于是陷入死循环。13 到 16.9 都受影响,16.10 给队列加了一千万条的硬上限。临时办法是调小 shared_buffers。

Warda Bibi 复盘了一次事故:checkpointer 卡了几个小时。原因是 fsync 请求队列没有上限,在大 shared_buffers 和重写入负载下越涨越大,超过 1 GB 的内部分配上限后申请内存失败;checkpointer 捕获错误后不断重试,而两次尝试之间队列毫无变化,于是陷入死循环。13 到 16.9 都受影响,16.10 给队列加了一千万条的硬上限。临时办法是调小 shared_buffers。

原始来源 ↗

来源记录
  • center.info_item · 5f195ee7963025b7 · 2026-10-03T04:08:35.169032Z
  • pgweb.info_item · 5f195ee7963025b7 · 2026-10-03T04:08:55.967155Z