↑↓ 选择↵ 打开⌫ 切换范围完整搜索

PG.CENTER 连接 PostgreSQL 文档、百科与生态知识。由 Pigsty 维护。

调度与网络策略打架,六成 GPU 在空转 RSS

这篇 CNCF 案例复现了一种难查的浪费:Kubeflow 把协调进程调度到被 Cilium 网络策略隔离的区域,worker 在另一个区域,Pod 全是 Running、GPU 也已分配,分布式训练却几乎不在计算。作者用亲和性、拓扑分布约束和容忍度把训练组共置后,实验环境 GPU 利用率从约 40% 提到约 85%。值得把区域、网络策略、集合通信延迟和跨区流量放进同一张看板。

发布于 2026-09-10T10:59:46.786683Z · CNCF · CNCF 博客
GPU Kubernetes 网络策略

这篇 CNCF 案例复现了一种难查的浪费:Kubeflow 把协调进程调度到被 Cilium 网络策略隔离的区域,worker 在另一个区域,Pod 全是 Running、GPU 也已分配,分布式训练却几乎不在计算。作者用亲和性、拓扑分布约束和容忍度把训练组共置后,实验环境 GPU 利用率从约 40% 提到约 85%。值得把区域、网络策略、集合通信延迟和跨区流量放进同一张看板。

这篇 CNCF 案例复现了一种难查的浪费:Kubeflow 把协调进程调度到被 Cilium 网络策略隔离的区域,worker 在另一个区域,Pod 全是 Running、GPU 也已分配,分布式训练却几乎不在计算。作者用亲和性、拓扑分布约束和容忍度把训练组共置后,实验环境 GPU 利用率从约 40% 提到约 85%。值得把区域、网络策略、集合通信延迟和跨区流量放进同一张看板。

原始来源 ↗

来源记录
  • center.info_item · 07e0c56001e81e46 · 2026-10-03T04:08:35.169032Z
  • pgweb.info_item · 07e0c56001e81e46 · 2026-10-03T04:08:55.967155Z