发布于 2026-09-10T10:59:46.786683Z · CNCF · CNCF 博客

这篇 CNCF 案例复现了一种难查的浪费:Kubeflow 把协调进程调度到被 Cilium 网络策略隔离的区域,worker 在另一个区域,Pod 全是 Running、GPU 也已分配,分布式训练却几乎不在计算。作者用亲和性、拓扑分布约束和容忍度把训练组共置后,实验环境 GPU 利用率从约 40% 提到约 85%。值得把区域、网络策略、集合通信延迟和跨区流量放进同一张看板。
这篇 CNCF 案例复现了一种难查的浪费:Kubeflow 把协调进程调度到被 Cilium 网络策略隔离的区域,worker 在另一个区域,Pod 全是 Running、GPU 也已分配,分布式训练却几乎不在计算。作者用亲和性、拓扑分布约束和容忍度把训练组共置后,实验环境 GPU 利用率从约 40% 提到约 85%。值得把区域、网络策略、集合通信延迟和跨区流量放进同一张看板。
来源记录
- center.info_item · 07e0c56001e81e46 · 2026-10-03T04:08:35.169032Z
- pgweb.info_item · 07e0c56001e81e46 · 2026-10-03T04:08:55.967155Z