An unserem Ceph-Cluster f1a.cloudandheat.com kam es vom 16.06.2026 16:50 Uhr bis heute, 19.06.2026 9:20 Uhr zu Leistungseinbrüchen.
Welche Systeme waren betroffen?
three_times_replicated verwenden, sowieEin fehlerhaftes Netzwerkkabel eines Ceph-OSD-Servers sorgte für Paketverluste und somit hohe Netzwerklatenzen, weshalb die Selbstheilung des Ceph-Clusters zum Erliegen kam. Der entsprechende Link war mittels Link Aggregation redundant ausgelegt, weshalb der Server prinzipiell noch erreichbar war und der Fehler erst später auffiel.