Station 01/Sieben Arten von Ausfall·Vorschau
Station 01 · Was ausfällt/Phase 1

Sieben Arten von Ausfall

Die häufigsten löst kein zweiter Server. Wer das nicht sortiert, baut die Doppelung an der falschen Stelle.

„Der Server ist ausgefallen“ ist im Betrieb fast nie die richtige Beschreibung. Wer nach einem Vorfall nachliest, findet meistens etwas anderes — und die Unterscheidung entscheidet, welche Maßnahme hilft.

Sieben ArtenWas ausfällt, wie oft, und was wirklich hilft
SIEBEN ARTEN VON AUSFALL — NUR ZWEI DAVON BRAUCHEN EINEN ZWEITEN SERVERWas ausfälltWie oftDauerWas wirklich hilftDer Prozess stirbtwöchentlichSekundenNeustart durch Docker — kein zweiter Server nötigDie Anwendung hängtmonatlichbis jemand hinsiehtGesundheitsprüfung, die tief genug prüft (Station 03)Ein FehldeploymonatlichMinuten bis StundenNicht die Doppelung — sondern Zurückrollen (Station 04)Die Platte läuft volljährlichStundenÜberwachung; doppelt läuft sonst beides vollDie Maschine fällt ausalle 1–3 JahreStundenZweiter Anwendungsserver — genau dafür ist er daDas Rechenzentrum fällt ausalle 3–10 JahreStunden bis TageNur ein zweiter Standort (Station 07)Der Anbieter sperrt das KontoseltenTageKeine Technik — nur die Sicherung außer HausDie häufigsten Ausfälle löst kein zweiter Server.Wer mit dem zweiten Server anfängt, verdoppelt die häufigen Ursachen und behebt nur die seltene — deshalb erst der Betrieb.
Zwei Zeilen dieser Tabelle sind der Grund für diesen Kurs: „Die Maschine fällt aus“ und, mit Einschränkungen, „Die Anwendung hängt“. Alle anderen brauchen andere Maßnahmen — und bekommen durch die Doppelung sogar zusätzliche Angriffsfläche, weil es jedes Teil nun zweimal gibt.

Die Zeile, die am meisten Ärger macht

Nicht der harte Ausfall, sondern der halbe: Der Server läuft, antwortet, wird aber immer langsamer, oder er nimmt Verbindungen an und beantwortet keine mehr. Für einen Menschen ist das offensichtlich, für den Verteiler nicht — er sieht einen Server, der antwortet.

SorteWas der Verteiler siehtWas zu tun ist
Harter Ausfall — Maschine wegVerbindung wird sofort abgelehntNichts. Das erkennt jeder Verteiler binnen Sekunden.
Hänger — Anwendung antwortet nicht mehrVerbindung steht offen, keine AntwortZeitgrenze in der Gesundheitsprüfung (Station 03).
Schleichender Ausfall — wird langsamAntwortet, nur spätAntwortzeit messen, nicht nur Erreichbarkeit (Station 06).
Lügender Ausfall — antwortet mit FehlerAntwort mit FehlercodeGesundheitsprüfung muss den Fehlercode auswerten, nicht nur „hat geantwortet“.
WarumWarum der halbe Ausfall schlimmer ist als der ganze

Ein harter Ausfall ist eindeutig, wird in Sekunden erkannt und in Sekunden umgangen. Der halbe Ausfall dagegen hat eine unangenehme Eigenschaft: Er zieht Verkehr an.

Ein Server, der langsam antwortet, hält Verbindungen länger offen. Verteilverfahren, die nach offenen Verbindungen gehen, schicken ihm daraufhin weniger — gut. Verfahren, die stur reihum verteilen, schicken ihm genauso viel wie dem gesunden — schlecht. Und wenn die Anwendung nach einer Zeitüberschreitung wiederholt, bekommt der kranke Server sogar mehr Arbeit als vorher.

Deshalb sind die drei Einstellungen aus Station 03 — Verteilverfahren, Gesundheitsprüfung, Zeitgrenzen — nicht Feinschliff, sondern die Stelle, an der sich entscheidet, ob der doppelte Aufbau im Ernstfall trägt.

Auf Stufe 2 (Fortgeschritten) steht hier zusätzlich: warum ein halb ausgefallener Server Verkehr anzieht statt ihn zu verlieren
Zugang erhalten
Fortschritt merken?Mit Zugang bleiben Häkchen und erledigte Phasen am Konto — auf jedem Gerät.