← Alle Runbooks
In Bearbeitung · Der Arbeitsentwurf benötigt ein Freigabemanifest.
Technisches Handbuch
Betrieb, Überwachung und Wiederherstellung
Was täglich zu überprüfen ist und wie man nachweisen kann, dass Daten und Dienste wiederhergestellt werden können.
01
Tagesbetrieb
- Containerstatus und Integritätsprüfungen; Zabbix kann Verfügbarkeit und Betriebskennzahlen überwachen
- Anwendungsfehler und fehlgeschlagene Integrationswarteschlangen; Sentry kann Anwendungsausnahmen abfangen.
- Speicherkapazität für Festplatten, Datenbanken und Dokumente
- Ablauf von Zertifikaten, Schlüsseln und Token
- verzögerte Prozesse, ausstehende Unterschriften und überfällige Aufgaben
- Backup und Replikation erfolgreich
02
Protokollierung und Rückverfolgbarkeit
- Grafana und Loki können zentralisierte Betriebsprotokolle und Berichte basierend auf der Architektur des Kunden bereitstellen.
- Das Anwendungsprotokoll darf keine Passwörter, Token oder vollständige vertrauliche Dokumente enthalten.
- Jeder Fall und jeder Integrationsaufruf verwendet eine Korrelations-ID.
- Der Prüfpfad gehört in ein verwaltetes Prüfprotokoll, nicht nur in das Betriebsprotokoll des Containers.
- Die Zeit aller Knoten ist synchronisiert und die Zeitzone ist explizit eingestellt.
- Die Aufbewahrung von Protokollen, Prüfberichten und Dokumenten unterliegt gesonderten Regeln.
03
Sicherung und Wiederherstellung
- Sichern Sie die Datenbank, die persistenten Dokumente, die Konfiguration, die Vorlagen und die Versionen der Prozessdefinitionen.
- Speichern Sie die Liste der Image-Digests und das Release-Manifest; eine Datensicherung allein reicht nicht aus.
- Führen Sie die Wiederherstellung in einer separaten Umgebung durch und messen Sie RPO/RTO.
- Führen Sie nach der Wiederherstellung denselben Funktionstest durch wie nach der Installation.
- Protokollieren Sie das Ergebnis des Wiederherstellungstests, einschließlich fehlender Abhängigkeiten und der Behebung.
04
Vorfall und Eskalation
- L1 erfasst Zeit, Benutzer, Fall, Korrelations-ID, Version und Reproduktionsschritte.
- Ein Sicherheitsvorfall wird nicht als Routinefehler behandelt, sondern gemäß dem Plan der Organisation weiterverfolgt.
- L2 überprüft Konfiguration, Integration und bekannte Release-Probleme.
- L3 DERS erhält minimierte Daten, relevante Protokolle und eine genaue Version/Zusammenfassung.
- Nach der Reparatur werden der ursprüngliche Fall, ähnliche Fälle und die Vollständigkeit des Prüfprotokolls überprüft.
Nächste Anleitung
