Alle Runbooks
In Bearbeitung · Der Arbeitsentwurf benötigt ein Freigabemanifest.

Technisches Handbuch

Betrieb, Überwachung und Wiederherstellung

Was täglich zu überprüfen ist und wie man nachweisen kann, dass Daten und Dienste wiederhergestellt werden können.

Publikum
Betriebsadministrator, Datenbankadministrator, Service Desk, Sicherheit, Serviceverantwortlicher
Ergebnis
Der Betrieb verfügt über messbare Kontrollen, Backups werden getestet, und der Vorfall hat eine klare Eskalation.

01

Tagesbetrieb

  • Containerstatus und Integritätsprüfungen; Zabbix kann Verfügbarkeit und Betriebskennzahlen überwachen
  • Anwendungsfehler und fehlgeschlagene Integrationswarteschlangen; Sentry kann Anwendungsausnahmen abfangen.
  • Speicherkapazität für Festplatten, Datenbanken und Dokumente
  • Ablauf von Zertifikaten, Schlüsseln und Token
  • verzögerte Prozesse, ausstehende Unterschriften und überfällige Aufgaben
  • Backup und Replikation erfolgreich

02

Protokollierung und Rückverfolgbarkeit

  • Grafana und Loki können zentralisierte Betriebsprotokolle und Berichte basierend auf der Architektur des Kunden bereitstellen.
  • Das Anwendungsprotokoll darf keine Passwörter, Token oder vollständige vertrauliche Dokumente enthalten.
  • Jeder Fall und jeder Integrationsaufruf verwendet eine Korrelations-ID.
  • Der Prüfpfad gehört in ein verwaltetes Prüfprotokoll, nicht nur in das Betriebsprotokoll des Containers.
  • Die Zeit aller Knoten ist synchronisiert und die Zeitzone ist explizit eingestellt.
  • Die Aufbewahrung von Protokollen, Prüfberichten und Dokumenten unterliegt gesonderten Regeln.

03

Sicherung und Wiederherstellung

  1. Sichern Sie die Datenbank, die persistenten Dokumente, die Konfiguration, die Vorlagen und die Versionen der Prozessdefinitionen.
  2. Speichern Sie die Liste der Image-Digests und das Release-Manifest; eine Datensicherung allein reicht nicht aus.
  3. Führen Sie die Wiederherstellung in einer separaten Umgebung durch und messen Sie RPO/RTO.
  4. Führen Sie nach der Wiederherstellung denselben Funktionstest durch wie nach der Installation.
  5. Protokollieren Sie das Ergebnis des Wiederherstellungstests, einschließlich fehlender Abhängigkeiten und der Behebung.

04

Vorfall und Eskalation

  • L1 erfasst Zeit, Benutzer, Fall, Korrelations-ID, Version und Reproduktionsschritte.
  • Ein Sicherheitsvorfall wird nicht als Routinefehler behandelt, sondern gemäß dem Plan der Organisation weiterverfolgt.
  • L2 überprüft Konfiguration, Integration und bekannte Release-Probleme.
  • L3 DERS erhält minimierte Daten, relevante Protokolle und eine genaue Version/Zusammenfassung.
  • Nach der Reparatur werden der ursprüngliche Fall, ähnliche Fälle und die Vollständigkeit des Prüfprotokolls überprüft.