Wszystkie podręczniki
W trakcie budowy · wersja robocza wymaga manifestu wydania

Podręcznik techniczny

Eksploatacja, nadzór i przywracanie

Co należy sprawdzać każdego dnia i jak udowodnić, że dane i usługa mogą zostać przywrócone.

Publiczność
Administrator operacyjny, administrator baz danych, dział obsługi klienta, dział bezpieczeństwa, właściciel usługi
Wynik
Operacja podlega mierzalnym kontrolom, kopie zapasowe są testowane, a incydent ma jasną eskalację.

01

Codzienna operacja

  • status kontenera i kontrole kondycji; Zabbix może monitorować dostępność i metryki operacyjne
  • Błędy aplikacji i nieudane kolejki integracji; Sentry może wychwytywać wyjątki aplikacji
  • pojemność dysków, baz danych i pamięci masowej dokumentów
  • wygaśnięcie certyfikatów, kluczy i tokenów
  • opóźnione procesy, oczekujące podpisy i przeterminowane zadania
  • sukces tworzenia kopii zapasowych i replikacji

02

Rejestry i możliwość śledzenia

  • Grafana i Loki mogą zapewnić scentralizowane dzienniki operacyjne i raporty oparte na architekturze klienta.
  • Dziennik aplikacji nie może zawierać haseł, tokenów ani całych poufnych dokumentów.
  • Każdy przypadek i wywołanie integracji wykorzystuje identyfikator korelacji.
  • Ślad audytu powinien znajdować się w zarządzanym audycie, a nie tylko w dzienniku operacyjnym kontenera.
  • Czas wszystkich węzłów jest zsynchronizowany, a strefa czasowa jest wyraźnie ustawiona.
  • Przechowywanie rejestrów, audytów i dokumentów regulują odrębne przepisy.

03

Kopia zapasowa i przywracanie

  1. Utwórz kopię zapasową bazy danych, dokumentów trwałych, konfiguracji, szablonów i wersji definicji procesów.
  2. Zapisz listę streszczeń obrazów i opublikuj manifest; samo utworzenie kopii zapasowej danych nie wystarczy.
  3. Wykonaj odzyskiwanie do oddzielnego środowiska i zmierz RPO/RTO.
  4. Po przywróceniu systemu należy przeprowadzić ten sam test dymowy, co po instalacji.
  5. Zapisz wynik testu odzyskiwania, w tym brakujące zależności i poprawkę.

04

Incydent i eskalacja

  • L1 zbiera informacje o czasie, użytkowniku, przypadku, identyfikatorze korelacji, wersji i krokach odtwarzania.
  • Incydent bezpieczeństwa nie jest traktowany jako rutynowy błąd, lecz postępuje zgodnie z planem organizacji.
  • L2 weryfikuje konfigurację, integrację i znane problemy dotyczące wydań.
  • L3 DERS otrzyma zminimalizowane dane, istotne logi i dokładną wersję/streszczenie.
  • Po naprawie weryfikuje się oryginalny przypadek, podobne przypadki i kompletność śladu audytu.