Tous les manuels d'exploitation
En cours de rédaction · Le projet de travail nécessite un manifeste de libération

Manuel technique

Exploitation, supervision et restauration

Que vérifier quotidiennement et comment prouver que les données et le service peuvent être rétablis ?

Public
Administrateur des opérations, DBA, Service d'assistance, Sécurité, Responsable de service
Résultat
L'opération comporte des contrôles mesurables, les sauvegardes sont testées et l'incident fait l'objet d'une procédure d'escalade clairement définie.

01

Opérations quotidiennes

  • Contrôles d'état et de santé des conteneurs ; Zabbix peut surveiller la disponibilité et les indicateurs opérationnels.
  • Erreurs d'application et files d'attente d'intégration ayant échoué ; Sentry peut intercepter les exceptions d'application
  • capacité de stockage des disques, des bases de données et des documents
  • expiration des certificats, clés et jetons
  • Processus retardés, signatures en attente et tâches en retard
  • succès de la sauvegarde et de la réplication

02

Journaux et traçabilité

  • Grafana et Loki peuvent fournir des journaux et des rapports opérationnels centralisés basés sur l'architecture du client.
  • Le journal d'application ne doit pas contenir de mots de passe, de jetons ou de documents sensibles complets.
  • Chaque cas et appel d'intégration utilise un ID de corrélation.
  • La piste d'audit doit figurer dans un audit géré, et non pas seulement dans le journal opérationnel du conteneur.
  • L'heure de tous les nœuds est synchronisée et le fuseau horaire est explicitement défini.
  • La conservation des journaux, des audits et des documents est régie par des règles distinctes.

03

Sauvegarde et restauration

  1. Sauvegardez la base de données, les documents persistants, la configuration, les modèles et les versions de définition des processus.
  2. Sauvegardez la liste des résumés d'images et le manifeste de publication ; la sauvegarde des données seules ne suffit pas.
  3. Effectuez la restauration dans un environnement distinct et mesurez le RPO/RTO.
  4. Après la restauration, effectuez le même test de fumée qu'après l'installation.
  5. Consignez le résultat du test de récupération, y compris les dépendances manquantes et la correction.

04

Incident et escalade

  • L1 collecte l'heure, l'utilisateur, le cas, l'ID de corrélation, la version et les étapes de reproduction.
  • Un incident de sécurité n'est pas traité comme une erreur de routine et suit la procédure établie par l'organisation.
  • L2 vérifie la configuration, l'intégration et les problèmes connus des versions.
  • L3 DERS recevra des données minimisées, les journaux pertinents et une version/un résumé précis.
  • Après la réparation, le dossier d'origine, les dossiers similaires et l'intégralité de la piste d'audit sont vérifiés.