← Tous les manuels d'exploitation
En cours de rédaction · Le projet de travail nécessite un manifeste de libération
Manuel technique
Exploitation, supervision et restauration
Que vérifier quotidiennement et comment prouver que les données et le service peuvent être rétablis ?
01
Opérations quotidiennes
- Contrôles d'état et de santé des conteneurs ; Zabbix peut surveiller la disponibilité et les indicateurs opérationnels.
- Erreurs d'application et files d'attente d'intégration ayant échoué ; Sentry peut intercepter les exceptions d'application
- capacité de stockage des disques, des bases de données et des documents
- expiration des certificats, clés et jetons
- Processus retardés, signatures en attente et tâches en retard
- succès de la sauvegarde et de la réplication
02
Journaux et traçabilité
- Grafana et Loki peuvent fournir des journaux et des rapports opérationnels centralisés basés sur l'architecture du client.
- Le journal d'application ne doit pas contenir de mots de passe, de jetons ou de documents sensibles complets.
- Chaque cas et appel d'intégration utilise un ID de corrélation.
- La piste d'audit doit figurer dans un audit géré, et non pas seulement dans le journal opérationnel du conteneur.
- L'heure de tous les nœuds est synchronisée et le fuseau horaire est explicitement défini.
- La conservation des journaux, des audits et des documents est régie par des règles distinctes.
03
Sauvegarde et restauration
- Sauvegardez la base de données, les documents persistants, la configuration, les modèles et les versions de définition des processus.
- Sauvegardez la liste des résumés d'images et le manifeste de publication ; la sauvegarde des données seules ne suffit pas.
- Effectuez la restauration dans un environnement distinct et mesurez le RPO/RTO.
- Après la restauration, effectuez le même test de fumée qu'après l'installation.
- Consignez le résultat du test de récupération, y compris les dépendances manquantes et la correction.
04
Incident et escalade
- L1 collecte l'heure, l'utilisateur, le cas, l'ID de corrélation, la version et les étapes de reproduction.
- Un incident de sécurité n'est pas traité comme une erreur de routine et suit la procédure établie par l'organisation.
- L2 vérifie la configuration, l'intégration et les problèmes connus des versions.
- L3 DERS recevra des données minimisées, les journaux pertinents et une version/un résumé précis.
- Après la réparation, le dossier d'origine, les dossiers similaires et l'intégralité de la piste d'audit sont vérifiés.
Guide suivant
