← Todos los manuales de operaciones
En construcción · El borrador requiere un manifiesto de lanzamiento
Manual de procedimientos técnicos
Operación, supervisión y restauración
Qué comprobar a diario y cómo demostrar que se pueden restablecer los datos y el servicio.
01
Operación diaria
- Estado y comprobaciones de salud de los contenedores; Zabbix puede supervisar la disponibilidad y las métricas operativas.
- Errores de la aplicación y colas de integración fallidas; Sentry puede detectar excepciones de la aplicación.
- Capacidad de almacenamiento de discos, bases de datos y documentos
- Caducidad de certificados, claves y tokens
- Procesos retrasados, firmas pendientes y tareas vencidas
- Copia de seguridad y replicación exitosas
02
Registros y trazabilidad
- Grafana y Loki pueden proporcionar registros operativos e informes centralizados basados en la arquitectura del cliente.
- El registro de la aplicación no debe contener contraseñas, tokens ni documentos confidenciales completos.
- Cada caso y cada llamada de integración utiliza un ID de correlación.
- El registro de auditoría debe formar parte de una auditoría gestionada, no solo del registro operativo del contenedor.
- La hora de todos los nodos está sincronizada y la zona horaria se establece explícitamente.
- La conservación de registros, auditorías y documentos se rige por normas independientes.
03
Copia de seguridad y restauración
- Realice una copia de seguridad de la base de datos, los documentos persistentes, la configuración, las plantillas y las versiones de definición de procesos.
- Guarde la lista de resúmenes de imágenes y el manifiesto de lanzamiento; hacer una copia de seguridad de los datos por sí solo no es suficiente.
- Realice la recuperación en un entorno separado y mida el RPO/RTO.
- Tras la restauración, ejecute la misma prueba de humo que después de la instalación.
- Registre el resultado de la prueba de recuperación, incluidas las dependencias faltantes y la solución.
04
Incidente y escalamiento
- L1 recopila información sobre la hora, el usuario, el caso, el ID de correlación, la versión y los pasos para reproducir el problema.
- Un incidente de seguridad no se trata como un error rutinario, sino que se sigue el plan de la organización.
- El nivel L2 verifica la configuración, la integración y los problemas conocidos de las versiones.
- El sistema L3 DERS recibirá datos minimizados, registros relevantes y una versión/resumen preciso.
- Tras la reparación, se verifica el caso original, los casos similares y la integridad del registro de auditoría.
Siguiente guía
