Todos los manuales de operaciones
En construcción · El borrador requiere un manifiesto de lanzamiento

Manual de procedimientos técnicos

Operación, supervisión y restauración

Qué comprobar a diario y cómo demostrar que se pueden restablecer los datos y el servicio.

Audiencia
Administrador de operaciones, administrador de bases de datos, mesa de ayuda, seguridad, propietario del servicio.
Resultado
La operación cuenta con controles medibles, se realizan pruebas de respaldo y el incidente tiene un procedimiento de escalamiento claro.

01

Operación diaria

  • Estado y comprobaciones de salud de los contenedores; Zabbix puede supervisar la disponibilidad y las métricas operativas.
  • Errores de la aplicación y colas de integración fallidas; Sentry puede detectar excepciones de la aplicación.
  • Capacidad de almacenamiento de discos, bases de datos y documentos
  • Caducidad de certificados, claves y tokens
  • Procesos retrasados, firmas pendientes y tareas vencidas
  • Copia de seguridad y replicación exitosas

02

Registros y trazabilidad

  • Grafana y Loki pueden proporcionar registros operativos e informes centralizados basados ​​en la arquitectura del cliente.
  • El registro de la aplicación no debe contener contraseñas, tokens ni documentos confidenciales completos.
  • Cada caso y cada llamada de integración utiliza un ID de correlación.
  • El registro de auditoría debe formar parte de una auditoría gestionada, no solo del registro operativo del contenedor.
  • La hora de todos los nodos está sincronizada y la zona horaria se establece explícitamente.
  • La conservación de registros, auditorías y documentos se rige por normas independientes.

03

Copia de seguridad y restauración

  1. Realice una copia de seguridad de la base de datos, los documentos persistentes, la configuración, las plantillas y las versiones de definición de procesos.
  2. Guarde la lista de resúmenes de imágenes y el manifiesto de lanzamiento; hacer una copia de seguridad de los datos por sí solo no es suficiente.
  3. Realice la recuperación en un entorno separado y mida el RPO/RTO.
  4. Tras la restauración, ejecute la misma prueba de humo que después de la instalación.
  5. Registre el resultado de la prueba de recuperación, incluidas las dependencias faltantes y la solución.

04

Incidente y escalamiento

  • L1 recopila información sobre la hora, el usuario, el caso, el ID de correlación, la versión y los pasos para reproducir el problema.
  • Un incidente de seguridad no se trata como un error rutinario, sino que se sigue el plan de la organización.
  • El nivel L2 verifica la configuración, la integración y los problemas conocidos de las versiones.
  • El sistema L3 DERS recibirá datos minimizados, registros relevantes y una versión/resumen preciso.
  • Tras la reparación, se verifica el caso original, los casos similares y la integridad del registro de auditoría.