Infraestructura, nube y DevOps · Avanzado

Alta disponibilidad y recuperación ante desastres

En una línea: Decide cuánto te cuesta una hora de caída y solo entonces decide cuánta redundancia compras.

Definir un objetivo antes de una solución

La diferencia entre el 99,9 y el 99,99 por ciento de disponibilidad es un multiplicador en coste y complejidad. La mayoría de los sistemas de negocio no necesitan el más alto, y quien lo necesite puede justificarlo en dinero.

Capas de resiliencia

Varias instancias en zonas de disponibilidad distintas; una base de datos con réplica secundaria y conmutación automática; sin dependencia del estado local; y comprobaciones de salud que saquen del tráfico una instancia defectuosa.

Para el siguiente paso —una segunda región geográfica— el coste y la complejidad son significativos, incluidas las preguntas de latencia y consistencia de datos.

El escenario de desastre

No solo un servidor caído: un borrado accidental, la corrupción de datos, y una cuenta de nube bloqueada. Cada uno exige una respuesta distinta, y los tres deben tener un plan escrito que alguien haya leído en el último año.

En profundidad

Ejecuta simulacros de fallo controlados: tumba una instancia, corta una dependencia, llena un disco, en un entorno controlado y en un momento conocido. Un sistema nunca probado bajo fallo no es resiliente, solo es no probado.