Infrastructure, cloud et DevOps · Avancé

Haute disponibilité et reprise après sinistre

En une ligne : Décidez combien vous coûte une heure d'arrêt et seulement ensuite décidez combien de redondance acheter.

Définir un objectif avant une solution

L'écart entre 99,9 et 99,99 % de disponibilité est un multiplicateur en coût et complexité. La plupart des systèmes commerciaux n'ont pas besoin du plus élevé, et qui en a besoin peut le justifier en argent.

Des couches de résilience

Plusieurs instances dans des zones de disponibilité distinctes ; une base de données avec un réplica secondaire et un basculement automatique ; pas de dépendance à l'état local ; et des vérifications de santé qui retirent du trafic une instance défectueuse.

Pour l'étape suivante — une seconde région géographique — le coût et la complexité sont significatifs, incluant des questions de latence et de cohérence des données.

Le scénario catastrophe

Pas seulement un serveur tombé : une suppression accidentelle, la corruption des données et un compte cloud verrouillé. Chacun exige une réponse différente, et les trois devraient avoir un plan écrit que quelqu'un a lu dans l'année écoulée.

Pour aller plus loin

Effectuez des exercices de panne contrôlés : faites tomber une instance, coupez une dépendance, remplissez un disque — dans un environnement contrôlé et à un moment connu. Un système jamais testé en situation de panne n'est pas résilient, il est juste non testé.