Alta disponibilidade e recuperação de desastres
Definir um objetivo antes de uma solução
A diferença entre 99,9% e 99,99% de disponibilidade é um multiplicador em custo e complexidade. A maioria dos sistemas de negócio não precisa do mais alto, e quem precisa consegue justificar em dinheiro.
Camadas de resiliência
Várias instâncias em diferentes zonas de disponibilidade; banco de dados com uma réplica secundária e failover automático; sem dependência de estado local; e health checks que removem uma instância com falha do tráfego.
Para o próximo passo — uma segunda região geográfica — o custo e a complexidade são significativos, incluindo questões de latência e consistência de dados.
O cenário de desastre
Não só um servidor caído: exclusão acidental, corrupção de dados e uma conta de cloud bloqueada. Cada um exige uma resposta diferente, e os três devem ter um plano escrito que alguém leu no último ano.
Indo mais fundo
Execute simulacros de falha controlada: derrube uma instância, corte uma dependência, encha um disco — em um ambiente controlado em um horário conhecido. Um sistema nunca testado em falha não é resiliente, apenas não testado.