Monitoramento e observabilidade: saber que algo quebrou antes do cliente
O que medir
Comece com quatro: taxa de requisições, taxa de erros, tempo de resposta nos extremos e saturação de recursos. Adicione uma métrica de negócio — pedidos por hora, cadastros, envios — que vai capturar falhas que a infraestrutura não vê.
O tempo de resposta médio engana. Olhe o percentil 95 e 99; é lá que estão os usuários irritados.
Logs úteis
Estruturados, com um identificador de requisição que acompanha uma chamada por todo o sistema, e sem informação pessoal desnecessária. Um log de texto livre é um arquivo, não uma ferramenta de investigação.
Alertas que não cansam
Alerte sobre sintomas que o usuário sente, não sobre toda anomalia técnica. Todo alerta deve incluir o que aconteceu, o impacto e o primeiro passo. Um alerta sem ação — delete. Fadiga de alertas é a principal causa de perder um incidente real.
Indo mais fundo
Adicione rastreamento distribuído que mostre o caminho de uma requisição entre componentes com timings. Em sistemas divididos, é a única forma de responder 'por que isso levou três segundos' sem adivinhar, e encurta investigações de horas para minutos.