Infraestructura, nube y DevOps · Mixto

Revisión de incidentes sin buscar culpables

En una línea: Tras cada incidente merece la pena una hora de revisión escrita centrada en el sistema, no en la persona; si no, el mismo incidente volverá.

Durante el incidente

Un gestor de incidente que decide y documenta, un único canal de comunicación, y actualizar a los clientes tan pronto como sea posible. La recuperación precede a la investigación: restaura el servicio y recoge evidencias al mismo tiempo.

Después

Escribe una línea de tiempo factual, el impacto en números, qué retrasó la detección y qué retrasó la corrección. Las dos últimas son las importantes: el tiempo de detección suele ser mayor que el de corrección, y eso apunta a brechas de monitorización.

Produce dos o tres acciones con propietario y fecha. Veinte acciones significan cero acciones.

Cultura

Quien pulsó el botón es el síntoma; el sistema que lo permitió sin aprobación, sin comprobación y sin vuelta atrás es el problema. Los equipos que buscan culpables aprenden a ocultar incidentes, lo cual es mucho más peligroso.

En profundidad

Guarda las revisiones en un lugar accesible y léelas trimestralmente. Los patrones recurrentes —la misma dependencia, el mismo tipo de cambio, la misma hora de la semana— apuntan a un problema estructural que ninguna revisión aislada revela.