Mejores prácticas de respuesta a incidentes
Un resumen condensado de las 25 prácticas más importantes de respuesta a incidentes para equipos de Node.js, extraídas de cada página de esta sección.
Busca en todas las páginas de la documentación
Un resumen condensado de las 25 prácticas más importantes de respuesta a incidentes para equipos de Node.js, extraídas de cada página de esta sección.
Enlaza los runbooks desde el README del servicio: El personal de guardia encuentra los pasos de reversión en 30 segundos - Conceptos básicos de incidentes.
Declara la severidad en 5 minutos: Redondea hacia arriba si no estás seguro; degrada después - Conceptos básicos de incidentes.
Asigna IC, TL, Comms, Scribe: El IC decide; el TL depura - Conceptos básicos de incidentes.
Lista de verificación de los primeros 15 minutos: Correlación de despliegues, paneles, registros, radio de explosión - Conceptos básicos de incidentes.
Estabiliza antes de la RCA: Revertir, escalar, deshabilitar funciones o cortar el circuito - Reversión de despliegue defectuoso.
Registra GIT_SHA al inicio: Vincula los registros a la imagen exacta al instante.
Anota los despliegues en Grafana: Línea vertical en el momento de la promoción para correlación.
Separa la vivacidad y la preparación: La caída de la base de datos no debe eliminar todos los pods - Modo de interrupción de la base de datos.
Modo de solo lectura antes de la tormenta de pool: Bloquea escrituras; pausa trabajadores - Modo de interrupción de la base de datos.
Clasificación de OOM: heap vs RSS: Diferentes soluciones para fugas vs buffers - Respuesta al OOM Killer.
No tomes instantáneas de heap bajo tráfico completo: Drena el pod primero; el estancamiento empeora el incidente.
Revertir API y trabajadores juntos: El esquema acoplado necesita una reversión acoplada - Reversión de despliegue defectuoso.
Desactivar la función antes de la reversión completa: Cuando solo una ruta es mala - Reversión de despliegue defectuoso.
Mantén las últimas 10 etiquetas de imagen en el registro: rollout undo falla si la imagen es recolectada por GC.
Actualizaciones a los interesados en lenguaje sencillo: Impacto, estado, próxima hora de actualización - Conceptos básicos de incidentes.
Cronología del escriba cada 10 minutos: Comandos, enlaces, decisiones con marcas de tiempo UTC.
Captura evidencia antes de reiniciar: Gráficos de memoria, métricas de pool, IDs de rastreo.
Alerta de retraso del bucle de eventos: CPU baja / latencia alta es un patrón de estancamiento de Node - Plantilla de post-mortem.
Post-mortem dentro de las 48 horas para SEV1/SEV2: Sin culpa, con enlaces a la evidencia - Plantilla de post-mortem.
Elementos de acción con propietario y fecha de vencimiento: "Ser más cuidadoso" no es un elemento de acción.
Practica la reversión trimestralmente: Día de juego con rollout undo programado.
Las comprobaciones canary p95, no solo errores: Las regresiones de latencia se escapan de otra manera.
Disyuntores en dependencias salientes: Detén la amplificación de reintentos durante una interrupción ascendente.
Convención de nombres de canales de incidentes: [SEV2] nombre-servicio descripción-corta.
Comparte aprendizajes genéricos en toda la plataforma: La optimización de alertas de pool ayuda a todos los consumidores de Postgres.
Comando de reversión, desactivación de funciones, enlaces a paneles, ruta de escalada y problemas conocidos recientes.
SEV4 y SEV3 únicos con una solución clara y sin riesgo de recurrencia. Los problemas repetidos requieren documentación.
Observa el estancamiento del bucle de eventos frente al agotamiento del pool de hilos. La memoria es el heap de un solo proceso más los buffers nativos.
Versiones de la pila: Esta página fue escrita para Node.js 24.18.0 (LTS activa), npm 10+, TypeScript 5.6+, Express 5, Fastify 5 y NestJS 11.
Revisado por Chris St. John·Última actualización: 16 jul 2026