Melhores Práticas de Resposta a Incidentes
Um resumo condensado das 25 práticas mais importantes de resposta a incidentes para equipes Node.js - extraído de todas as páginas desta seção.
Busque em todas as páginas da documentação
Um resumo condensado das 25 práticas mais importantes de resposta a incidentes para equipes Node.js - extraído de todas as páginas desta seção.
Vincule runbooks do README do serviço: A equipe de plantão encontra os passos de rollback em 30 segundos - Noções Básicas de Incidentes.
Declare a severidade em 5 minutos: Arredonde para cima quando tiver dúvidas; rebaixe mais tarde - Noções Básicas de Incidentes.
Atribua IC, TL, Comms, Scribe: O IC decide; o TL depura - Noções Básicas de Incidentes.
Checklist dos primeiros 15 minutos: Correlação de deploy, dashboards, logs, raio de impacto - Noções Básicas de Incidentes.
Estabilize antes do RCA: Faça rollback, escale, desative flags ou use circuit breaker - Rollback de Deploy Ruim.
Registre GIT_SHA na inicialização: Associe logs ao digest exato da imagem instantaneamente.
Anote deploys no Grafana: Linha vertical no momento da promoção para correlação.
Separe liveness e readiness: DB indisponível não deve matar todos os pods - Modo de Indisponibilidade do Banco de Dados.
Modo somente leitura antes da tempestade no pool: Bloqueie escritas; pause workers - Modo de Indisponibilidade do Banco de Dados.
Triagem de OOM: heap vs RSS: Correções diferentes para vazamento vs buffers - Resposta ao OOM Killer.
Não tire snapshot de heap com tráfego total: Esvazie o pod primeiro; a lentidão piora o incidente.
Faça rollback da API e dos workers juntos: Esquema acoplado precisa de rollback acoplado - Rollback de Deploy Ruim.
Desative feature flags antes do rollback completo: Quando apenas um caminho está ruim - Rollback de Deploy Ruim.
Mantenha as últimas 10 tags de imagem no registry: rollout undo falha se a imagem for coletada pelo GC.
Atualizações em linguagem clara para stakeholders: Impacto, status, hora da próxima atualização - Noções Básicas de Incidentes.
Scribe registra a linha do tempo a cada 10 minutos: Comandos, links, decisões com timestamps UTC.
Capture evidências antes de reiniciar: Gráficos de memória, métricas do pool, IDs de trace.
Alerta de lag no event loop: CPU-baixo / latência-alta é um padrão de travamento do Node - Modelo de Post-Mortem.
Post-mortem em até 48 horas para SEV1/SEV2: Sem culpa, com links para evidências - Modelo de Post-Mortem.
Itens de ação com responsável e data de vencimento: "Ser mais cuidadoso" não é um item de ação.
Pratique rollback trimestralmente: Game day com rollout undo roteirizado.
Verificações Canary em p95, não apenas erros: Regressões de latência passam despercebidas de outra forma.
Circuit breakers em dependências de saída: Pare a amplificação de retentativas durante indisponibilidade upstream.
Convenção de nomenclatura do canal de incidentes: [SEV2] nome-do-serviço descrição-curta.
Compartilhe aprendizados genéricos em toda a plataforma: Ajustes de alerta de pool ajudam todos os consumidores de Postgres.
Comando de rollback, desativação de feature flags, links de dashboards, caminho de escalonamento e problemas conhecidos recentes.
SEV4 e SEV3 pontuais com correção clara e sem risco de recorrência. Problemas repetidos exigem documentação.
Observe o travamento do event loop vs. esgotamento do thread pool. A memória é heap de processo único mais buffers nativos.
Versões da Stack: Esta página foi escrita para Node.js 24.18.0 (Active LTS), npm 10+, TypeScript 5.6+, Express 5, Fastify 5 e NestJS 11.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026