View a markdown version of this page

Preparazione per gli incidenti in Incident Manager -  Incident Manager

Strumento di gestione degli incidenti AWS Systems Manager non è più aperto a nuovi clienti. I clienti esistenti possono continuare a utilizzare il servizio normalmente. Per ulteriori informazioni, consulta Strumento di gestione degli incidenti AWS Systems Manager la modifica della disponibilità.

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Preparazione per gli incidenti in Incident Manager

La pianificazione di un incidente inizia molto prima del ciclo di vita dell'incidente. Come mostra la figura seguente, prima di iniziare a rispondere agli incidenti, ci si prepara impostando i canali di chat, creando piani di escalation, specificando i contatti e determinando i runbook di automazione da utilizzare nella risposta agli incidenti. Quindi, utilizza un piano di risposta che specifichi come avviene il monitoraggio e se le risposte sono automatizzate. Una volta completata la correzione, puoi analizzare l'incidente e la risposta all'incidente per perfezionare ulteriormente il piano di risposta per gli incidenti futuri.

Un flusso di lavoro di Incident Manager per prepararsi, rispondere e imparare dagli incidenti.

Monitoraggio

Il monitoraggio dello stato delle applicazioni AWS ospitate è fondamentale per garantire tempi di attività e prestazioni delle applicazioni. Nel determinare le soluzioni di monitoraggio, considerate quanto segue:

  • Criticità delle funzionalità: se il sistema dovesse guastarsi, quanto sarebbe critico l'impatto sugli utenti a valle.

  • Caratteristiche comuni dei guasti: con che frequenza si verifica un guasto di un sistema? I sistemi che richiedono interventi frequenti devono essere monitorati attentamente.

  • Latenza aumentata: quanto è aumentato o diminuito il tempo necessario per completare un'attività.

  • Client-side Rispetto alle metriche lato server: se esiste una discrepanza tra le metriche correlate sul client e sul server.

  • Fallimenti legati alle dipendenze: guasti a cui il team può e deve prepararsi.

Dopo aver creato i piani di risposta, puoi utilizzare le tue soluzioni di monitoraggio per tracciare automaticamente gli incidenti nel momento in cui si verificano nel tuo ambiente. Per ulteriori informazioni sul monitoraggio e la creazione degli incidenti, vedereVisualizzazione dei dettagli dell'incidente nella console Incident Manager.

Per ulteriori informazioni sulla progettazione di applicazioni e carichi di lavoro infrastrutturali sicuri, ad alte prestazioni, resilienti ed efficienti, consultare il. AWS Well-Architected