Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Testa i carichi di lavoro integrati in Incident Detection and Response
Inserimento di allarmiAl termine, AWS Incident Detection and Response consente il monitoraggio del carico di lavoro e invia una Go-Live conferma. Il tuo carico di lavoro viene monitorato attivamente da questo momento in poi.
I test degli allarmi confermano che gli allarmi integrati attivino AWS Incident Detection and Response come previsto, attivino i runbook appropriati e qualsiasi altra azione desiderata, ad esempio la creazione automatica di casi se selezionata durante l'inserimento dell'allarme.
Il test è facoltativo ma fortemente consigliato. Sei responsabile della convalida delle modalità di risposta prima che si verifichi un incidente reale.
Opzioni di test
AWS Incident Detection and Response offre due opzioni di test.
Opzione 1: programmata GameDay (consigliata)
Un programma GameDay è una simulazione end-to-end in tempo reale di ciò che potrebbe accadere durante un incidente reale. AWS Incident Detection and Response segue i passaggi prescritti per darti un'idea di come potrebbe avvenire un incidente reale. GameDay È un'opportunità per porre domande o perfezionare le istruzioni per migliorare il coinvolgimento.
Per pianificare un GameDay, completa i seguenti passaggi:
-
Notifica AWS Incident Detection and Response indicando una data preferita e una finestra temporale di 1 ora, incluso il fuso orario. Fornisci almeno 48 ore di tempo di consegna.
-
Pianifica le risorse per il GameDay, inclusi il tuo SRE/Ops team e i contatti di escalation.
GameDay pianificazione:
-
Tu e AWS Incident Detection and Response vi unite alla chiamata.
-
Disabiliti le azioni di allarme, se applicabile.
-
È possibile impostare manualmente gli allarmi sullo stato ALARM utilizzando le istruzioni contenute inCome testare i tuoi allarmi.
-
AWS Incident Detection and Response conferma la ricezione della notifica di allarme.
-
AWS Incident Detection and Response risponde all'allarme e si unisce al bridge prescritto nel tuo runbook.
-
Tu e AWS Incident Detection and Response confermate il risultato. GameDay
Opzione 2: test degli allarmi offline
È possibile testare gli allarmi in modo indipendente in qualsiasi momento senza programmare una chiamata. L'attivazione di un allarme attiva AWS Incident Detection and Response in base al tuo runbook, proprio come farebbe durante un incidente reale.
Per eseguire test di allarme offline, completa i seguenti passaggi:
-
Per evitare azioni indesiderate, disabilita tutte le azioni di CloudWatch allarme di Amazon.
-
Attiva i tuoi allarmi utilizzando le istruzioni contenute in. Come testare i tuoi allarmi
-
Entro 5 minuti, viene creato un caso di supporto per tuo conto e AWS Incident Detection and Response ti coinvolge come specificato nel tuo runbook.
-
Informa l'Incident Manager che stai conducendo test di allarme offline.
-
L'Incident Manager conferma quali modifiche allo stato di allarme sono state ricevute e convalida le disposizioni di risposta.
Se non viene creato un caso di supporto entro 5 minuti, invia una richiesta di incidente per attivare manualmente AWS Incident Detection and Response per la risoluzione dei problemi.
Come testare i tuoi allarmi
Allarmi Amazon CloudWatch
Nota
L' AWS Identity and Access Management utente o il ruolo utilizzato per i test degli allarmi deve disporre cloudwatch:SetAlarmState dell'autorizzazione.
Usa AWS Command Line Interface o AWS CloudShell per impostare manualmente la sveglia sullo stato ALARM. Questi comandi modificano lo stato dell'allarme senza influire sul carico di lavoro.
Per evitare azioni indesiderate, ad esempio il riavvio dell'istanza Amazon EC2, disabilita qualsiasi azione di CloudWatch allarme prima di modificare lo stato di allarme. Puoi riattivare le azioni di CloudWatch allarme al termine del test. Per ulteriori informazioni su come disabilitare o abilitare le azioni di allarme, consulta DisableAlarmActions e EnableAlarmActions nell'Amazon CloudWatch API Reference.
Disattiva le azioni di allarme:
aws cloudwatch disable-alarm-actions --alarm-names "ExampleAlarm" --regionus-east-1
Imposta lo stato di allarme su ALARM:
aws cloudwatch set-alarm-state --alarm-name "ExampleAlarm" --state-value ALARM --state-reason "Testing AWS Incident Detection and Response" --regionus-east-1
Re-enable azioni di allarme dopo il test:
aws cloudwatch enable-alarm-actions --alarm-names "ExampleAlarm" --regionus-east-1
Lo stato di allarme torna automaticamente su OK entro pochi secondi.
Allarmi compositi
Il set-alarm-state comando non garantisce che gli allarmi compositi tornino allo stato OK. Come procedura consigliata, verificate lo stato degli allarmi compositi dopo il test. Per reimpostare manualmente un allarme composito, utilizzate il seguente comando:
aws cloudwatch set-alarm-state --alarm-name "ExampleCompositeAlarm" --state-value OK --state-reason "Testing AWS Incident Detection and Response" --regionus-east-1
Per ulteriori informazioni sulla modifica manuale dello stato degli CloudWatch allarmi, consulta SetAlarmState Amazon CloudWatch API Reference.
Per saperne di più sulle autorizzazioni richieste per le operazioni CloudWatch API, consulta Amazon CloudWatch permissions reference.
Third-party Allarmi APM
I carichi di lavoro che utilizzano uno strumento APM (Application Performance Monitoring) di terze parti, come Datadog, Splunk, New Relic o Dynatrace, richiedono istruzioni diverse per simulare un allarme.
-
Disabilita le azioni di allarme nel tuo APM per evitare azioni indesiderate.
-
Modificate la soglia di allarme o l'operatore di confronto per forzare l'allarme nello stato ALARM. Questo attiva un payload per AWS Incident Detection and Response.
-
Al termine del test, ripristina la soglia o le modifiche apportate dall'operatore di confronto per riportare l'allarme allo stato OK.
Principali risultati
Dopo aver superato con successo i test:
L'inserimento dell'allarme è confermato e la configurazione dell'allarme è corretta.
Gli allarmi vengono ricevuti da AWS Incident Detection and Response.
Viene creato un caso di supporto e i contatti prescritti vengono notificati.
AWS Incident Detection and Response ti coinvolge tramite i mezzi di conferenza prescritti.
Tutti gli allarmi e i casi di supporto generati durante i test vengono risolti.
Domande frequenti
- I test di allarme sono obbligatori?
-
No Il test è facoltativo ma è fortemente consigliato per convalidare le disposizioni di risposta end-to-end prima che si verifichi un incidente reale.
- Il mio carico di lavoro ne risentirà?
-
No Tuttavia, durante il test, vengono attivate tutte le azioni di allarme configurate sugli allarmi, a meno che non vengano disattivate. Disabilita le azioni di allarme prima del test per evitare impatti indesiderati.
- Chi viene avvisato durante i test?
-
Durante una pianificazione GameDay, tutti i contatti e i percorsi di escalation inclusi nel runbook vengono contattati per la verifica. Durante il test degli allarmi offline, viene notificato solo il contatto iniziale specificato durante l'attivazione degli allarmi.
- Posso rispondere via e-mail agli aggiornamenti dei casi?
-
No Le copie via e-mail delle corrispondenze relative ai Supporto casi vengono inviate da un indirizzo di mancata risposta. Per aggiornare un caso, usa il. AWS Support Center Console
- Come posso richiedere un GameDay after go-live?
-
Rispondi al tuo caso di assistenza per l'onboarding esistente, se esiste, o crea un. Richiedi modifiche a un carico di lavoro integrato in Incident Detection and Response