View a markdown version of this page

Sviluppa runbook e piani di risposta per rispondere a un incidente in Incident Detection and Response - Guida per l'utente AWS Incident Detection and Response

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Sviluppa runbook e piani di risposta per rispondere a un incidente in Incident Detection and Response

AWS Incident Detection and Response utilizza le informazioni acquisite durante l'onboarding del carico di lavoro per sviluppare runbook per la gestione degli incidenti che riguardano i carichi di lavoro. I runbook documentano le azioni intraprese dagli Incident Manager quando rispondono a un incidente. Un piano di risposta è associato ad almeno uno dei tuoi carichi di lavoro. Il team di gestione degli incidenti crea questi modelli a partire dalle informazioni fornite dall'utente durante l'onboarding del carico di lavoro.

Risultati chiave:

  • Completamento della definizione del carico di lavoro su AWS Incident Detection and Response.

  • Completamento degli allarmi e dei runbook su AWS Incident Detection and Response.

Puoi anche scaricare un esempio di AWS Incident Detection and Response Runbook: aws-idr-runbook-example.zip. samples/aws-idr-runbook-example.zip

Esempio Esempio di runbook
Description

Questo documento è destinato a [CustomerName] - [WorkloadName].

Fase: Priorità

Azioni prioritarie

  1. Invia la prima corrispondenza sul Supporto caso al cliente come indicato di seguito.

Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Fase 1: Informazioni

Piani di coinvolgimento

Questa sezione descrive i piani di coinvolgimento applicabili a questo runbook e contiene solo i dettagli di contatto. I piani di coinvolgimento saranno indicati nei piani di comunicazione dettagliati.

  • Impegno iniziale

    Il team di AWS Incident Detection and Response aggiunge al Supporto caso gli indirizzi delle parti interessate dei clienti di seguito. AWS le parti interessate sono altre parti interessate che potrebbero dover essere informate di eventuali problemi.

    • Stakeholder del cliente: customeremail1; customeremail2; mobile1

    • AWS Soggetti interessati: aws-idr-oncall@amazon.com; tam-team-email; ecc.

    • Contatti una tantum: [Si tratta di contatti e-mail inclusi solo nella prima comunicazione. Rimuovi questi contatti dopo che la prima comunicazione è terminata. Potrebbero essere indirizzi email dei clienti, ad esempio pager-duty, che non devono essere contattati per ogni corrispondenza. Aggiungi esplicitamente istruzioni nella sezione «Priorità», «Piani di comunicazione» su come utilizzarli solo se sono disponibili Contatti una tantum.]

  • Configurazione delle chiamate di emergenza

    Indica se il cliente richiede AWS Incident Detection and Response per creare un bridge, se utilizza un bridge statico o se fornirà un bridge quando viene aperto un incidente.

    (Scegli un'opzione in base alle preferenze del cliente)

    • AWS Incident Detection and Response crea un Amazon Chime/Zoom Bridge

    • Bridge statico fornito dal cliente

      • Numero di conferenza: < Insert Conference number >

    • Il cliente fornisce i dettagli relativi a ogni incidente rispondendo alle comunicazioni inviate dal team di rilevamento e risposta agli incidenti di AWS.

    • Altro: specifica i dettagli.

  • Incremento del coinvolgimento

    AWS Incident Detection and Response contatterà i seguenti contatti quando i contatti del piano di coinvolgimento iniziale non rispondono agli incidenti.

    Per ogni contatto Escalation, indica se deve essere aggiunto al Supporto caso, telefonato o entrambi.

    • Assicurati di aver chiamato il contatto di Initial Engagement, se applicabile, prima di inoltrare la richiesta.

    • Primo contatto di emergenza: [escalation EmailAddress #1]/[PhoneNumber] - Attendi XX minuti prima di passare a questo contatto.

      • [Aggiungi contatto a Case/Phone] questo contatto.

    • Secondo contatto di emergenza: [escalation EmailAddress #2]/[PhoneNumber] - Attendi XX minuti prima di passare a questo contatto.

      • [Aggiungi contatto al caso/telefono] questo contatto.

    • ecc.

Piani di comunicazione

Questa sezione descrive come i tecnici addetti alla gestione degli incidenti comunicano con le parti interessate designate al di fuori dei canali di chiamata e comunicazione degli incidenti.

  • Piano di comunicazione d'impatto

    Questo piano viene avviato quando AWS Incident Detection and Response ha stabilito, sin dalla fase di triage, che un avviso indica un potenziale impatto su un cliente.

    AWS Incident Detection and Response richiederà al cliente di unirsi al bridge predeterminato, come indicato in Engagement plans - Incident call setup.

    (Scegline uno a seconda che sia disponibile One Time Only Contacts o meno).

    1. Assicurati che gli stakeholder dei clienti presenti nei piani di coinvolgimento: il coinvolgimento iniziale venga aggiunto al CC del caso.

    O

    1. Assicurati che le parti interessate dei clienti e i contatti riservati una tantum previsti dai piani di coinvolgimento iniziale siano aggiunti al CC del caso.

    2. Invia la notifica di coinvolgimento al cliente in base al seguente modello:

      (Scegline uno)

      Modello Impact - Amazon Chime Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/

      Modello di impatto - Bridge fornito dal cliente

      The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.

      Modello di impatto - Customer Static Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>
    3. Imposta il caso come Azione del cliente in sospeso.

    4. RIMUOVI dal caso i contatti una tantum dopo aver inviato la precedente comunicazione di Impact. (Se è disponibile One Time Only Contacts).

    5. Segui il piano Engagement Escalation come indicato sopra.

    6. Se il cliente non risponde entro 30 minuti, disattivalo e continua a monitorare fino al ripristino dell'allarme.

  • Nessun piano di comunicazione d'impatto

    Questo piano viene avviato quando un allarme si ripristina prima che Incident Detection and Response abbia completato il triage iniziale.

    1. Prima di inviare la notifica di assenza di impatto, verifica e rimuovi i contatti and/or aggiunti con i clienti dal Supporto Case CC in base ai contatti elencati nei Piani di coinvolgimento - Piano di coinvolgimento iniziale.

      ["NON aggiungere contatti una tantum"] (Applicabile se è disponibile una sola volta i contatti).

    2. Invia una notifica di mancato coinvolgimento al cliente in base al modello seguente:

      Modello No Impact

      AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.
    3. Inoltra il caso nella sezione Pending Customer Action.

    4. Se il cliente non risponde entro 30 minuti, risolvi il caso.

Panoramica dell'architettura dell'applicazione

Questa sezione fornisce una panoramica dell' application/workload architettura per sensibilizzare gli Incident Management Engineer e gli Operations Engineer.

  • AWS Account e regioni con servizi chiave: elenco degli AWS account con le regioni che supportano questa applicazione. Assiste gli ingegneri nella valutazione dell'infrastruttura sottostante a supporto dell'applicazione.

    • 123456789012

      • US-EAST-1 - descrizione breve, se del caso

        • Amazon EC2: descrizione breve a seconda dei casi

        • DynamoDB: breve descrizione a seconda dei casi

        • ecc.

      • US-WEST-1 - descrizione breve a seconda dei casi

        • ecc.

    • un altro account

      • ecc.