View a markdown version of this page

Questionario di onboarding del carico di lavoro in Incident Detection and Response (percorso delle eccezioni) - Guida per l'utente AWS Incident Detection and Response

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Questionario di onboarding del carico di lavoro in Incident Detection and Response (percorso delle eccezioni)

Nota

Se non riesci a utilizzare l'interfaccia a riga di comando IDR per l'onboarding del carico di lavoro, utilizza il seguente questionario per l'onboarding del carico di lavoro.

Questo argomento fornisce il questionario da compilare per l'onboarding di un carico di lavoro e la configurazione degli allarmi da inserire in AWS Incident Detection and Response. Il questionario sull'onboarding del carico di lavoro contiene informazioni generali sul carico di lavoro, i dettagli della sua architettura, gli allarmi e i contatti per la risposta agli incidenti. Nella sezione relativa all'inserimento degli allarmi del questionario, specifichi gli allarmi critici che innescano la creazione di incidenti in Incident Detection and Response per il tuo carico di lavoro, oltre alle informazioni del runbook su chi contattare e quali azioni intraprendere. La corretta compilazione di questo questionario è un passaggio fondamentale nell'impostazione dei processi di monitoraggio e risposta agli incidenti per i carichi di lavoro. AWS

Scarica il questionario di onboarding di Workload:

Dettagli del carico di lavoro - Domande generali

Domande generali
Domanda Risposta di esempio
Nome dell'azienda

Amazon Inc.

Nome di questo carico di lavoro (includi eventuali abbreviazioni)

Amazon Retail Operations (ARO)

Utente finale principale e funzione di questo carico di lavoro.

Questo carico di lavoro è un'applicazione di e-commerce che consente agli utenti finali di acquistare vari articoli. Questo carico di lavoro è il principale generatore di entrate per la nostra attività.

Dettagli del carico di lavoro - Domande sull'architettura

Domande sull'architettura
Domanda Risposta di esempio

Un elenco di tag di AWS risorse utilizzati per definire le risorse che fanno parte di questo carico di lavoro. AWS utilizza questi tag per identificare le risorse di questo carico di lavoro e velocizzare il supporto in caso di incidenti.

Nota

I tag rispettano la distinzione tra maiuscole e minuscole. Se fornisci più tag, tutte le risorse utilizzate da questo carico di lavoro devono avere gli stessi tag.

Nome app: Optimax

ambiente: Produzione

Un elenco degli Servizio AWS utenti utilizzati da questo carico di lavoro, con le Account AWS informazioni Regione AWS in cui si trovano.

Servizi AWS: Route 53, ALB, ECS,...

Account: 123456789101, 123456789102,...

US-EAST-1Regioni: US-WEST-2,,...

Dettagli del carico di lavoro - Domande relative all'inserimento di allarmi

Per le domande relative all'inserimento di allarmi, specifica gli allarmi critici per il tuo carico di lavoro che desideri coinvolgere AWS Incident Detection and Response, nonché i contatti che desideri che un Incident Management Engineer coinvolga quando questi allarmi si attivano.

La sezione relativa all'inserimento degli allarmi è suddivisa nelle seguenti sezioni:

  • Sezione Contatti: per prima cosa, specifica i contatti principali da includere nel Supporto caso creato con AWS Incident Detection and Response quando scatta un allarme, nonché l'applicazione di conferenza preferita per gli incident bridge. Se non viene fornita alcuna preferenza per il bridge, AWS Incident Detection and Response creerà un incident bridge durante gli incidenti. Successivamente, specifica i contatti di escalation e gli intervalli di tempo per coinvolgerli quando i contatti principali non sono raggiungibili. Infine, elenca tutti i contatti che dovrebbero ricevere aggiornamenti regolari sullo stato degli incidenti tramite la richiesta di assistenza per la durata dell'incidente.

  • Matrice di allarme: elenca il set di allarmi che attiveranno AWS Incident Detection and Response quando vengono attivati. Consulta i «Criteri critici di allarme» definiti da AWS Incident Detection and Response quando selezioni gli allarmi per l'onboarding. Per ulteriori informazioni, consulta Definizione di allarme.

Contatti per il coinvolgimento e l'escalation del carico di lavoro - Domande preliminari

Domande su Runbook
Domanda Risposta di esempio

AWS coinvolge i contatti del carico di lavoro attraverso il Supporto caso. Chi è il contatto principale quando scatta un allarme per questo carico di lavoro?

Specifica la tua applicazione di conferenza preferita e AWS richiederai questi dettagli durante un incidente.

Nota

Se non viene fornita un'applicazione di conferenza preferita, ti AWS contatteremo durante un incidente e ti fornirà un Chime bridge a cui partecipare.

Team di candidatura

app@example.com

+61 2 3456 7890

Se il contatto principale non è disponibile durante un incidente, fornisci i contatti di emergenza e la tempistica nell'ordine di comunicazione preferito.

1. Dopo 10 minuti, in assenza di risposta da parte del Contatto principale, interagisci con:

John Smith - Supervisore delle applicazioni

john.smith@example.com

+61 2 3456 7890

2. Dopo 10 minuti, in caso di mancata risposta da parte di John Smith, contattare:

Jane Smith - Responsabile delle operazioni

jane.smith@example.com

+61 2 3456 7890

Matrice di allarme

Fornisci le seguenti informazioni per identificare il set di allarmi che attiveranno AWS Incident Detection and Response per creare incidenti per conto del tuo carico di lavoro. Una volta che i tecnici di AWS Incident Detection and Response avranno esaminato i tuoi allarmi, verranno eseguite ulteriori fasi di onboarding.

Criteri di allarme critici per il rilevamento e la risposta agli incidenti di AWS:

  • Gli allarmi di AWS Incident Detection and Response devono entrare nello stato «Allarme» solo in caso di impatto aziendale significativo sul carico di lavoro monitorato (perdita dell'esperienza del revenue/degraded cliente) che richiede l'attenzione immediata dell'operatore.

  • Gli allarmi di AWS Incident Detection and Response devono inoltre coinvolgere i resolver per il carico di lavoro contemporaneamente o prima dell'intervento. AWS Gli Incident Manager collaborano con i tuoi resolver nel processo di mitigazione e non fungono da soccorritori di prima linea che poi passano a te.

  • Le soglie di allarme di AWS Incident Detection and Response devono essere impostate su una soglia e una durata appropriate, in modo che ogni volta che si attiva un allarme sia avviata un'indagine. Se un allarme passa dallo stato «Allarme» a quello «OK», si verifica un impatto sufficiente da richiedere la risposta e l'attenzione dell'operatore.

Politica di rilevamento e risposta agli incidenti di AWS per le violazioni dei criteri:

Questi criteri possono essere valutati solo caso per caso quando si verificano gli eventi. Il team di Incident Management collabora con i responsabili tecnici degli account (TAM) per modificare gli allarmi e, in rari casi, disabilitare il monitoraggio se si sospetta che gli allarmi dei clienti non rispettino questi criteri e coinvolge inutilmente il team di gestione degli incidenti a intervalli regolari.

Importante

Fornisci un indirizzo email di distribuzione di gruppo quando fornisci gli indirizzi di contatto, in modo da poter controllare le aggiunte e le eliminazioni dei destinatari senza dover aggiornare il runbook.

Fornisci il numero di telefono di riferimento del tuo team di ingegneria dell'affidabilità del sito (SRE) se desideri che il team di AWS Incident Detection and Response lo chiami dopo aver inviato un'email di coinvolgimento iniziale.

Tabella delle matrici di allarme per gli CloudWatch allarmi

CloudWatch allarme ARN

Contatto principale per questo allarme.

(Se diverso dal contatto principale del carico di lavoro)

Specifica la più pertinente Servizio AWS per questo allarme per coinvolgere il tecnico giusto. Inserisci N/A se non è necessario.

Esempio:

arn:aws:cloudwatch:us-east-1:123456789012:alarm:ALB_5xx_Target_Response

Esempio:

Sam Smith - Gestore delle applicazioni

sam.smith@example.com

+61 2 3456 7890

Esempio:

ECS

Tabella a matrice di allarme per allarmi APM di terze parti

EventBridge Event Bus ARN

(Viene creato come parte dell'integrazione APM di terze parti per indirizzare gli avvisi ad AWS Incident Detection and Response).

Esempio: (ci sarà un bus di eventi per Account/Region combinazione)

arn:aws:events:us-east-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

arn:aws:events:us-west-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

Identificatore di allarme

Cosa rappresenta questa metrica?

Perché questo allarme è importante?

Contatto principale per questo allarme.

(Se diverso dal contatto principale del carico di lavoro)

Specifica la più pertinente Servizio AWS per questo allarme per coinvolgere il tecnico giusto. Inserisci N/A se non è necessario.

Esempio:

Alb_5xx_ Target_Response

ID account: 123456789012

Regione: us-east-1

Esempio:

Questa metrica rappresenta le risposte alle transazioni provenienti dagli obiettivi alla base dell'ALB. Se gli errori 5XX superano la soglia, si tratta di un grave fallimento nell'elaborazione delle transazioni commerciali.

Esempio:

Sam Smith - Gestore delle applicazioni

sam.smith@example.com

+61 2 3456 7890

Esempio:

ECS