View a markdown version of this page

Questionnaire d'intégration de la charge de travail dans la section Détection et réponse aux incidents (chemin d'exception) - Guide de l'utilisateur d'AWS Incident Detection and Response

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Questionnaire d'intégration de la charge de travail dans la section Détection et réponse aux incidents (chemin d'exception)

Note

Si vous ne pouvez pas utiliser l'IDR CLI pour intégrer votre charge de travail, utilisez le questionnaire suivant pour l'intégration de la charge de travail.

Cette rubrique fournit le questionnaire que vous devez remplir lors de l'intégration d'une charge de travail et de la configuration des alarmes à transmettre à AWS Incident Detection and Response. Le questionnaire d'intégration de la charge de travail contient des informations générales sur votre charge de travail, les détails de son architecture, les alarmes et les contacts pour la réponse aux incidents. Dans la section du questionnaire consacrée à l'ingestion des alarmes, vous spécifiez les alarmes critiques qui déclenchent la création d'incidents dans la section Détection et réponse aux incidents pour votre charge de travail, ainsi que des informations sur les personnes à contacter et les mesures à prendre. Le fait de remplir correctement ce questionnaire est une étape clé dans la mise en place de processus de surveillance et de réponse aux incidents pour vos AWS charges de travail.

Téléchargez le questionnaire d'intégration à la charge de travail :

Détails de la charge de travail - Questions générales

Questions générales
Question Exemple de réponse
Nom de l'entreprise

Amazon Inc.

Nom de cette charge de travail (inclure les abréviations éventuelles)

Opérations de vente au détail d'Amazon (ARO)

L'utilisateur final principal et la fonction de cette charge de travail.

Cette charge de travail est une application de commerce électronique qui permet aux utilisateurs finaux d'acheter divers articles. Cette charge de travail est la principale source de revenus de notre entreprise.

Détails de la charge de travail - Questions d'architecture

Questions relatives à l'architecture
Question Exemple de réponse

Liste des balises de AWS ressources utilisées pour définir les ressources qui font partie de cette charge de travail. AWS utilise ces balises pour identifier les ressources de cette charge de travail afin d'accélérer le support en cas d'incident.

Note

Les balises sont sensibles à la casse. Si vous fournissez plusieurs balises, toutes les ressources utilisées par cette charge de travail doivent avoir les mêmes balises.

Nom de l'application : Optimax

environnement : Production

Une liste des Service AWS personnes utilisées par cette charge de travail, des Compte AWS catégories et des Région AWS catégories dans lesquelles elles se trouvent.

Services AWS: Route 53, ALB, ECS,...

Comptes : 123456789101, 123456789102,...

Régions : US-EAST-1, US-WEST-2,...

Détails de la charge de travail - Questions concernant l'ingestion d'alarmes

Pour les questions relatives à l'ingestion d'alarmes, vous devez spécifier les alarmes critiques pour votre charge de travail que vous souhaitez faire intervenir auprès d'AWS Incident Detection and Response, ainsi que les contacts que vous souhaitez qu'un ingénieur en gestion des incidents déclenche lorsque ces alarmes se déclenchent.

La section d'ingestion des alarmes est divisée comme suit :

  • Section Contact : Tout d'abord, spécifiez le ou les contacts principaux à inclure dans le Support dossier créé avec AWS Incident Detection and Response lorsqu'une alarme se déclenche, ainsi que votre application de conférence préférée pour les passerelles d'incidents. Si aucune préférence de passerelle n'est spécifiée, AWS Incident Detection and Response créera une passerelle lors d'incidents. Spécifiez ensuite les contacts d'escalade et les intervalles de temps pour les engager lorsque les contacts principaux sont injoignables. Enfin, dressez la liste de tous les contacts qui devraient recevoir des mises à jour régulières sur l'état des incidents via le dossier d'assistance pendant la durée de l'incident.

  • Matrice d'alarmes : répertoriez l'ensemble d'alarmes qui activeront AWS Incident Detection and Response lorsqu'elles sont déclenchées. Consultez les « critères d'alarme critiques » définis par AWS Incident Detection and Response lors de la sélection des alarmes pour l'intégration. Pour de plus amples informations, veuillez consulter Définition de l'alarme.

Contacts relatifs à l'engagement et à l'escalade de la charge de travail - Runbook questions

Questions relatives au Runbook
Question Exemple de réponse

AWS engage les interlocuteurs chargés de la charge de travail tout au long du Support dossier. Qui est le contact principal lorsqu'une alarme se déclenche pour cette charge de travail ?

Spécifiez votre application de conférence préférée et AWS nous vous demanderons ces informations lors d'un incident.

Note

Si aucune application de conférence préférée n'est fournie, AWS nous vous contacterons lors d'un incident et vous fournirons un pont Chime auquel vous pourrez vous connecter.

Équipe chargée de la candidature

app@example.com

+61 2 3456 7890

Si le contact principal n'est pas disponible lors d'un incident, veuillez indiquer les contacts d'escalade et le calendrier dans l'ordre de communication préféré.

1. Au bout de 10 minutes, en l'absence de réponse de la part du contact principal, engagez :

John Smith - Superviseur des applications

john.smith@example.com

+61 2 3456 7890

2. Au bout de 10 minutes, en l'absence de réponse de John Smith, contactez :

Jane Smith - Directrice des opérations

jane.smith@example.com

+61 2 3456 7890

Matrice d'alarme

Fournissez les informations suivantes pour identifier l'ensemble d'alarmes qui activera AWS Incident Detection and Response afin de créer des incidents pour votre charge de travail. Une fois que les ingénieurs d'AWS Incident Detection and Response auront examiné vos alarmes, des étapes d'intégration supplémentaires seront proposées.

Critères d'alerte critiques liés à la détection et à la réponse aux incidents AWS  :

  • Les alarmes AWS Incident Detection and Response ne doivent passer à l'état « Alarme » qu'en cas d'impact significatif sur la charge de travail surveillée (perte d'expérience revenue/degraded client) nécessitant l'attention immédiate de l'opérateur.

  • Les alarmes AWS Incident Detection and Response doivent également impliquer vos résolveurs pour la charge de travail en même temps ou avant l'engagement. AWS Les responsables des incidents collaborent avec vos résolveurs dans le cadre du processus d'atténuation, et ne sont pas des intervenants de première ligne qui s'adressent ensuite à vous.

  • Les seuils d'alarme AWS Incident Detection and Response doivent être définis sur un seuil et une durée appropriés afin que chaque fois qu'une alarme se déclenche, une enquête soit menée. Si une alarme passe de l'état « Alarme » à l'état « OK », l'impact est suffisant pour justifier la réponse et l'attention de l'opérateur.

Politique de détection et de réponse aux incidents AWS en cas de violation des critères  :

Ces critères ne peuvent être évalués qu'au cas par cas au fur et à mesure que les événements se produisent. L'équipe de gestion des incidents travaille avec vos responsables techniques de comptes (TAM) pour régler les alarmes et, dans de rares cas, désactiver la surveillance si l'on soupçonne que les alarmes des clients ne répondent pas à ces critères et fait appel inutilement à l'équipe de gestion des incidents à un rythme régulier.

Important

Indiquez une adresse e-mail de distribution de groupe lorsque vous fournissez des adresses de contact, afin de pouvoir contrôler les ajouts et les suppressions de destinataires sans mettre à jour le runbook.

Indiquez le numéro de téléphone de contact de l'équipe d'ingénierie de fiabilité de votre site (SRE) si vous souhaitez que l'équipe AWS Incident Detection and Response les appelle après avoir envoyé un e-mail d'engagement initial.

Tableau matriciel d'alarme pour les CloudWatch alarmes

CloudWatch alarme ARN

Contact principal pour cette alarme.

(Si différent du contact principal de la charge de travail)

Spécifiez la plus pertinente Service AWS pour cette alarme afin d'engager le bon ingénieur. Entrez N/A si ce n'est pas nécessaire.

Exemple :

arn:aws:cloudwatch:us-east-1:123456789012:alarm:ALB_5xx_Target_Response

Exemple :

Sam Smith - Gestionnaire des applications

sam.smith@example.com

+61 2 3456 7890

Exemple :

ECS

Tableau matriciel d'alarme pour les alarmes APM tierces

EventBridge Event Bus ARN

(Ceci est créé dans le cadre de l'intégration APM tierce pour acheminer les alertes vers AWS Incident Detection and Response.)

Exemple : (Il y aura un bus événementiel par Account/Region combinaison)

arn:aws:events:us-east-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

arn:aws:events:us-west-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

Identifiant d'alarme

Que représente cette métrique ?

Pourquoi cette alarme est-elle importante ?

Contact principal pour cette alarme.

(Si différent du contact principal de la charge de travail)

Spécifiez la plus pertinente Service AWS pour cette alarme afin d'engager le bon ingénieur. Entrez N/A si ce n'est pas nécessaire.

Exemple :

ALB_5xx_ Target_Response

ID du compte : 123456789012

Région : us-east-1

Exemple :

Cette métrique représente les réponses aux transactions des cibles à l'origine de l'ALB. Si le nombre d'erreurs 5XX dépasse le seuil, cela représente un échec critique dans le traitement des transactions commerciales.

Exemple :

Sam Smith - Gestionnaire des applications

sam.smith@example.com

+61 2 3456 7890

Exemple :

ECS