Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Questionnaire d'intégration de la charge de travail dans la section Détection et réponse aux incidents (chemin d'exception)
Note
Si vous ne pouvez pas utiliser l'IDR CLI pour intégrer votre charge de travail, utilisez le questionnaire suivant pour l'intégration de la charge de travail.
Cette rubrique fournit le questionnaire que vous devez remplir lors de l'intégration d'une charge de travail et de la configuration des alarmes à transmettre à AWS Incident Detection and Response. Le questionnaire d'intégration de la charge de travail contient des informations générales sur votre charge de travail, les détails de son architecture, les alarmes et les contacts pour la réponse aux incidents. Dans la section du questionnaire consacrée à l'ingestion des alarmes, vous spécifiez les alarmes critiques qui déclenchent la création d'incidents dans la section Détection et réponse aux incidents pour votre charge de travail, ainsi que des informations sur les personnes à contacter et les mesures à prendre. Le fait de remplir correctement ce questionnaire est une étape clé dans la mise en place de processus de surveillance et de réponse aux incidents pour vos AWS charges de travail.
Téléchargez le questionnaire d'intégration à la charge de travail :
Détails de la charge de travail - Questions générales
| Question | Exemple de réponse |
|---|---|
| Nom de l'entreprise | Amazon Inc. |
| Nom de cette charge de travail (inclure les abréviations éventuelles) | Opérations de vente au détail d'Amazon (ARO) |
| L'utilisateur final principal et la fonction de cette charge de travail. | Cette charge de travail est une application de commerce électronique qui permet aux utilisateurs finaux d'acheter divers articles. Cette charge de travail est la principale source de revenus de notre entreprise. |
Détails de la charge de travail - Questions d'architecture
| Question | Exemple de réponse |
|---|---|
Liste des balises de AWS ressources utilisées pour définir les ressources qui font partie de cette charge de travail. AWS utilise ces balises pour identifier les ressources de cette charge de travail afin d'accélérer le support en cas d'incident. NoteLes balises sont sensibles à la casse. Si vous fournissez plusieurs balises, toutes les ressources utilisées par cette charge de travail doivent avoir les mêmes balises. |
Nom de l'application : Optimax environnement : Production |
Une liste des Service AWS personnes utilisées par cette charge de travail, des Compte AWS catégories et des Région AWS catégories dans lesquelles elles se trouvent. |
Services AWS: Route 53, ALB, ECS,... Comptes : 123456789101, 123456789102,... Régions : US-EAST-1, US-WEST-2,... |
Détails de la charge de travail - Questions concernant l'ingestion d'alarmes
Pour les questions relatives à l'ingestion d'alarmes, vous devez spécifier les alarmes critiques pour votre charge de travail que vous souhaitez faire intervenir auprès d'AWS Incident Detection and Response, ainsi que les contacts que vous souhaitez qu'un ingénieur en gestion des incidents déclenche lorsque ces alarmes se déclenchent.
La section d'ingestion des alarmes est divisée comme suit :
Section Contact : Tout d'abord, spécifiez le ou les contacts principaux à inclure dans le Support dossier créé avec AWS Incident Detection and Response lorsqu'une alarme se déclenche, ainsi que votre application de conférence préférée pour les passerelles d'incidents. Si aucune préférence de passerelle n'est spécifiée, AWS Incident Detection and Response créera une passerelle lors d'incidents. Spécifiez ensuite les contacts d'escalade et les intervalles de temps pour les engager lorsque les contacts principaux sont injoignables. Enfin, dressez la liste de tous les contacts qui devraient recevoir des mises à jour régulières sur l'état des incidents via le dossier d'assistance pendant la durée de l'incident.
Matrice d'alarmes : répertoriez l'ensemble d'alarmes qui activeront AWS Incident Detection and Response lorsqu'elles sont déclenchées. Consultez les « critères d'alarme critiques » définis par AWS Incident Detection and Response lors de la sélection des alarmes pour l'intégration. Pour de plus amples informations, veuillez consulter Définition de l'alarme.
Amazon CloudWatch Alarms (laissez cette section vide si vous n'avez pas d' CloudWatch alarmes Amazon)
Alarmes APM tierces (laissez cette section vide si vous n'avez pas d'alarmes APM tierces)
EventBridge EventBus ARN : il s'agit de l'ARN de l' EventBus ARN personnalisé que vous avez créé dans Alarmes d'ingestion provenant des APM avec intégration directe EventBridge ouIngestion d'alarmes depuis les APM sans intégration directe avec EventBridge.
Identifiants d'alarme : partagez le numéro de compte, la région et le nom de l'alarme APM.
Contacts relatifs à l'engagement et à l'escalade de la charge de travail - Runbook questions
| Question | Exemple de réponse |
|---|---|
AWS engage les interlocuteurs chargés de la charge de travail tout au long du Support dossier. Qui est le contact principal lorsqu'une alarme se déclenche pour cette charge de travail ? Spécifiez votre application de conférence préférée et AWS nous vous demanderons ces informations lors d'un incident. NoteSi aucune application de conférence préférée n'est fournie, AWS nous vous contacterons lors d'un incident et vous fournirons un pont Chime auquel vous pourrez vous connecter. |
Équipe chargée de la candidature app@example.com +61 2 3456 7890 |
Si le contact principal n'est pas disponible lors d'un incident, veuillez indiquer les contacts d'escalade et le calendrier dans l'ordre de communication préféré. |
1. Au bout de 10 minutes, en l'absence de réponse de la part du contact principal, engagez : John Smith - Superviseur des applications john.smith@example.com +61 2 3456 7890 2. Au bout de 10 minutes, en l'absence de réponse de John Smith, contactez : Jane Smith - Directrice des opérations jane.smith@example.com +61 2 3456 7890 |
Matrice d'alarme
Fournissez les informations suivantes pour identifier l'ensemble d'alarmes qui activera AWS Incident Detection and Response afin de créer des incidents pour votre charge de travail. Une fois que les ingénieurs d'AWS Incident Detection and Response auront examiné vos alarmes, des étapes d'intégration supplémentaires seront proposées.
Critères d'alerte critiques liés à la détection et à la réponse aux incidents AWS :
Les alarmes AWS Incident Detection and Response ne doivent passer à l'état « Alarme » qu'en cas d'impact significatif sur la charge de travail surveillée (perte d'expérience revenue/degraded client) nécessitant l'attention immédiate de l'opérateur.
Les alarmes AWS Incident Detection and Response doivent également impliquer vos résolveurs pour la charge de travail en même temps ou avant l'engagement. AWS Les responsables des incidents collaborent avec vos résolveurs dans le cadre du processus d'atténuation, et ne sont pas des intervenants de première ligne qui s'adressent ensuite à vous.
Les seuils d'alarme AWS Incident Detection and Response doivent être définis sur un seuil et une durée appropriés afin que chaque fois qu'une alarme se déclenche, une enquête soit menée. Si une alarme passe de l'état « Alarme » à l'état « OK », l'impact est suffisant pour justifier la réponse et l'attention de l'opérateur.
Politique de détection et de réponse aux incidents AWS en cas de violation des critères :
Ces critères ne peuvent être évalués qu'au cas par cas au fur et à mesure que les événements se produisent. L'équipe de gestion des incidents travaille avec vos responsables techniques de comptes (TAM) pour régler les alarmes et, dans de rares cas, désactiver la surveillance si l'on soupçonne que les alarmes des clients ne répondent pas à ces critères et fait appel inutilement à l'équipe de gestion des incidents à un rythme régulier.
Important
Indiquez une adresse e-mail de distribution de groupe lorsque vous fournissez des adresses de contact, afin de pouvoir contrôler les ajouts et les suppressions de destinataires sans mettre à jour le runbook.
Indiquez le numéro de téléphone de contact de l'équipe d'ingénierie de fiabilité de votre site (SRE) si vous souhaitez que l'équipe AWS Incident Detection and Response les appelle après avoir envoyé un e-mail d'engagement initial.
CloudWatch alarme ARN |
Contact principal pour cette alarme. (Si différent du contact principal de la charge de travail) |
Spécifiez la plus pertinente Service AWS pour cette alarme afin d'engager le bon ingénieur. Entrez N/A si ce n'est pas nécessaire. |
Exemple :
|
Exemple : Sam Smith - Gestionnaire des applications sam.smith@example.com +61 2 3456 7890 |
Exemple : ECS |
EventBridge Event Bus ARN (Ceci est créé dans le cadre de l'intégration APM tierce pour acheminer les alertes vers AWS Incident Detection and Response.) |
Exemple : (Il y aura un bus événementiel par Account/Region combinaison)
|
||
Identifiant d'alarme |
Que représente cette métrique ? Pourquoi cette alarme est-elle importante ? |
Contact principal pour cette alarme. (Si différent du contact principal de la charge de travail) |
Spécifiez la plus pertinente Service AWS pour cette alarme afin d'engager le bon ingénieur. Entrez N/A si ce n'est pas nécessaire. |
Exemple : ALB_5xx_ Target_Response ID du compte : 123456789012 Région : us-east-1 |
Exemple : Cette métrique représente les réponses aux transactions des cibles à l'origine de l'ALB. Si le nombre d'erreurs 5XX dépasse le seuil, cela représente un échec critique dans le traitement des transactions commerciales. |
Exemple : Sam Smith - Gestionnaire des applications sam.smith@example.com +61 2 3456 7890 |
Exemple : ECS |