Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Élaborez des runbooks et des plans de réponse pour répondre à un incident dans le cadre de la détection et de la réponse aux incidents
AWS Incident Detection and Response utilise les informations capturées lors de l'intégration de votre charge de travail pour développer des runbooks destinés à la gestion des incidents affectant vos charges de travail. Les Runbooks documentent les étapes suivies par les gestionnaires d'incidents lorsqu'ils répondent à un incident. Un plan de réponse est mappé à au moins l'une de vos charges de travail. L'équipe de gestion des incidents crée ces modèles à partir des informations que vous avez fournies lors de l'intégration À propos des charges de travail liées à la détection et à la réponse aux incidents de la charge de travail.
Principaux résultats :
-
Finalisation de la définition de votre charge de travail sur AWS Incident Detection and Response.
-
Achèvement des alarmes et des runbooks sur AWS Incident Detection and Response.
Vous pouvez également télécharger un exemple de livre d'exécution AWS Incident Detection and Response Runbook : aws-idr-runbook-example.zip.
Exemple Exemple de runbook
Description
Ce document est destiné à [CustomerName] - [WorkloadName].
Étape : Priorité
Actions prioritaires
-
Envoyez la première correspondance concernant l' Support affaire au client comme indiqué ci-dessous.
Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Étape 2 : Informations
Plans d'engagement
Cette section décrit les plans d'engagement applicables à ce runbook et ne contient que les coordonnées. Les plans d'engagement seront référencés dans les plans de communication étape par étape.
-
Engagement initial
L'équipe de détection et de réponse aux incidents AWS ajoute les adresses des parties prenantes des clients ci-dessous au Support dossier. AWS les parties prenantes sont destinées à d'autres parties prenantes qui pourraient avoir besoin d'être informées de tout problème.
Parties prenantes du client : customeremail1 ; customeremail2 ; mobile1
AWS Parties prenantes : aws-idr-oncall@amazon.com ; tam-team-email ; etc.
Contacts à usage unique : [Il s'agit de contacts de messagerie qui ne sont inclus que lors de la première communication. Supprimez ces contacts après l'envoi de la première communication. Il peut s'agir d'adresses e-mail de clients, telles que pager-duty, qui ne doivent pas être paginées pour chaque correspondance. Ajoutez explicitement des instructions dans la section « Priorité », « Plans de communication » sur la façon de les utiliser uniquement si One Time Only Contacts est disponible.]
-
Configuration des appels en cas d'incident
Indiquez si le client a besoin d'AWS Incident Detection and Response pour créer un pont, s'il utilise un pont statique ou s'il fournira un pont lorsqu'un incident est ouvert.
(Choisissez une option en fonction des préférences du client)
AWS Incident Detection and Response crée un Amazon Chime/Zoom Bridge
-
Pont statique fourni par le client
Numéro de conférence : < Insert Conference number >
Le client fournit des informations complémentaires pour chaque incident en répondant aux communications envoyées par l'équipe AWS de détection et de réponse aux incidents.
Autre - Spécifiez les détails.
-
Escalade de l'engagement
AWS Incident Detection and Response contactera les contacts suivants lorsque les contacts du plan d'engagement initial ne répondent pas aux incidents.
Pour chaque contact d'escalade, indiquez s'il doit être ajouté au Support dossier, téléphoner ou les deux.
Assurez-vous d'avoir appelé le contact d'engagement initial, le cas échéant, avant de passer à l'étape supérieure.
-
Premier contact d'escalade : [escalade EmailAddress #1]/[PhoneNumber] - Attendez XX minutes avant de passer à ce contact.
[Ajouter un contact à l'étui/au téléphone] ce contact.
-
Deuxième contact d'escalade : [escalade EmailAddress #2]/[PhoneNumber] - Attendez XX minutes avant de passer à ce contact.
[Ajouter un contact à l'étui/au téléphone] ce contact.
etc.
Plans de communication
Cette section décrit comment les ingénieurs en gestion des incidents communiquent avec les parties prenantes désignées en dehors des canaux d'appel et de communication en cas d'incident.
-
Plan de communication sur l'impact
Ce plan est lancé lorsqu'AWS Incident Detection and Response a déterminé, à l'issue de l'étape Triage, qu'une alerte indique un impact potentiel sur un client.
AWS Incident Detection and Response demandera au client de rejoindre le pont prédéterminé, comme indiqué dans Plans d'engagement - Configuration des appels en cas d'incident.
(Choisissez-en une selon que l'option Contacts à usage unique est disponible ou non.)
Assurez-vous que les parties prenantes des clients figurent dans les plans d'engagement - L'engagement initial est ajouté au dossier CC.
OU
Assurez-vous que les parties prenantes des clients et les contacts ponctuels des plans d'engagement - Engagement initial sont ajoutés au dossier CC.
Envoyez la notification d'engagement au client selon le modèle suivant :
(Choisissez-en un)
Modèle d'impact - Amazon Chime Bridge
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/Modèle d'impact - Pont fourni par le client
The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.Modèle d'impact - Customer Static Bridge
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>Réglez le dossier sur En attente d'une action du client.
SUPPRIMEZ les contacts à usage unique du dossier après avoir envoyé la communication d'impact ci-dessus. (Si l'option Contacts à usage unique est disponible.)
Suivez le plan d'escalade de l'engagement tel que mentionné ci-dessus.
Si le client ne répond pas dans les 30 minutes, désengagez et continuez à surveiller jusqu'à ce que l'alarme se rétablisse.
-
Plan de communication sans impact
Ce plan est lancé lorsqu'une alarme se rétablit avant que la détection et la réponse aux incidents n'aient terminé le triage initial.
-
Avant d'envoyer la notification sans impact, vérifiez, puis supprimez et and/or ajoutez des contacts clients du Support Case CC en fonction des contacts répertoriés dans les plans d'engagement - Plan d'engagement initial.
[« NE PAS ajouter de contacts à usage unique. »] (Applicable si l'option Contacts à usage unique est disponible.)
Envoyez une notification de non-engagement au client en vous basant sur le modèle ci-dessous :
Modèle sans impact
AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.Placez le dossier dans Pending Customer Action.
Si le client ne répond pas dans les 30 minutes, résolvez le problème.
-
Présentation de l'architecture des applications
Cette section fournit une vue d'ensemble de l' application/workload architecture destinée à sensibiliser les ingénieurs en gestion des incidents et les ingénieurs des opérations.
-
AWS Comptes et régions dotés de services clés - liste des AWS comptes des régions prenant en charge cette application. Aide les ingénieurs à évaluer l'infrastructure sous-jacente supportant l'application.
-
123456789012
-
US-EAST-1 - une brève description, le cas échéant
Amazon EC2 : brève description, le cas échéant
DynamoDB : brève description, le cas échéant
etc.
-
US-WEST-1 - une brève description, le cas échéant
etc.
-
-
un autre compte
etc.
-