Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Entwickeln Sie unter Incident Detection and Response Runbooks und Reaktionspläne für die Reaktion auf einen Vorfall
AWS Incident Detection and Response verwendet Informationen, die beim Onboarding Ihrer Workloads erfasst wurden, um Runbooks für das Management von Vorfällen zu entwickeln, die sich auf Ihre Workloads auswirken. Runbooks dokumentieren die Schritte, die Incident Manager ergreifen, um auf einen Vorfall zu reagieren. Ein Reaktionsplan ist mindestens einem Ihrer Workloads zugeordnet. Das Incident-Management-Team erstellt diese Vorlagen anhand der Informationen, die Sie beim Workload-Onboarding bereitgestellt haben.
Wichtigste Ergebnisse:
-
Fertigstellung Ihrer Workload-Definition für AWS Incident Detection and Response.
-
Fertigstellung von Alarmen und Runbooks zu AWS Incident Detection and Response.
Sie können auch ein Beispiel für ein AWS Incident Detection and Response Runbook herunterladen: aws-idr-runbook-example.zip.
Beispiel Beispiel für ein Runbook
Description
Dieses Dokument ist für [CustomerName] - [WorkloadName] bestimmt.
Schritt: Priorität
Vorrangige Maßnahmen
-
Senden Sie die erste Korrespondenz zu dem Support Fall wie folgt an den Kunden.
Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Schritt: Informationen
Pläne zur Verlobung
Dieser Abschnitt beschreibt die für dieses Runbook geltenden Engagementpläne und enthält nur Kontaktdaten. Auf die Engagementpläne wird in den schrittweisen Kommunikationsplänen verwiesen.
-
Erstes Engagement
Das AWS Incident Detection and Response Team fügt dem Support Fall die unten aufgeführten Adressen der Kundenvertreter hinzu. AWS Stakeholder sind für zusätzliche Stakeholder da, die möglicherweise auf Probleme aufmerksam gemacht werden müssen.
Interessengruppen des Kunden: Kunden-E-Mail1; Kunden-E-Mail2; Handy1
AWS Beteiligte: aws-idr-oncall@amazon.com; tam-team-email; usw.
Kontakte nur einmal: [Dies sind E-Mail-Kontakte, die nur in der ersten Kommunikation enthalten sind. Entfernen Sie diese Kontakte, nachdem die erste Kommunikation beendet wurde. Dies können Kunden-Paging-E-Mail-Adressen sein, wie z. B. Pager-Duty, die nicht bei jeder Korrespondenz durchsucht werden dürfen. Fügen Sie im Abschnitt „Priorität“ unter „Kommunikationspläne“ ausdrücklich Anweisungen hinzu, wie Sie diese nur verwenden können, wenn Einmalkontakte verfügbar sind.]
-
Einrichtung eines Vorfallanrufs
Geben Sie an, ob der Kunde AWS Incident Detection and Response benötigt, um eine Brücke zu erstellen, ob der Kunde eine statische Brücke verwendet oder ob der Kunde eine Brücke bereitstellt, wenn ein Vorfall eröffnet wird.
(Wählen Sie je nach Kundenpräferenz eine Option aus)
Mit AWS Incident Detection and Response wird eine Amazon Chime/Zoom Bridge erstellt
-
Vom Kunden bereitgestellte statische Bridge
Nummer der Konferenz: < Insert Conference number >
Der Kunde stellt Brückendetails für jeden Vorfall zur Verfügung, indem er auf die vom AWS Incident Detection and Response Team gesendete Mitteilung reagiert.
Andere — Geben Sie die Details an.
-
Eskalation des Engagements
AWS Incident Detection and Response setzt sich mit den folgenden Kontakten in Verbindung, wenn die Kontakte aus dem ursprünglichen Einsatzplan nicht auf Vorfälle reagieren.
Geben Sie für jeden Eskalationskontakt an, ob er dem Support Fall hinzugefügt, telefonisch oder beides hinzugefügt werden muss.
Vergewissern Sie sich, dass Sie gegebenenfalls den Erstkontakt angerufen haben, bevor Sie eine Eskalation vornehmen.
-
Erster Eskalationskontakt: [Eskalation EmailAddress #1]/[PhoneNumber] — Warten Sie XX Minuten, bevor Sie zu diesem Kontakt eskalieren.
[Kontakt zu Fall hinzufügen/Telefon] dieser Kontakt.
-
Zweiter Eskalationskontakt: [Eskalation EmailAddress #2]/[PhoneNumber] — Warten Sie XX Minuten, bevor Sie zu diesem Kontakt eskalieren.
[Kontakt zu Fall hinzufügen/Telefon] dieser Kontakt.
usw.
Pläne für die Kommunikation
In diesem Abschnitt wird beschrieben, wie Incident Management Engineers mit bestimmten Stakeholdern außerhalb des Anrufs und der Kommunikationskanäle kommunizieren.
-
Impact: Kommunikationsplan
Dieser Plan wird initiiert, wenn AWS Incident Detection and Response im Schritt Triage festgestellt hat, dass eine Warnung auf potenzielle Auswirkungen auf einen Kunden hinweist.
AWS Incident Detection and Response fordert den Kunden auf, sich der zuvor festgelegten Brücke anzuschließen, wie in den Engagement-Plänen — Einrichtung von Incident-Calls angegeben.
(Wählen Sie eine aus, je nachdem, ob One Time Only Contacts verfügbar sind oder nicht.)
Stellen Sie sicher, dass die Interessenvertreter des Kunden aus den Engagement-Plänen — Erste Interaktionen zum Fall-CC hinzugefügt werden.
ODER
Stellen Sie sicher, dass die Interessenvertreter des Kunden und die einmaligen Ansprechpartner aus den Plänen für Kundenanfragen — Erstkontakt zum Fall-CC hinzugefügt werden.
Senden Sie die Kontaktbenachrichtigung auf der Grundlage der folgenden Vorlage an den Kunden:
(Wählen Sie eine aus)
Impact-Vorlage — Amazon Chime Bridge
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/Vorlage für Auswirkungen — Vom Kunden bereitgestellte Bridge
The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.Vorlage für Auswirkungen — Statische Brücke vom Kunden
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>Setzen Sie den Fall auf Ausstehende Kundenaktion.
ENTFERNEN Sie Kontakte, die nur einmal verfügbar sind, aus dem Fall, nachdem Sie die oben genannte Impact-Mitteilung gesendet haben. (Wenn die Option „Einmalige Kontakte“ verfügbar ist.)
Folgen Sie dem oben genannten Plan zur Engagement-Eskalation.
Wenn der Kunde nicht innerhalb von 30 Minuten reagiert, schalten Sie das Gerät aus und setzen Sie die Überwachung fort, bis sich der Alarm wieder einstellt.
-
Kommunikationsplan ohne Auswirkungen
Dieser Plan wird initiiert, wenn sich ein Alarm wieder einstellt, bevor die erste Triage von Incident Detection and Response abgeschlossen ist.
-
Bevor Sie die Benachrichtigung versenden, ohne dass dies Auswirkungen hat, überprüfen Sie die Kundenkontakte and/or und entfernen Sie sie dann aus dem Support Kundenvorgangsbereich. Grundlage dafür sind die Kontakte, die im Plan „Engagement — Erste Interaktion“ aufgeführt sind.
["KEINE Kontakte hinzufügen, die nur einmal verfügbar sind."] (Gilt, wenn Kontakte nur einmal verfügbar sind.)
Senden Sie dem Kunden auf der Grundlage der folgenden Vorlage eine Benachrichtigung, dass kein Kontakt aufgenommen wurde:
Vorlage „Keine Auswirkung“
AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.Fügen Sie den Fall unter Ausstehende Kundenaktion ein.
Wenn der Kunde nicht innerhalb von 30 Minuten reagiert, lösen Sie den Fall.
-
Überblick über die Anwendungsarchitektur
Dieser Abschnitt bietet einen Überblick über die application/workload Architektur zur Sensibilisierung von Incident Management Engineer und Operations Engineer.
-
AWS Konten und Regionen mit wichtigen Diensten — Liste der AWS Konten mit Regionen, die diese Anwendung unterstützen. Unterstützt Techniker bei der Bewertung der zugrunde liegenden Infrastruktur, die die Anwendung unterstützt.
-
123456789012
-
US-EAST-1 — gegebenenfalls kurze Beschreibung
Amazon EC2 — gegebenenfalls kurze Beschreibung
DynamoDB — gegebenenfalls kurze Beschreibung
usw.
-
US-WEST-1 - gegebenenfalls kurze Beschreibung
usw.
-
-
ein anderes Konto
usw.
-