View a markdown version of this page

Fragebogen zum Onboarding von Workloads in Incident Detection and Response (Ausnahmepfad) - AWS-Benutzerhandbuch zur Erkennung und Reaktion von Vorfällen

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Fragebogen zum Onboarding von Workloads in Incident Detection and Response (Ausnahmepfad)

Anmerkung

Wenn Sie die IDR-CLI nicht für das Onboarding Ihres Workloads verwenden können, verwenden Sie den folgenden Fragebogen für das Workload-Onboarding.

In diesem Thema finden Sie den Fragebogen, den Sie beim Onboarding eines Workloads und beim Konfigurieren von Alarmen für die Aufnahme in AWS Incident Detection and Response ausfüllen müssen. Der Fragebogen zum Workload-Onboarding enthält allgemeine Informationen zu Ihrem Workload, Details zur Architektur, Alarme und Ansprechpartner für die Reaktion auf Vorfälle. Im Abschnitt zur Erfassung von Alarmen des Fragebogens geben Sie in Incident Detection and Response für Ihren Workload die kritischen Alarme an, die zur Entstehung eines Incidents führen. Außerdem erhalten Sie Runbook-Informationen darüber, an wen Sie sich wenden und welche Maßnahmen zu ergreifen sind. Das korrekte Ausfüllen dieses Fragebogens ist ein wichtiger Schritt bei der Einrichtung von Überwachungs- und Reaktionsprozessen für Ihre Workloads. AWS

Laden Sie den Workload-Onboarding-Fragebogen herunter:

Einzelheiten zur Arbeitslast — Allgemeine Fragen

Allgemeine Fragen
Frage Beispielantwort
Name des Unternehmens

Amazon Inc.

Name dieses Workloads (einschließlich aller Abkürzungen)

Amazon Retail Operations (ARO)

Primärer Endbenutzer und die Funktion dieses Workloads.

Bei diesem Workload handelt es sich um eine E-Commerce-Anwendung, mit der Endbenutzer verschiedene Artikel kaufen können. Diese Arbeitslast ist der Hauptumsatzgenerator für unser Unternehmen.

Einzelheiten zur Arbeitslast — Fragen zur Architektur

Fragen zur Architektur
Frage Beispielantwort

Eine Liste von AWS Ressourcen-Tags, die verwendet werden, um Ressourcen zu definieren, die Teil dieser Arbeitslast sind. AWS verwendet diese Tags, um die Ressourcen dieses Workloads zu identifizieren und den Support bei Vorfällen zu beschleunigen.

Anmerkung

Bei Tags muss die Groß- und Kleinschreibung beachtet werden. Wenn Sie mehrere Tags angeben, müssen alle von diesem Workload verwendeten Ressourcen dieselben Tags haben.

App-Name: Optimax

Umgebung: Produktion

Eine Liste von AWS-Service(n), die von diesem Workload verwendet werden, sowie die AWS-Konto(n) und AWS-Region(n), in denen sie sich befinden.

AWS-Services: Route 53, ALB, ECS,...

Konten: 123456789101, 123456789102,...

US-EAST-1Regionen: US-WEST-2,,...

Einzelheiten zur Arbeitslast — Fragen zur Erfassung von Alarmen

Bei Fragen zur Alarmaufnahme geben Sie die kritischen Alarme für Ihren Workload an, die Sie mit AWS Incident Detection and Response beauftragen möchten, sowie die Ansprechpartner, die ein Incident Management Engineer kontaktieren soll, wenn diese Alarme ausgelöst werden.

Der Abschnitt zur Erfassung von Alarmen ist in die folgenden Abschnitte unterteilt:

  • Abschnitt Kontakt: Geben Sie zunächst die Hauptansprechpartner an, die in den mit AWS Incident Detection and Response erstellten Support Fall aufgenommen werden sollen, wenn ein Alarm ausgelöst wird, sowie Ihre bevorzugte Konferenzanwendung für Incident-Bridges. Wenn keine Überbrückungspräferenz angegeben wird, erstellt AWS Incident Detection and Response bei Vorfällen eine Zwischenfallbrücke. Geben Sie als Nächstes Eskalationskontakte und Zeitintervalle an, in denen sie kontaktiert werden sollen, wenn die Hauptkontakte nicht erreichbar sind. Listen Sie abschließend alle Kontakte auf, die während der Dauer eines Vorfalls regelmäßig über den Support-Fall informiert werden sollen.

  • Alarmmatrix: Listet die Gruppe von Alarmen auf, bei deren Auslösung AWS Incident Detection and Response ausgelöst wird. Beachten Sie bei der Auswahl von Alarmen für das Onboarding die von AWS Incident Detection and Response definierten „Kriterien für kritische Alarme“. Weitere Informationen finden Sie unter Definition des Alarms.

Ansprechpartner für Workload-Einsatz und Eskalation — Runbook-Fragen

Fragen zum Runbook
Frage Beispielantwort

AWS bezieht die Workload-Ansprechpartner mit der Bearbeitung des Support Falls ein. Wer ist der Hauptansprechpartner, wenn für diese Arbeitslast ein Alarm ausgelöst wird?

Geben Sie Ihre bevorzugte Konferenzanwendung an und fordern AWS Sie diese Informationen bei einem Vorfall an.

Anmerkung

Wenn eine bevorzugte Konferenzanwendung nicht zur Verfügung gestellt AWS wird, kontaktieren wir Sie während eines Vorfalls und stellen Ihnen eine Chime-Bridge zur Verfügung, an der Sie teilnehmen können.

Bewerbungsteam

app@example.com

+61 2 3456 7890

Wenn der Hauptansprechpartner während eines Vorfalls nicht verfügbar ist, geben Sie bitte die Eskalationskontakte und den Zeitplan in der bevorzugten Kommunikationsreihenfolge an.

1. Wenn nach 10 Minuten keine Antwort vom Hauptansprechpartner erfolgt, wenden Sie sich an:

John Smith — Anwendungsleiter

john.smith@example.com

+61 2 3456 7890

2. Wenn John Smith nach 10 Minuten keine Antwort gibt, wenden Sie sich an:

Jane Smith - Betriebsleiterin

jane.smith@example.com

+61 2 3456 7890

Alarmmatrix

Geben Sie die folgenden Informationen an, um die Alarme zu identifizieren, die AWS Incident Detection and Response dazu veranlassen, Vorfälle im Namen Ihrer Arbeitslast auszulösen. Sobald die Techniker von AWS Incident Detection and Response Ihre Alarme überprüft haben, werden weitere Onboarding-Schritte durchgeführt.

Kriterien für die Erkennung und Reaktion von AWS-Vorfällen bei kritischen Alarmen:

  • Die Alarme von AWS Incident Detection and Response sollten nur dann in den Status „Alarm“ übergehen, wenn die überwachte Arbeitslast erheblich beeinträchtigt wird (Verlust der revenue/degraded Kundenerfahrung), sodass der Betreiber sofort reagieren muss.

  • Die AWS-Alarme zur Erkennung und Reaktion von Incident Detection and Response müssen gleichzeitig oder vor dem Einsatz auch Ihre für die Arbeitslast zuständigen Mitarbeiter einschalten. AWS Die Incident Manager arbeiten bei der Problembehebung mit Ihren Problemlösern zusammen und sind nicht als Ersthelfer tätig, die dann zu Ihnen eskalieren.

  • Die Alarmschwellenwerte für AWS Incident Detection and Response müssen auf einen angemessenen Schwellenwert und eine angemessene Dauer festgelegt werden, sodass jedes Mal, wenn ein Alarm ausgelöst wird, eine Untersuchung eingeleitet werden muss. Wenn sich ein Alarm zwischen dem Status „Alarm“ und „OK“ bewegt, sind die Auswirkungen so groß, dass die Reaktion und Aufmerksamkeit des Bedieners gerechtfertigt ist.

AWS-Richtlinie zur Erkennung und Reaktion auf Vorfälle bei Verstößen gegen Kriterien:

Diese Kriterien können nur von Fall zu Fall bewertet werden, wenn Ereignisse eintreten. Das Incident-Management-Team arbeitet mit Ihren technischen Kundenbetreuern (TAMs) zusammen, um Alarme anzupassen und in seltenen Fällen die Überwachung zu deaktivieren, wenn der Verdacht besteht, dass Kundenalarme diese Kriterien nicht erfüllen, und das Incident-Management-Team unnötig regelmäßig einbezieht.

Wichtig

Geben Sie bei der Angabe von Kontaktadressen eine E-Mail-Adresse für den Gruppenvertrieb an, damit Sie das Hinzufügen und Löschen von Empfängern ohne Runbook-Updates kontrollieren können.

Geben Sie die Kontakttelefonnummer für Ihr Site Reliability Engineering (SRE) -Team an, wenn Sie möchten, dass das AWS Incident Detection and Response Team es nach dem Senden einer ersten Kontakt-E-Mail anruft.

Alarm-Matrix-Tabelle für CloudWatch Alarme

CloudWatch Alarm-ARN

Hauptkontakt für diesen Alarm.

(Falls anders als der primäre Workload-Ansprechpartner)

Geben Sie den AWS-Service für diesen Alarm relevantesten an, um den richtigen Techniker zu beauftragen. Geben Sie ein N/A , falls nicht erforderlich.

Beispiel:

arn:aws:cloudwatch:us-east-1:123456789012:alarm:ALB_5xx_Target_Response

Beispiel:

Sam Smith - Anwendungsmanager

sam.smith@example.com

+61 2 3456 7890

Beispiel:

ECS

Alarmmatrixtabelle für APM-Alarme von Drittanbietern

EventBridge Event Bus ARN

(Dies wird als Teil der APM-Integration eines Drittanbieters erstellt, um Warnmeldungen an AWS Incident Detection and Response weiterzuleiten.)

Beispiel: (Pro Account/Region Kombination wird es einen Event-Bus geben)

arn:aws:events:us-east-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

arn:aws:events:us-west-1:123456789012:event-bus/APMName-AWSIncidentDetectionResponse-EventBus

Alarm-ID

Was bedeutet diese Metrik?

Warum ist dieser Alarm wichtig?

Hauptkontakt für diesen Alarm.

(Falls anders als der primäre Workload-Ansprechpartner)

Geben Sie den AWS-Service für diesen Alarm relevantesten an, um den richtigen Techniker zu beauftragen. Geben Sie ein N/A , falls nicht erforderlich.

Beispiel:

Alb_5xx_ Target_Response

Konto-ID: 123456789012

Region: us-east-1

Beispiel:

Diese Metrik stellt die Transaktionsantworten der Ziele dar, die hinter dem ALB stehen. Wenn 5XX-Fehler den Schwellenwert überschreiten, handelt es sich um einen kritischen Fehler bei der Verarbeitung von Geschäftstransaktionen.

Beispiel:

Sam Smith — Anwendungsmanager

sam.smith@example.com

+61 2 3456 7890

Beispiel:

ECS