Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Fragebogen zum Onboarding von Workloads in Incident Detection and Response (Ausnahmepfad)
Anmerkung
Wenn Sie die IDR-CLI nicht für das Onboarding Ihres Workloads verwenden können, verwenden Sie den folgenden Fragebogen für das Workload-Onboarding.
In diesem Thema finden Sie den Fragebogen, den Sie beim Onboarding eines Workloads und beim Konfigurieren von Alarmen für die Aufnahme in AWS Incident Detection and Response ausfüllen müssen. Der Fragebogen zum Workload-Onboarding enthält allgemeine Informationen zu Ihrem Workload, Details zur Architektur, Alarme und Ansprechpartner für die Reaktion auf Vorfälle. Im Abschnitt zur Erfassung von Alarmen des Fragebogens geben Sie in Incident Detection and Response für Ihren Workload die kritischen Alarme an, die zur Entstehung eines Incidents führen. Außerdem erhalten Sie Runbook-Informationen darüber, an wen Sie sich wenden und welche Maßnahmen zu ergreifen sind. Das korrekte Ausfüllen dieses Fragebogens ist ein wichtiger Schritt bei der Einrichtung von Überwachungs- und Reaktionsprozessen für Ihre Workloads. AWS
Laden Sie den Workload-Onboarding-Fragebogen herunter:
Einzelheiten zur Arbeitslast — Allgemeine Fragen
| Frage | Beispielantwort |
|---|---|
| Name des Unternehmens | Amazon Inc. |
| Name dieses Workloads (einschließlich aller Abkürzungen) | Amazon Retail Operations (ARO) |
| Primärer Endbenutzer und die Funktion dieses Workloads. | Bei diesem Workload handelt es sich um eine E-Commerce-Anwendung, mit der Endbenutzer verschiedene Artikel kaufen können. Diese Arbeitslast ist der Hauptumsatzgenerator für unser Unternehmen. |
Einzelheiten zur Arbeitslast — Fragen zur Architektur
| Frage | Beispielantwort |
|---|---|
Eine Liste von AWS Ressourcen-Tags, die verwendet werden, um Ressourcen zu definieren, die Teil dieser Arbeitslast sind. AWS verwendet diese Tags, um die Ressourcen dieses Workloads zu identifizieren und den Support bei Vorfällen zu beschleunigen. AnmerkungBei Tags muss die Groß- und Kleinschreibung beachtet werden. Wenn Sie mehrere Tags angeben, müssen alle von diesem Workload verwendeten Ressourcen dieselben Tags haben. |
App-Name: Optimax Umgebung: Produktion |
Eine Liste von AWS-Service(n), die von diesem Workload verwendet werden, sowie die AWS-Konto(n) und AWS-Region(n), in denen sie sich befinden. |
AWS-Services: Route 53, ALB, ECS,... Konten: 123456789101, 123456789102,... US-EAST-1Regionen: US-WEST-2,,... |
Einzelheiten zur Arbeitslast — Fragen zur Erfassung von Alarmen
Bei Fragen zur Alarmaufnahme geben Sie die kritischen Alarme für Ihren Workload an, die Sie mit AWS Incident Detection and Response beauftragen möchten, sowie die Ansprechpartner, die ein Incident Management Engineer kontaktieren soll, wenn diese Alarme ausgelöst werden.
Der Abschnitt zur Erfassung von Alarmen ist in die folgenden Abschnitte unterteilt:
Abschnitt Kontakt: Geben Sie zunächst die Hauptansprechpartner an, die in den mit AWS Incident Detection and Response erstellten Support Fall aufgenommen werden sollen, wenn ein Alarm ausgelöst wird, sowie Ihre bevorzugte Konferenzanwendung für Incident-Bridges. Wenn keine Überbrückungspräferenz angegeben wird, erstellt AWS Incident Detection and Response bei Vorfällen eine Zwischenfallbrücke. Geben Sie als Nächstes Eskalationskontakte und Zeitintervalle an, in denen sie kontaktiert werden sollen, wenn die Hauptkontakte nicht erreichbar sind. Listen Sie abschließend alle Kontakte auf, die während der Dauer eines Vorfalls regelmäßig über den Support-Fall informiert werden sollen.
Alarmmatrix: Listet die Gruppe von Alarmen auf, bei deren Auslösung AWS Incident Detection and Response ausgelöst wird. Beachten Sie bei der Auswahl von Alarmen für das Onboarding die von AWS Incident Detection and Response definierten „Kriterien für kritische Alarme“. Weitere Informationen finden Sie unter Definition des Alarms.
CloudWatch Amazon-Alarme (lassen Sie diesen Abschnitt leer, wenn Sie keine CloudWatch Amazon-Alarme haben)
APM-Alarme von Drittanbietern (lassen Sie diesen Abschnitt leer, wenn Sie keine APM-Alarme von Drittanbietern haben)
EventBridge EventBus ARN: Dies ist der ARN des benutzerdefinierten EventBus ARN, den Sie in Erfassen Sie Alarme von APMs mit direkter Integration EventBridge oder erstellt haben. Erfassen Sie Alarme von APMs ohne direkte Integration mit EventBridge
Alarm-Identifikatoren: Teilen Sie die Kontonummer, die Region und den Namen des APM-Alarms mit.
Ansprechpartner für Workload-Einsatz und Eskalation — Runbook-Fragen
| Frage | Beispielantwort |
|---|---|
AWS bezieht die Workload-Ansprechpartner mit der Bearbeitung des Support Falls ein. Wer ist der Hauptansprechpartner, wenn für diese Arbeitslast ein Alarm ausgelöst wird? Geben Sie Ihre bevorzugte Konferenzanwendung an und fordern AWS Sie diese Informationen bei einem Vorfall an. AnmerkungWenn eine bevorzugte Konferenzanwendung nicht zur Verfügung gestellt AWS wird, kontaktieren wir Sie während eines Vorfalls und stellen Ihnen eine Chime-Bridge zur Verfügung, an der Sie teilnehmen können. |
Bewerbungsteam app@example.com +61 2 3456 7890 |
Wenn der Hauptansprechpartner während eines Vorfalls nicht verfügbar ist, geben Sie bitte die Eskalationskontakte und den Zeitplan in der bevorzugten Kommunikationsreihenfolge an. |
1. Wenn nach 10 Minuten keine Antwort vom Hauptansprechpartner erfolgt, wenden Sie sich an: John Smith — Anwendungsleiter john.smith@example.com +61 2 3456 7890 2. Wenn John Smith nach 10 Minuten keine Antwort gibt, wenden Sie sich an: Jane Smith - Betriebsleiterin jane.smith@example.com +61 2 3456 7890 |
Alarmmatrix
Geben Sie die folgenden Informationen an, um die Alarme zu identifizieren, die AWS Incident Detection and Response dazu veranlassen, Vorfälle im Namen Ihrer Arbeitslast auszulösen. Sobald die Techniker von AWS Incident Detection and Response Ihre Alarme überprüft haben, werden weitere Onboarding-Schritte durchgeführt.
Kriterien für die Erkennung und Reaktion von AWS-Vorfällen bei kritischen Alarmen:
Die Alarme von AWS Incident Detection and Response sollten nur dann in den Status „Alarm“ übergehen, wenn die überwachte Arbeitslast erheblich beeinträchtigt wird (Verlust der revenue/degraded Kundenerfahrung), sodass der Betreiber sofort reagieren muss.
Die AWS-Alarme zur Erkennung und Reaktion von Incident Detection and Response müssen gleichzeitig oder vor dem Einsatz auch Ihre für die Arbeitslast zuständigen Mitarbeiter einschalten. AWS Die Incident Manager arbeiten bei der Problembehebung mit Ihren Problemlösern zusammen und sind nicht als Ersthelfer tätig, die dann zu Ihnen eskalieren.
Die Alarmschwellenwerte für AWS Incident Detection and Response müssen auf einen angemessenen Schwellenwert und eine angemessene Dauer festgelegt werden, sodass jedes Mal, wenn ein Alarm ausgelöst wird, eine Untersuchung eingeleitet werden muss. Wenn sich ein Alarm zwischen dem Status „Alarm“ und „OK“ bewegt, sind die Auswirkungen so groß, dass die Reaktion und Aufmerksamkeit des Bedieners gerechtfertigt ist.
AWS-Richtlinie zur Erkennung und Reaktion auf Vorfälle bei Verstößen gegen Kriterien:
Diese Kriterien können nur von Fall zu Fall bewertet werden, wenn Ereignisse eintreten. Das Incident-Management-Team arbeitet mit Ihren technischen Kundenbetreuern (TAMs) zusammen, um Alarme anzupassen und in seltenen Fällen die Überwachung zu deaktivieren, wenn der Verdacht besteht, dass Kundenalarme diese Kriterien nicht erfüllen, und das Incident-Management-Team unnötig regelmäßig einbezieht.
Wichtig
Geben Sie bei der Angabe von Kontaktadressen eine E-Mail-Adresse für den Gruppenvertrieb an, damit Sie das Hinzufügen und Löschen von Empfängern ohne Runbook-Updates kontrollieren können.
Geben Sie die Kontakttelefonnummer für Ihr Site Reliability Engineering (SRE) -Team an, wenn Sie möchten, dass das AWS Incident Detection and Response Team es nach dem Senden einer ersten Kontakt-E-Mail anruft.
CloudWatch Alarm-ARN |
Hauptkontakt für diesen Alarm. (Falls anders als der primäre Workload-Ansprechpartner) |
Geben Sie den AWS-Service für diesen Alarm relevantesten an, um den richtigen Techniker zu beauftragen. Geben Sie ein N/A , falls nicht erforderlich. |
Beispiel:
|
Beispiel: Sam Smith - Anwendungsmanager sam.smith@example.com +61 2 3456 7890 |
Beispiel: ECS |
EventBridge Event Bus ARN (Dies wird als Teil der APM-Integration eines Drittanbieters erstellt, um Warnmeldungen an AWS Incident Detection and Response weiterzuleiten.) |
Beispiel: (Pro Account/Region Kombination wird es einen Event-Bus geben)
|
||
Alarm-ID |
Was bedeutet diese Metrik? Warum ist dieser Alarm wichtig? |
Hauptkontakt für diesen Alarm. (Falls anders als der primäre Workload-Ansprechpartner) |
Geben Sie den AWS-Service für diesen Alarm relevantesten an, um den richtigen Techniker zu beauftragen. Geben Sie ein N/A , falls nicht erforderlich. |
Beispiel: Alb_5xx_ Target_Response Konto-ID: 123456789012 Region: us-east-1 |
Beispiel: Diese Metrik stellt die Transaktionsantworten der Ziele dar, die hinter dem ALB stehen. Wenn 5XX-Fehler den Schwellenwert überschreiten, handelt es sich um einen kritischen Fehler bei der Verarbeitung von Geschäftstransaktionen. |
Beispiel: Sam Smith — Anwendungsmanager sam.smith@example.com +61 2 3456 7890 |
Beispiel: ECS |