View a markdown version of this page

Availability Zone: Wiederherstellung - AWS Resilience Hub

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Availability Zone: Wiederherstellung

Der Availability Zone: Recovery-Test untersucht die Symptome einer Stromunterbrechung in einer einzelnen Availability Zone, was sich auf die Rechen-, Netzwerk-, Speicher- und Datenbankressourcen innerhalb dieser AZ auswirkt. Er kann Ihnen dabei helfen, zu überprüfen, ob Ihr Service die beeinträchtigte AZ erkennt, in den fehlerfreien AZs weiterarbeitet und innerhalb Ihrer definierten RTO wieder in einen fehlerfreien Zustand zurückkehrt. Darüber hinaus kann Ihnen dieser Test dabei helfen, Single-AZ-Abhängigkeiten zu erkennen, von denen Sie möglicherweise nichts wissen.

Was macht diesen Test einzigartig
  • Zielt auf eine einzelne Availability Zone ab, die Sie auswählen, wobei der Schwerpunkt auf zonaler, regionsinterner Resilienz liegt.

  • Dies ist ein Wiederherstellungstest — Ihr Service muss innerhalb Ihres RTO wiederhergestellt werden.

Wie besteht man diesen Test
  • Dies ist ein Wiederherstellungstest. Der RTO-Countdown beginnt, wenn die Testaktionen beginnen. Der Test ist bestanden, wenn alle Erfolgsmeldungen in Ihrem RTO wieder den OK Status erreichen und dort bleiben, bis die Testaktionen beendet sind.

Dinge, über die man nachdenken sollte
  • Wählen Sie Erfolgsalarme, die den Zustand der regionalen Dienste messen (z. B. regionale Fehlerrate, Latenz). Vermeiden Sie Alarme pro AZ, da davon auszugehen ist, dass die beeinträchtigte AZ fehlerhaft ist.

  • Am aussagekräftigsten für Multi-AZ-Architekturen, in denen der Datenverkehr auf fehlerfreie AZs verlagert werden kann. Kann auch für Single-AZ-Dienste ausgeführt werden.

  • Wenn Sie die zonale automatische Verschiebung von AWS Application Recovery Controller (ARC) für Ihre Ressourcen aktiviert haben, werden die Testübungen automatisch ausgeführt. Wenn Autoshift nicht konfiguriert ist, wird die Aktion übersprungen.

Wichtige Testparameter
  • Availability Zone — Wählen Sie die AZ aus, die beeinträchtigt werden soll. Wählen Sie eine AZ aus, in der Ihr Service über Ressourcen verfügt.

  • Dauer — Die Dauer der Ausführung der Testaktionen. Danach dauert es noch einige Minuten, bis die endgültigen Ergebnisse erfasst sind, bevor der Test endet. Standardmäßig wird Ihr RTO aus Ihrer Servicerichtlinie plus 30 Minuten verwendet, wenn Sie den Test zum ersten Mal erstellen. Stellen Sie den Wert länger als Ihr RTO ein, um zu überprüfen, ob die Wiederherstellung nachhaltig ist.

Aktionen

Bei diesem Test werden die folgenden AWS FIS Aktionen ausgeführt, um die von Ihnen gewählte Availability Zone zu beeinträchtigen. Wenn Ihr Service keine Ressourcen hat, die dem Zieltyp einer Aktion entsprechen, wird diese Aktion übersprungen. Einzelheiten zu den einzelnen Aktionen finden Sie in der AWS FIS Aktionsreferenz.

Action Description
aws:ec2:stop-instances Stoppt Instances in der beeinträchtigten AZ für die Dauer.
aws:ec2:api-insufficient-instance-capacity-error Blockiert das Starten neuer Instances in der beeinträchtigten AZ.
aws:ec2:asg-insufficient-instance-capacity-error Verhindert, dass Auto Scaling Kapazität in der AZ bereitstellt.
aws:network:disrupt-connectivity Blockiert den in das Subnetz ein- und ausgehenden Datenverkehr und blockiert den Zugriff auf Amazon S3 Express One Zone-Verzeichnis-Buckets, falls vorhanden.
aws:rds:failover-db-cluster Failover für den Cluster, wenn sich der Writer in der beeinträchtigten AZ befindet.
aws:elasticache:replicationgroup-interrupt-az-power Beendet die Cache-Knoten in der beeinträchtigten AZ, ohne dass sie für die Dauer ersetzt werden.
aws:arc:start-zonal-autoshift Leitet den Verkehr auf fehlerfreie AZs um.

Um die Parameter dieses Tests und ihre Standardwerte zu sehen, verwenden Sieget-test-template.