Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Zone de disponibilité : restauration
Le test de restauration de la zone de disponibilité injecte les symptômes d'une coupure de courant dans une seule zone de disponibilité, affectant les ressources de calcul, de réseau, de stockage et de base de données au sein de cette zone de disponibilité. Cela peut vous aider à vérifier que votre service détecte l'AZ altérée, continue de fonctionner dans les zones Z saines et revient à un état sain dans le cadre de votre RTO défini. En outre, ce test peut vous aider à mettre en évidence des dépendances à AZ unique dont vous n'êtes peut-être pas au courant.
Qu'est-ce qui rend ce test unique ?
-
Cible une zone de disponibilité unique que vous choisissez, en mettant l'accent sur la résilience zonale au sein de la région.
-
Il s'agit d'un test de restauration : votre service doit être restauré au sein de votre RTO.
Comment réussir ce test
-
Il s'agit d'un test de récupération. Le compte à rebours RTO commence lorsque les actions de test commencent. Le test est réussi si toutes les alarmes de réussite reviennent à
OKl'état de votre RTO et y restent jusqu'à la fin des actions de test.
Points à prendre en compte
-
Choisissez des alarmes de réussite qui mesurent l'état du service régional (par exemple, le taux d'erreur régional, la latence). Évitez les alarmes par zone de gravité, car la zone de sécurité altérée est susceptible d'être défectueuse.
-
Cela est particulièrement significatif pour les architectures multi-AZ où le trafic peut être transféré vers des zones de zone de zone de zone saines. Peut également être exécuté sur des services Single-AZ.
-
Si le décalage automatique zonal de AWS l'Application Recovery Controller (ARC) est activé sur vos ressources, le test effectue des exercices qui changent automatiquement. Si le décalage automatique n'est pas configuré, l'action est ignorée.
Principaux paramètres de test
-
Zone de disponibilité : choisissez la zone de disponibilité à modifier. Sélectionnez une zone de disponibilité dans laquelle les ressources de votre service sont déployées.
-
Durée : durée pendant laquelle les actions de test sont exécutées. Il faut ensuite quelques minutes supplémentaires pour recueillir les résultats finaux avant la fin du test. La valeur par défaut est votre RTO selon votre politique de service, plus 30 minutes lorsque vous créez le test pour la première fois. Réglez-le plus longtemps que votre RTO pour vérifier que la restauration est maintenue.
Actions
Ce test exécute les AWS FIS actions suivantes pour altérer la zone de disponibilité que vous sélectionnez. Si votre service ne dispose d'aucune ressource correspondant au type de cible d'une action, cette action est ignorée. Pour plus de détails sur chaque action, consultez la référence AWS FIS des actions.
| Action | Description |
|---|---|
aws:ec2:stop-instances |
Arrête les instances dans la zone Z altérée pendant la durée. |
aws:ec2:api-insufficient-instance-capacity-error |
Bloque le lancement de nouvelles instances dans la zone Z altérée. |
aws:ec2:asg-insufficient-instance-capacity-error |
Empêche Auto Scaling de provisionner la capacité dans l'AZ. |
aws:network:disrupt-connectivity |
Bloque le trafic entrant et sortant du sous-réseau, et bloque l'accès aux compartiments du répertoire Amazon S3 Express One Zone s'ils sont présents. |
aws:rds:failover-db-cluster |
Passe sur le cluster si le graveur se trouve dans la zone Z altérée. |
aws:elasticache:replicationgroup-interrupt-az-power |
Termine les nœuds de cache dans la zone de zone de sécurité altérée sans les remplacer pendant toute la durée. |
aws:arc:start-zonal-autoshift |
Déplace le trafic vers des zones de trafic saines. |
Pour voir les paramètres de ce test et leurs valeurs par défaut, utilisezget-test-template.