Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Zona de disponibilidad: recuperación
La prueba de recuperación de la zona de disponibilidad inyecta los síntomas de una interrupción del suministro eléctrico en una única zona de disponibilidad, lo que afecta a los recursos informáticos, de redes, de almacenamiento y de bases de datos de esa zona de disponibilidad. Puede ayudarlo a comprobar que su servicio detecta la zona de disponibilidad defectuosa, continúa funcionando en las zonas de disponibilidad en buen estado y vuelve a un estado correcto dentro del RTO definido. Además, esta prueba puede ayudarte a descubrir las dependencias de una sola zona de disponibilidad que tal vez desconozcas.
¿Qué hace que esta prueba sea única
-
Se dirige a la única zona de disponibilidad que usted elija, centrándose en la resiliencia zonal e interna de la región.
-
Se trata de una prueba de recuperación: su servicio debe recuperarse dentro de su RTO.
¿Cómo pasar esta prueba
-
Se trata de una prueba de recuperación. La cuenta regresiva del RTO comienza cuando comienzan las acciones de prueba. La prueba pasa si todas las alarmas de éxito vuelven al
OKestado de su RTO y permanecen allí hasta que finalicen las acciones de prueba.
Cosas en las que pensar
-
Elija alarmas de éxito que midan el estado de los servicios regionales (por ejemplo, la tasa de error regional o la latencia). Evite las alarmas por zona de disponibilidad, ya que se espera que la zona de disponibilidad dañada no esté en buen estado.
-
Es más significativo para las arquitecturas multizona de disponibilidad, en las que el tráfico puede cambiar a zonas de disponibilidad en buen estado. También se puede ejecutar en servicios Single-AZ.
-
Si tiene activado el cambio automático zonal del AWS Application Recovery Controller (ARC) en sus recursos, los ejercicios de prueba son los que cambian automáticamente. Si el cambio automático no está configurado, se omite la acción.
Parámetros clave de la prueba
-
Zona de disponibilidad: elija la zona de disponibilidad que desee modificar. Seleccione una zona de disponibilidad en la que su servicio tenga recursos desplegados.
-
Duración: el tiempo durante el que se ejecutan las acciones de prueba. Después, se necesitan unos minutos más para recopilar los resultados finales antes de que finalice la prueba. El RTO se establece de forma predeterminada según su política de servicio, más 30 minutos cuando crea la prueba por primera vez. Configúrala durante más tiempo que tu RTO para validar que la recuperación es sostenida.
Acciones
Esta prueba ejecuta las siguientes AWS FIS acciones para afectar la zona de disponibilidad que seleccione. Si su servicio no tiene recursos que coincidan con el tipo de objetivo de una acción, esa acción se omite. Para obtener más información sobre cada acción, consulta la referencia de AWS FIS acciones.
| Action | Description (Descripción) |
|---|---|
aws:ec2:stop-instances |
Detiene las instancias en la zona de disponibilidad alterada mientras dure. |
aws:ec2:api-insufficient-instance-capacity-error |
Bloquea el lanzamiento de nuevas instancias en la zona de disponibilidad dañada. |
aws:ec2:asg-insufficient-instance-capacity-error |
Impide que Auto Scaling aprovisione capacidad en la Arizona. |
aws:network:disrupt-connectivity |
Bloquea el tráfico que entra y sale de la subred y bloquea el acceso a los buzones de directorio One Zone de Amazon S3 Express, si los hay. |
aws:rds:failover-db-cluster |
Realiza una conmutación por error del clúster si el escritor se encuentra en la zona de distribución defectuosa. |
aws:elasticache:replicationgroup-interrupt-az-power |
Termina los nodos de caché en la zona de disponibilidad dañada sin reemplazarlos mientras dure. |
aws:arc:start-zonal-autoshift |
Cambia el tráfico a zonas de disponibilidad en buen estado. |
Para ver los parámetros de esta prueba y sus valores predeterminados, utiliceget-test-template.