As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Zona de disponibilidade: recuperação
Zona de disponibilidade: o teste de recuperação injeta os sintomas de uma interrupção de energia em uma única zona de disponibilidade, afetando os recursos de computação, rede, armazenamento e banco de dados dentro dessa AZ. Isso pode ajudar você a validar se seu serviço detecta a AZ prejudicada, continua operando nas AZs saudáveis e retorna a um estado íntegro dentro do seu RTO definido. Além disso, esse teste pode ajudá-lo a identificar dependências Single-AZ que você talvez não conheça.
O que torna esse teste único
-
Tem como alvo uma única zona de disponibilidade que você escolher, com foco na resiliência zonal e na região.
-
Esse é um teste de recuperação — seu serviço deve se recuperar dentro do seu RTO.
Como passar neste teste
-
É um teste de recuperação. A contagem regressiva do RTO começa quando as ações de teste começam. O teste será aprovado se todos os alarmes de sucesso voltarem ao
OKestado em seu RTO e permanecerem lá até que as ações de teste terminem.
Coisas em que pensar
-
Escolha alarmes de sucesso que meçam a integridade do serviço regional (por exemplo, taxa de erro regional, latência) — evite alarmes por AZ, pois espera-se que o AZ prejudicado não seja íntegro.
-
Mais significativo para arquiteturas Multi-AZ, nas quais o tráfego pode mudar para AZs saudáveis. Também pode ser executado em serviços Single-AZ.
-
Se você tiver o desvio automático zonal do AWS Application Recovery Controller (ARC) ativado em seus recursos, os exercícios de teste mudarão automaticamente. Se o desvio automático não estiver configurado, a ação será ignorada.
Parâmetros de teste chave
-
Zona de disponibilidade — Escolha a AZ a ser prejudicada. Selecione uma AZ em que seu serviço tenha recursos implantados.
-
Duração — O período de tempo em que as ações de teste são executadas. Depois, são necessários mais alguns minutos para coletar os resultados finais antes que o teste termine. O padrão é o RTO de sua política de serviço mais 30 minutos quando você cria o teste pela primeira vez. Defina-o por mais tempo do que seu RTO para validar se a recuperação é sustentada.
Ações
Esse teste executa as seguintes AWS FIS ações para prejudicar a zona de disponibilidade que você seleciona. Se seu serviço não tiver recursos que correspondam ao tipo de alvo de uma ação, essa ação será ignorada. Para obter detalhes sobre cada ação, consulte a referência de AWS FIS ações.
| Ação | Description |
|---|---|
aws:ec2:stop-instances |
Interrompe as instâncias no AZ prejudicado durante todo o período. |
aws:ec2:api-insufficient-instance-capacity-error |
Bloqueia o lançamento de novas instâncias no AZ prejudicado. |
aws:ec2:asg-insufficient-instance-capacity-error |
Impede que o Auto Scaling provisione a capacidade no AZ. |
aws:network:disrupt-connectivity |
Bloqueia o tráfego que entra e sai da sub-rede e bloqueia o acesso aos buckets do diretório One Zone do Amazon S3 Express, se houver. |
aws:rds:failover-db-cluster |
Falha no cluster se o gravador estiver no AZ prejudicado. |
aws:elasticache:replicationgroup-interrupt-az-power |
Encerra os nós de cache no AZ prejudicado sem substituí-los durante o período. |
aws:arc:start-zonal-autoshift |
Transfere o tráfego para AZs saudáveis. |
Para ver os parâmetros desse teste e seus valores padrão, useget-test-template.