Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Zona Ketersediaan: pemulihan
Av ailability Zone: recovery test menyuntikkan gejala gangguan daya di Zona Ketersediaan tunggal, memengaruhi sumber daya komputasi, jaringan, penyimpanan, dan basis data dalam AZ tersebut. Ini dapat membantu Anda memvalidasi bahwa layanan Anda mendeteksi AZ yang rusak, terus beroperasi di AZ yang sehat, dan kembali ke keadaan sehat dalam RTO yang Anda tentukan. Selain itu, tes ini dapat membantu Anda memunculkan dependensi Single-AZ yang mungkin tidak Anda sadari.
Apa yang membuat tes ini unik
-
Menargetkan Zona Ketersediaan tunggal yang Anda pilih, dengan fokus pada ketahanan zona dalam wilayah.
-
Ini adalah tes pemulihan - layanan Anda harus pulih dalam RTO Anda.
Cara lulus tes ini
-
Ini adalah tes pemulihan. Hitung mundur RTO dimulai saat tindakan pengujian dimulai. Tes lulus jika semua alarm sukses kembali ke
OKstatus dalam RTO Anda dan tetap di sana sampai tindakan pengujian berakhir.
Hal-hal yang perlu dipikirkan
-
Pilih alarm keberhasilan yang mengukur kesehatan layanan regional (misalnya, tingkat kesalahan regional, latensi) - hindari alarm per-AZ karena AZ yang rusak diperkirakan tidak sehat.
-
Paling bermakna untuk arsitektur multi-AZ di mana lalu lintas dapat bergeser ke AZ yang sehat. Dapat juga dijalankan terhadap layanan Single-AZ.
-
Jika Anda mengaktifkan autoshift zonal Appl AWS ication Recovery Controller (ARC) pada sumber daya Anda, latihan tes akan bergeser secara otomatis. Jika autoshift tidak dikonfigurasi, tindakan dilewati.
Parameter uji utama
-
Zona Ketersediaan - Pilih AZ untuk merusak. Pilih AZ tempat layanan Anda memiliki sumber daya yang digunakan.
-
Durasi — Lamanya waktu tindakan pengujian dijalankan. Dibutuhkan beberapa menit lagi sesudahnya untuk mengumpulkan hasil akhir sebelum tes berakhir. Standar RTO Anda dari kebijakan layanan Anda ditambah 30 menit saat pertama kali Anda membuat pengujian. Tetapkan lebih lama dari RTO Anda untuk memvalidasi bahwa pemulihan berkelanjutan.
Tindakan
Pengujian ini menjalankan AWS FIS tindakan berikut untuk merusak Zona Ketersediaan yang Anda pilih. Jika layanan Anda tidak memiliki sumber daya yang cocok dengan jenis target tindakan, tindakan tersebut dilewati. Untuk detail tentang setiap tindakan, lihat referensi AWS FIS tindakan.
| Tindakan | Deskripsi |
|---|---|
aws:ec2:stop-instances |
Menghentikan instance di AZ yang rusak selama durasi tersebut. |
aws:ec2:api-insufficient-instance-capacity-error |
Memblokir peluncuran instance baru di AZ yang rusak. |
aws:ec2:asg-insufficient-instance-capacity-error |
Mencegah Auto Scaling dari penyediaan kapasitas di AZ. |
aws:network:disrupt-connectivity |
Memblokir lalu lintas yang masuk dan keluar dari subnet, dan memblokir akses ke bucket direktori Amazon S3 Express One Zone jika ada. |
aws:rds:failover-db-cluster |
Gagal melewati cluster jika penulis berada di AZ yang rusak. |
aws:elasticache:replicationgroup-interrupt-az-power |
Menghentikan node cache di AZ yang rusak tanpa penggantian selama durasi. |
aws:arc:start-zonal-autoshift |
Mengalihkan lalu lintas ke AZ yang sehat. |
Untuk melihat parameter pengujian ini dan nilai defaultnya, gunakanget-test-template.