PERF05-BP05 Menggunakan otomatisasi untuk secara proaktif memulihkan masalah terkait kinerja
Gunakan indikator kinerja utama (KPI), yang digabungkan dengan sistem pamantauan dan peringatan, untuk menangani masalah terkait kinerja secara proaktif.
Antipola umum:
-
Anda hanya membekali staf operasional dengan kemampuan untuk membuat perubahan operasional pada beban kerja.
-
Anda membiarkan semua alarm disaring ke tim operasi tanpa perbaikan proaktif.
Manfaat menerapkan praktik terbaik ini: Perbaikan tindakan alarm yang proaktif memungkinkan staf dukungan untuk berkonsentrasi pada item-item yang tidak dapat ditindaklanjuti secara otomatis. Ini membantu staf operasi menangani semua alarm tanpa kewalahan dan mereka hanya berkonsentrasi pada alarm yang kritis.
Tingkat risiko yang terjadi jika praktik terbaik ini tidak dijalankan: Rendah
Panduan implementasi
Gunakan alarm untuk memicu tindakan otomatis untuk memperbaiki masalah ketika memungkinkan. Teruskan alarm ke personel yang mampu merespons jika respons otomatis tidak memungkinkan. Misalnya, Anda mungkin memiliki sistem yang dapat memprediksi nilai dan alarm indikator kinerja utama (KPI) yang diharapkan ketika melanggar ambang batas tertentu, atau alat yang dapat menghentikan atau membatalkan deployment secara otomatis jika KPI berada di luar nilai yang diharapkan.
Implementasikan proses yang menyediakan visibilitas tentang kinerja saat beban kerja Anda berjalan. Bangun dasbor pemantauan dan buat norma acuan untuk harapan kinerja guna menentukan apakah beban kerja berkinerja secara optimal.
Langkah implementasi
-
Identifikasi alur kerja perbaikan: Identifikasi dan pahami masalah kinerja yang dapat diperbaiki secara otomatis. Gunakan solusi pemantauan AWS seperti Amazon CloudWatch atau AWS X-Ray untuk membantu Anda lebih memahami akar penyebab masalah.
-
Tentukan proses otomatisasi: Buat proses perbaikan langkah demi langkah yang dapat digunakan untuk memperbaiki masalah secara otomatis.
-
Konfigurasikan peristiwa inisiasi: Konfigurasikan peristiwa agar memulai proses perbaikan secara otomatis. Misalnya, Anda dapat menentukan pemicu untuk memulai ulang instans secara otomatis ketika mencapai ambang batas pemanfaatan CPU tertentu.
-
Otomatiskan perbaikan: Gunakan layanan dan teknologi AWS untuk mengotomatiskan proses perbaikan. Misalnya, Otomatisasi AWS Systems Manager menyediakan cara yang aman dan dapat diskalakan untuk mengotomatiskan proses perbaikan. Pastikan menggunakan logika pemulihan mandiri untuk mengembalikan perubahan jika masalah tidak berhasil diselesaikan.
-
Uji alur kerja Uji proses perbaikan otomatis di lingkungan praproduksi.
-
Implementasikan alur kerja: Implementasikan perbaikan otomatis di lingkungan produksi.
-
Kembangkan playbook: Kembangkan dan dokumentasikan playbook yang menguraikan langkah-langkah untuk rencana perbaikan, termasuk peristiwa inisiasi, logika perbaikan, dan tindakan yang dilakukan. Pastikan melatih pemangku kepentingan untuk membantu mereka merespons peristiwa perbaikan otomatis secara efektif.
-
Tinjau dan sempurnakan: Secara rutin nilai efektivitas alur kerja perbaikan otomatis. Sesuaikan peristiwa inisiasi dan logika perbaikan jika perlu.
Sumber daya
Dokumen terkait:
Video terkait:
-
AWS re:Invent 2023 - [PELUNCURAN] Pemantauan aplikasi untuk beban kerja modern
-
AWS re:Invent 2023 - Mengimplementasikan observabilitas aplikasi
-
AWS re:Invent 2021 - Mengotomatiskan operasi cloud secara cerdas
-
AWS re:Invent 2022 - Menyiapkan kontrol dalam skala besar di lingkungan AWS Anda
-
AWS re:Invent 2022 - Mengotomatiskan manajemen dan kepatuhan patch menggunakan AWS
Contoh terkait: