View a markdown version of this page

Operasi Terpadu Memulai: Alarm kritis onboard untuk manajemen insiden yang cepat - AWS Dukungan

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Operasi Terpadu Memulai: Alarm kritis onboard untuk manajemen insiden yang cepat

Untuk membantu memberi tahu Anda dengan cepat tentang insiden kritis, selesaikan langkah-langkah berikut untuk memasukkan alarm Anda ke Deteksi dan Respons AWS Insiden

  1. Tentukan dan konfigurasikan alarm kritis Anda untuk manajemen insiden yang cepat. Untuk informasi terperinci, lihat Men definisikan dan mengonfigurasi alarm di Deteksi dan Respons Insiden di Panduan Pengguna Deteksi dan Respons Insiden.

    1. Untuk langkah-langkah mengatur alarm menggunakan Amazon CloudWatch, lihat Men definisikan dan mengonfigurasi alarm di Deteksi dan Respons Insiden di Panduan Pengguna Deteksi dan Respons Insiden. Untuk AWS rekomendasi jenis alarm kritis untuk berbagai jenis Layanan AWS, lihat Det eksi dan Respons Insiden (IDR). Hubungi tim Operasi Ter AWS padu jika Anda AWS ingin mengotomatiskan pembuatan AWS alarm penting untuk AWS sumber daya yang diberi tag.

    2. Untuk mengalihkan atau menyerap alarm kritis dari alat APM pihak ketiga dengan EventBridge integrasi Amazon langsung, seperti DataDog,, dan seterusnya NewRelic, lihat Mengambil alarm dari AP M yang memiliki integrasi langsung dengan Amazon EventBridge di Panduan Pengguna Deteksi dan Respons AWS Insiden. Anda harus menerapkan serangkaian AWS sumber daya (AWS Lambda dan aturan bus EventBridge peristiwa Amazon) untuk mengubah dan mengarahkan alarm (peristiwa) Anda ke Deteksi dan Respons AWS Insiden. Tim Operasi Ter AWS padu Anda dapat membantu menyediakan CloudFormation template untuk menginstal sumber daya ini.

    3. Alihkan atau ambil alarm kritis dari alat pemantauan kustom Anda melalui alat APM pihak ketiga yang tidak memiliki integrasi langsung dengan Amazon. EventBridge Untuk informasi selengkapnya, lihat Menggunakan webhook untuk menerima alarm dari APM tanpa integrasi langsung dengan Amazon EventBridge di Panduan Pengguna Deteksi dan Respons AWS Insiden. Anda harus menerapkan serangkaian AWS sumber daya ( AWS Lambda fungsi API Gateway, dan aturan bus EventBridge peristiwa Amazon) untuk mengubah dan mengarahkan alarm (peristiwa) Anda ke Deteksi dan Respons AWS Insiden. Tim Operasi Ter AWS padu Anda dapat membantu menyediakan CloudFormation template untuk menginstal sumber daya ini.

  2. Berikan detail arsitektur beban kerja, informasi titik kontak, dan informasi runbook tentang tindakan mitigasi untuk alarm kritis. Caranya, lakukan langkah-langkah berikut:

    1. Unduh dan lengkapi kuesioner orientasi Beban Kerja Deteksi AWS Insiden dan Resp ons untuk setiap beban kerja atau aplikasi kritis dan kuesioner penyerapan Alarm yang terkait dengan setiap beban kerja unik.

      Informasi dalam kuesioner ini membantu AWS tim mengembangkan runbook remediasi insiden. Runbook ini memungkinkan tindakan yang tepat diambil untuk memecahkan masalah dan memperbaiki alarm kritis dengan cepat sebelum menyebabkan downtime bisnis. Untuk contoh dan informasi sampel, lihat Kuesioner orientasi beban kerja dan penyerapan alarm di Deteksi dan Resp ons AWS Insiden.

  3. Berikan akses untuk memasang alarm kritis Anda ke Deteksi dan Respons AWS Insiden

    1. Terapkan AWSServiceRoleForHealth_EventProcessor peran terkait layanan (SLR) dalam Akun AWS menjalankan beban kerja kritis yang akan dipantau oleh tim manajemen in AWS siden. Untuk informasi selengkapnya, lihat Penyediaan akses untuk penyerapan peringatan ke Det AWS eksi dan Respons Insiden.

      catatan

      Untuk membantu Anda dengan orientasi besar Akun AWS, AWS dapat memberi Anda AWS Command Line Interface skrip untuk melacak penyediaan SLR ini dengan cepat.

    2. (Opsional) Jika alarm Anda ada di Amazon CloudWatch, pastikan bahwa AWS Identity and Access Management pengguna atau peran yang digunakan untuk pengujian alarm (sebelum di-live) memiliki izin cloudwatch:SetAlarmState IAM di Anda Akun AWS yang menjalankan beban kerja kritis. Ini diperlukan untuk pengujian alarm (gameday) pasca onboarding. Untuk informasi selengkapnya, lihat Meng uji beban kerja terpasang di Deteksi dan Respons AWS Insiden.

  4. Buat AWS Dukungan kasus untuk berlangganan beban kerja untuk manajemen insiden yang cepat. Perhatikan bahwa Anda secara otomatis Akun AWS diaktifkan untuk manajemen inbound cepat inbound, yang berarti Anda dapat menaikkan kasus ke antrian Pendeteksian dan Respons Insiden Operasi Terpadu melalui Konsol Pusat Dukungan AWS Command Line Interface, atau AWS SDK untuk tindakan cepat. AWS Untuk memonitor dan membuat insiden dengan kasus keluar secara proaktif, AWS Dukungan buat AWS Dukungan kasus untuk beban kerja kritis Anda. Caranya, lakukan langkah-langkah berikut:

    1. Masuk ke AWS Support Center Console, pilih Buat kasus, lalu pilih Dukungan teknis.

    2. Untuk Layanan pilih Det eksi dan Respons Insiden.

    3. Untuk Kategori pilih Onboard new beban kerja.

    4. Untuk Tingkat keparahan pilih Panduan umum.

    5. Melampirkan kuesioner Beban Kerja dan Alarm yang Anda selesaikan pada langkah sebelumnya.