View a markdown version of this page

Memecahkan masalah metrik kesehatan cluster - AWS ParallelCluster

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Memecahkan masalah metrik kesehatan cluster

Metrik kesehatan cluster ditambahkan ke CloudWatch dasbor AWS ParallelCluster Amazon dimulai dengan AWS ParallelCluster versi 3.6.0. Di bagian berikut, Anda dapat mempelajari tentang metrik kesehatan dasbor, dan tindakan yang dapat Anda lakukan untuk memecahkan masalah dan menyelesaikan masalah.

Melihat Kesalahan Penyediaan Instans Grafik

Jika Anda melihat nilai bukan nol dalam Instance Provisioning Errors grafik, berarti instans Amazon EC2 untuk mendukung node slurm gagal diluncurkan di API or. CreateFleet RunInstance

Melihat IAMPolicyErrors

  • Apa yang terjadi?

    Sejumlah instance gagal diluncurkan, yang disebabkan oleh izin yang tidak mencukupi dengan kode kesalahanUnauthorizedOperation.

  • Bagaimana cara menyelesaikannya?

    Jika Anda telah mengonfigurasi kustom InstanceRole atau InstanceProfile, periksa kebijakan IAM Anda dan verifikasi bahwa Anda menggunakan kredenSIAL yang benar.

    Periksa clustermgtd file untuk detail kesalahan simpul statis. Periksa slurm_resume.log file untuk detail kesalahan simpul dinamis. Gunakan detail untuk mempelajari lebih lanjut tentang izin yang hilang yang harus ditambahkan.

Melihat VcpuLimitErrors

  • Apa yang terjadi?

    AWS ParallelCluster gagal meluncurkan instans karena mencapai batas vCPU pada Anda Akun AWS untuk jenis instans Amazon EC2 tertentu yang Anda konfigurasikan untuk node komputasi cluster.

  • Bagaimana cara menyelesaikannya?

    Periksa VcpuLimitExceeded kesalahan dalam clustermgtd file untuk node statis, dan periksa slurm_resume.log file untuk node dinamis untuk mendapatkan detail tambahan. Untuk mengatasi masalah ini, Anda dapat meminta peningkatan batas vCPU Anda. Untuk informasi selengkapnya tentang cara melihat batas saat ini dan meminta batas baru, lihat kuota layanan Amazon Elastic Compute Cloud di Panduan Pengguna Amazon Elastic Compute Cloud untuk Instans Linux.

Melihat VolumeLimitErrors

  • Apa yang terjadi?

    Anda telah mencapai batas volume Amazon EBS pada Akun AWS, dan AWS ParallelCluster tidak dapat meluncurkan instans dengan kode kesalahan InsufficientVolumeCapacity atauVolumeLimitExceeded.

  • Bagaimana cara menyelesaikannya?

    Periksa clustermgtd file untuk node statis, dan periksa slurm_resume.log file untuk node dinamis untuk mendapatkan detail batas volume tambahan. Untuk mengatasi masalah ini, Anda dapat menggunakan volume yang berbeda Wilayah AWS, membersihkan volume yang ada, atau menghubungi Pusat AWS Dukungan untuk mengirimkan permintaan untuk meningkatkan batas volume Amazon EBS Anda.

Melihat InsufficientCapacityErrors

OtherInstanceLaunchFailures

  • Apa yang terjadi?

    Instans Amazon EC2 untuk mendukung node komputasi gagal diluncurkan dengan API CreateFleet orRunInstance.

  • Bagaimana cara menyelesaikannya?

    Periksa clustermgtd file untuk node statis, dan periksa slurm_resume.log file untuk node dinamis untuk mendapatkan detail kesalahan.

Melihat Kesalahan Instans Tidak Sehat Grafik

Melihat InstanceBootstrapTimeoutError

  • Apa yang terjadi?

    Sebuah instance tidak dapat bergabung dengan cluster di dalam resume_timeout (untuk node dinamis) atau node_replacement_timeout (untuk node statis). Hal ini dapat terjadi jika jaringan tidak dikonfigurasi dengan benar untuk node komputasi, atau dapat terjadi jika skrip kustom yang berjalan pada node komputasi membutuhkan waktu terlalu lama untuk diselesaikan.

  • Bagaimana cara menyelesaikannya?

    Untuk node dinamis, periksa clustermgtd log (/var/log/parallelcluster/clustermgtd) untuk alamat IP node komputasi dan kesalahan seperti berikut:

    Node bootstrap error: Resume timeout expires for node

    Untuk node statis, periksa clustermgtd log (/var/log/parallelcluster/clustermgtd) untuk alamat IP node komputasi dan kesalahan seperti berikut:

    Node bootstrap error: Replacement timeout expires for node ... in replacement.

    Untuk detail tambahan, periksa /var/log/cloud-init-output.log file untuk kesalahan. Anda dapat mengambil alamat IP node komputasi yang bermasalah dari file clustermgtd dan slurm_resume log.

Melihat EC2HealthCheckErrors

Melihat ScheduledEventHealthCheckErrors

  • Apa yang terjadi?

    Instans gagal dalam pemeriksaan kesehatan acara terjadwal Amazon EC2, dan itu tidak sehat.

  • Bagaimana cara menyelesaikannya?

    Untuk informasi tentang cara memecahkan masalah ini, lihat Acara terjadwal untuk instans Anda.

Melihat NoCorrespondingInstanceErrors

  • Apa yang terjadi?

    AWS ParallelCluster tidak dapat menemukan instance yang mendukung node. Node kemungkinan telah dihentikan sendiri selama operasi bootstrap. SlurmQueues/CustomActions/OnNodeStart| OnNodeConfigured script, atau kesalahan jaringan dapat dihasilkanNoCorrespondingInstanceErrors.

  • Bagaimana cara menyelesaikannya?

    Untuk detail tambahan, periksa /var/log/cloud-init-output.log untuk simpul komputasi.

Melihat Hitung Waktu Idle Armada Grafik

Melihat MaxDynamicNodeIdleTime yang jauh lebih panjang dari Waktu Idle Scaledown ambang

  • Apa yang terjadi?

    Instans Anda tidak berakhir dengan benar. MaxDynamicNodeIdleTimemenunjukkan waktu maksimum dalam detik saat node dinamis, didukung oleh instans Amazon EC2, tidak aktif. Am bang batas Waktu Idle Scaledown diturunkan dari parameter konfigurasi ScaledownIdletime cluster. Ketika node komputasi tidak aktif selama lebih dari detik Scaledown Waktu Idle, Slurm matikan node dan menghentikan instance AWS ParallelCluster pendukung. Dalam hal ini, ada sesuatu yang mencegah penghentian instance.

  • Bagaimana cara menyelesaikannya?

    Untuk informasi lebih lanjut tentang masalah ini, lihat Mengganti, menghentikan, atau mematikan instans dan node yang bermasalah diMemecahkan masalah penskalaan.