Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Memecahkan masalah metrik kesehatan cluster
Metrik kesehatan cluster ditambahkan ke CloudWatch dasbor AWS ParallelCluster Amazon dimulai dengan AWS ParallelCluster versi 3.6.0. Di bagian berikut, Anda dapat mempelajari tentang metrik kesehatan dasbor, dan tindakan yang dapat Anda lakukan untuk memecahkan masalah dan menyelesaikan masalah.
Topik
Melihat Kesalahan Penyediaan Instans Grafik
Jika Anda melihat nilai bukan nol dalam Instance Provisioning Errors grafik, berarti instans Amazon EC2 untuk mendukung node slurm gagal diluncurkan di API or. CreateFleet RunInstance
Melihat IAMPolicyErrors
-
Apa yang terjadi?
Sejumlah instance gagal diluncurkan, yang disebabkan oleh izin yang tidak mencukupi dengan kode kesalahan
UnauthorizedOperation. -
Bagaimana cara menyelesaikannya?
Jika Anda telah mengonfigurasi kustom InstanceRole atau InstanceProfile, periksa kebijakan IAM Anda dan verifikasi bahwa Anda menggunakan kredenSIAL yang benar.
Periksa
clustermgtdfile untuk detail kesalahan simpul statis. Periksaslurm_resume.logfile untuk detail kesalahan simpul dinamis. Gunakan detail untuk mempelajari lebih lanjut tentang izin yang hilang yang harus ditambahkan.
Melihat VcpuLimitErrors
-
Apa yang terjadi?
AWS ParallelCluster gagal meluncurkan instans karena mencapai batas vCPU pada Anda Akun AWS untuk jenis instans Amazon EC2 tertentu yang Anda konfigurasikan untuk node komputasi cluster.
-
Bagaimana cara menyelesaikannya?
Periksa
VcpuLimitExceededkesalahan dalamclustermgtdfile untuk node statis, dan periksaslurm_resume.logfile untuk node dinamis untuk mendapatkan detail tambahan. Untuk mengatasi masalah ini, Anda dapat meminta peningkatan batas vCPU Anda. Untuk informasi selengkapnya tentang cara melihat batas saat ini dan meminta batas baru, lihat kuota layanan Amazon Elastic Compute Cloud di Panduan Pengguna Amazon Elastic Compute Cloud untuk Instans Linux.
Melihat VolumeLimitErrors
-
Apa yang terjadi?
Anda telah mencapai batas volume Amazon EBS pada Akun AWS, dan AWS ParallelCluster tidak dapat meluncurkan instans dengan kode kesalahan
InsufficientVolumeCapacityatauVolumeLimitExceeded. -
Bagaimana cara menyelesaikannya?
Periksa
clustermgtdfile untuk node statis, dan periksaslurm_resume.logfile untuk node dinamis untuk mendapatkan detail batas volume tambahan. Untuk mengatasi masalah ini, Anda dapat menggunakan volume yang berbeda Wilayah AWS, membersihkan volume yang ada, atau menghubungi Pusat AWS Dukungan untuk mengirimkan permintaan untuk meningkatkan batas volume Amazon EBS Anda.
Melihat InsufficientCapacityErrors
-
Apa yang terjadi?
AWS ParallelCluster tidak memiliki kapasitas yang cukup untuk meluncurkan instans Amazon EC2 ke node cadangan.
-
Bagaimana cara menyelesaikannya?
Periksa
clustermgtdfile untuk node statis, dan periksaslurm_resume.logfile untuk node dinamis untuk mendapatkan detail kesalahan kapasitas yang tidak mencukupi. Untuk memecahkan masalah, ikuti panduan di https://aws.amazon.com/premiumsupport/knowledge-center/ec2-insufficient-capacity-errors/.
OtherInstanceLaunchFailures
-
Apa yang terjadi?
Instans Amazon EC2 untuk mendukung node komputasi gagal diluncurkan dengan API
CreateFleetorRunInstance. -
Bagaimana cara menyelesaikannya?
Periksa
clustermgtdfile untuk node statis, dan periksaslurm_resume.logfile untuk node dinamis untuk mendapatkan detail kesalahan.
Melihat Kesalahan Instans Tidak Sehat Grafik
-
Apa yang terjadi?
Sejumlah instance komputasi diluncurkan tetapi kemudian dihentikan karena tidak sehat.
-
Bagaimana cara menyelesaikannya?
Untuk informasi selengkapnya tentang pemecahan masalah node yang tidak sehat, lihatMemecahkan masalah penggantian dan penghentian node yang tidak terduga.
Melihat InstanceBootstrapTimeoutError
-
Apa yang terjadi?
Sebuah instance tidak dapat bergabung dengan cluster di dalam
resume_timeout(untuk node dinamis) ataunode_replacement_timeout(untuk node statis). Hal ini dapat terjadi jika jaringan tidak dikonfigurasi dengan benar untuk node komputasi, atau dapat terjadi jika skrip kustom yang berjalan pada node komputasi membutuhkan waktu terlalu lama untuk diselesaikan. -
Bagaimana cara menyelesaikannya?
Untuk node dinamis, periksa
clustermgtdlog (/var/log/parallelcluster/clustermgtd) untuk alamat IP node komputasi dan kesalahan seperti berikut:Node bootstrap error: Resume timeout expires for nodeUntuk node statis, periksa
clustermgtdlog (/var/log/parallelcluster/clustermgtd) untuk alamat IP node komputasi dan kesalahan seperti berikut:Node bootstrap error: Replacement timeout expires for node ... in replacement.Untuk detail tambahan, periksa
/var/log/cloud-init-output.logfile untuk kesalahan. Anda dapat mengambil alamat IP node komputasi yang bermasalah dari fileclustermgtddanslurm_resumelog.
Melihat EC2HealthCheckErrors
-
Apa yang terjadi?
Sebuah instance gagal dalam pemeriksaan kesehatan Amazon EC2.
-
Bagaimana cara menyelesaikannya?
Untuk informasi tentang cara memecahkan masalah ini, lihat Memecahkan masalah instans dengan pemeriksaan status gagal.
Melihat ScheduledEventHealthCheckErrors
-
Apa yang terjadi?
Instans gagal dalam pemeriksaan kesehatan acara terjadwal Amazon EC2, dan itu tidak sehat.
-
Bagaimana cara menyelesaikannya?
Untuk informasi tentang cara memecahkan masalah ini, lihat Acara terjadwal untuk instans Anda.
Melihat NoCorrespondingInstanceErrors
-
Apa yang terjadi?
AWS ParallelCluster tidak dapat menemukan instance yang mendukung node. Node kemungkinan telah dihentikan sendiri selama operasi bootstrap. SlurmQueues/CustomActions/OnNodeStart| OnNodeConfigured script, atau kesalahan jaringan dapat dihasilkan
NoCorrespondingInstanceErrors. -
Bagaimana cara menyelesaikannya?
Untuk detail tambahan, periksa
/var/log/cloud-init-output.loguntuk simpul komputasi.
Melihat Hitung Waktu Idle Armada Grafik
Melihat MaxDynamicNodeIdleTime yang jauh lebih panjang dari Waktu Idle Scaledown ambang
-
Apa yang terjadi?
Instans Anda tidak berakhir dengan benar.
MaxDynamicNodeIdleTimemenunjukkan waktu maksimum dalam detik saat node dinamis, didukung oleh instans Amazon EC2, tidak aktif. Am bang batas Waktu Idle Scaledown diturunkan dari parameter konfigurasi ScaledownIdletime cluster. Ketika node komputasi tidak aktif selama lebih dari detik Scaledown Waktu Idle, Slurm matikan node dan menghentikan instance AWS ParallelCluster pendukung. Dalam hal ini, ada sesuatu yang mencegah penghentian instance. -
Bagaimana cara menyelesaikannya?
Untuk informasi lebih lanjut tentang masalah ini, lihat Mengganti, menghentikan, atau mematikan instans dan node yang bermasalah diMemecahkan masalah penskalaan.