Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Saya mengonfigurasi reservasi kapasitas sesuai permintaan (ODCR) atau Instans Cadangan zona
ODCR yang menyertakan instance yang memiliki beberapa antarmuka jaringan, seperti P4d, P4de, dan AWS Trainium (Trn)
Dalam file konfigurasi cluster, periksa apakah HeadNode ada di subnet publik dan bahwa node komputasi berada di subnet pribadi.
ODCR adalah ODCR yang ditargetkan
Melihat Tidak dapat membaca file 'opt/slurm/etc/pcluster/run_instances_overrides.json'.meskipun saya sudah memiliki opt/slurm/etc/pcluster/run_instances_overri des.json di tempat dengan mengikuti instruksi yang diberikan di Luncurkan instans dengan On-Demand Reservasi Kapasitas (ODCR)
Jika Anda menggunakan AWS ParallelCluster versi 3.1.1 hingga 3.2.1 dengan ODCR yang ditargetkan, dan Anda juga menggunakan instance run menggantikan file JSON, ada kemungkinan file JSON Anda tidak diformat dengan benar. Anda dapat melihat kesalahan diclustermgtd.log, seperti berikut ini:
Unable to read file '/opt/slurm/etc/pcluster/run_instances_overrides.json'. Using default: {} in /var/log/parallelcluster/clustermgtd.
Memvalidasi bahwa format file JSON benar dengan menjalankan yang berikut:
$echo /opt/slurm/etc/pcluster/run_instances_overrides.json | jq
Melihat RunInstances parameter yang Ditemukan diganti.di clustermgtd.log ketika pembuatan cluster gagal, atau di slurm_resume.log saat menjalankan pekerjaan gagal
Jika Anda menggunakan run instance mengganti file JSON, periksa apakah Anda menetapkan nama antrian dan nama sumber daya komputasi dengan benar dalam file. /opt/slurm/etc/pcluster/run_instances_overrides.json
Melihat Terjadi kesalahan (InsufficientInstanceCapacity) di slurm_resume.log ketika saya gagal menjalankan pekerjaan, atau di clustermgtd.log ketika saya gagal membuat cluster
Menggunakan PG-ODCR (ODCR Grup Penempatan)
Saat membuat ODCR dengan grup penempatan terkait, nama grup penempatan yang sama harus digunakan dalam file konfigurasi. Tetapkan nama grup penempatan yang sesuai dalam konfigurasi cluster.
Menggunakan Instans Cadangan zona
Jika Anda menggunakan Instans Cadangan zonal denganPlacementGroup/Enabledto true dalam konfigurasi cluster, Anda mungkin melihat kesalahan, seperti berikut ini:
We currently do not have sufficient trn1.32xlarge capacity in the Availability Zone you requested (us-east-1d). Our system will be working on provisioning additional capacity. You can currently get trn1.32xlarge capacity by not specifying an Availability Zone in your request or choosing us-east-1a, us-east-1b, us-east-1c, us-east-1e, us-east-1f.
Anda mungkin melihat ini karena Instans Cadangan zona tidak ditempatkan di UC (atau tulang belakang) yang sama, yang dapat menyebabkan kesalahan kapasitas tidak mencukupi (ICE) saat menggunakan grup penempatan. Anda dapat memeriksa kasus ini dengan menonaktifkan pengaturan PlacementGroup Grup dalam konfigurasi cluster untuk menentukan apakah cluster dapat mengalokasikan instance.