View a markdown version of this page

Mencoba membuat cluster - AWS ParallelCluster

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mencoba membuat cluster

Saat menggunakan AWS ParallelCluster versi 3.5.0 dan yang lebih baru untuk membuat cluster, dan pembuatan cluster gagal dengan --rollback-on-failure set tofalse, gunakan perintah pcluster deskripsi-cluster CLI untuk mendapatkan status dan informasi kegagalan. Dalam hal ini, yang diharapkan clusterStatus dari pcluster describe-cluster output adalahCREATE_FAILED. Periksa failures bagian dalam output untuk menemukan failureCode danfailureReason. Kemudian, di bagian berikut, temukan pencocokan failureCode untuk bantuan pemecahan masalah tambahan. Untuk informasi selengkapnya, lihat pcluster deskripsi-cluster.

Di bagian berikut, kami sarankan Anda memeriksa log pada node kepala, seperti /var/log/chef-client.log file /var/log/cfn-init.log dan. Untuk informasi lebih lanjut tentang AWS ParallelCluster log dan cara melihatnya, lihat Log kunci untuk debugging danMengambil dan melestarikan log.

Jika Anda tidak memilikifailureCode, navigasikan ke CloudFormation konsol untuk melihat tumpukan cluster. Periksa Status Reason kegagalan HeadNodeWaitCondition atau pada sumber daya lain untuk menemukan detail kegagalan tambahan. Untuk informasi selengkapnya, lihat Tampilan CloudFormation peristiwa di CREATE_FAILED. Periksa /var/log/chef-client.log file /var/log/cfn-init.log dan pada node kepala. Jika pembuatan cluster gagal karena kegagalan pembuatan node kepala dan log cluster tidak tersedia di grup log cluster, Anda harus mempertahankan cluster pada kegagalan, tentukan --rollback-on-failure = True dan mengambil log dari dalam node kepala itu sendiri.

FailureCode adalah OnNodeConfiguredExecutionFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di OnNodeConfigured bagian node kepala dalam konfigurasi untuk membuat cluster. Namun, skrip kustom gagal dijalankan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/cfn-init.log file untuk mempelajari lebih lanjut tentang kegagalan dan cara memperbaiki masalah di skrip kustom Anda. Menjelang akhir log ini, Anda mungkin melihat informasi run yang terkait dengan OnNodeConfigured skrip setelah Running command runpostinstall pesan.

FailureCode adalah OnNodeConfiguredDownloadFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di OnNodeConfigured bagian node kepala dalam konfigurasi untuk membuat cluster. Namun, skrip kustom gagal diunduh.

  • Bagaimana cara menyelesaikannya?

    Pastikan URL valid dan akses dikonfigurasi dengan benar. Untuk informasi selengkapnya tentang konfigurasi skrip bootstrap kustom, lihatTindakan bootstrap khusus.

    Periksa /var/log/cfn-init.log file-nya. Menjelang akhir log ini, Anda mungkin melihat informasi run yang terkait dengan pemrosesan OnNodeConfigured skrip, termasuk mengunduh, setelah Running command runpostinstall pesan.

FailureCode adalah OnNodeConfiguredFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di OnNodeConfigured bagian node kepala dalam konfigurasi untuk membuat cluster. Namun, penggunaan skrip kustom gagal dalam penerapan cluster. Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/cfn-init.log file-nya. Menjelang akhir log ini, Anda mungkin melihat informasi run terkait pemrosesan OnNodeConfigured skrip setelah Running command runpostinstall pesan.

FailureCode adalah OnNodeStartExecutionFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di OnNodeStart bagian node kepala dalam konfigurasi untuk membuat cluster. Namun, skrip kustom gagal dijalankan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/cfn-init.log file untuk mempelajari lebih lanjut tentang kegagalan dan cara memperbaiki masalah di skrip kustom Anda. Menjelang akhir log ini, Anda mungkin melihat informasi run yang terkait dengan OnNodeStart skrip setelah Running command runpreinstall pesan.

FailureCode adalah OnNodeStartDownloadFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di OnNodeStart bagian node kepala dalam konfigurasi untuk membuat cluster. Namun, skrip kustom gagal diunduh.

  • Bagaimana cara menyelesaikannya?

    Pastikan URL valid dan akses dikonfigurasi dengan benar. Untuk informasi selengkapnya tentang konfigurasi skrip bootstrap kustom, lihatTindakan bootstrap khusus.

    Periksa /var/log/cfn-init.log file-nya. Menjelang akhir log ini, Anda mungkin melihat informasi run yang terkait dengan pemrosesan OnNodeStart skrip, termasuk mengunduh, setelah Running command runpreinstall pesan.

FailureCode adalah OnNodeStartFailure

  • Mengapa gagal?

    Anda menyediakan skrip kustom di bagian node kepala dalam konfigurasi untuk membuat cluster. OnNodeStart Namun, penggunaan skrip kustom gagal dalam penerapan cluster. Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/cfn-init.log file-nya. Menjelang akhir log ini, Anda mungkin melihat informasi run terkait pemrosesan OnNodeStart skrip setelah Running command runpreinstall pesan.

FailureCode adalah EbsMountFailure

  • Mengapa gagal?

    Volume EBS yang ditentukan dalam konfigurasi cluster gagal dipasang.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/chef-client.log file untuk detail kegagalan.

FailureCode adalah EfsMountFailure

  • Mengapa gagal?

    Volume Amazon EFS yang ditentukan dalam konfigurasi cluster gagal dipasang.

  • Bagaimana cara menyelesaikannya?

    Jika Anda mendefinisikan sistem file Amazon EFS yang ada, pastikan lalu lintas diizinkan antara cluster dan sistem file. Untuk informasi lebih lanjut, lihat SharedStorage/EfsSettings/FileSystemId.

    Periksa /var/log/chef-client.log file untuk detail kegagalan.

FailureCode adalah FsxMountFailure

  • Mengapa gagal?

    Sistem file Amazon FSx yang ditentukan dalam konfigurasi cluster gagal dipasang.

  • Bagaimana cara menyelesaikannya?

    Jika Anda mendefinisikan sistem file Amazon FSx yang ada, pastikan lalu lintas diizinkan antara cluster dan sistem file. Untuk informasi lebih lanjut, lihat SharedStorage/FsxLustreSettings/FileSystemId.

    Periksa /var/log/chef-client.log file untuk detail kegagalan.

FailureCode adalah RaidMountFailure

  • Mengapa gagal?

    Volume RAID yang ditentukan dalam konfigurasi cluster gagal dipasang.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/chef-client.log file untuk detail kegagalan.

FailureCode adalah AmiVersionMismatch

  • Mengapa gagal?

    AWS ParallelCluster Versi yang digunakan untuk membuat AMI kustom berbeda dari AWS ParallelCluster versi yang digunakan untuk mengkonfigurasi cluster. Di CloudFormation konsol, lihat detail CloudFormation tumpukan cluster dan periksa Status Reason HeadNodeWaitCondition untuk mendapatkan detail tambahan tentang AWS ParallelCluster versi dan AMI. Untuk informasi selengkapnya, lihat Tampilan CloudFormation peristiwa di CREATE_FAILED.

  • Bagaimana cara menyelesaikannya?

    Pastikan AWS ParallelCluster versi yang digunakan untuk membuat AMI kustom adalah AWS ParallelCluster versi yang sama yang digunakan untuk mengkonfigurasi cluster. Anda dapat mengubah versi AMI khusus atau versi pcluster CLI untuk membuatnya sama.

FailureCode adalah InvalidAmi

  • Mengapa gagal?

    AMI kustom tidak valid karena tidak dibuat menggunakan AWS ParallelCluster.

  • Bagaimana cara menyelesaikannya?

    Gunakan pcluster build-image perintah untuk membuat AMI dengan menjadikan AMI sebagai gambar induk. Untuk informasi selengkapnya, lihat citra bangunan pcluster.

FailureCode HeadNodeBootstrapFailure dengan failureReas on Gagal mengatur node kepala.

  • Mengapa gagal?

    Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan. Misalnya, bisa jadi cluster dalam status dilindungi, dan ini bisa disebabkan oleh kegagalan untuk menyediakan armada komputasi statis.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/chef-client.log. file untuk detail kegagalan.

    catatan

    Jika Anda melihat RuntimeError pengecualianCluster state has been set to PROTECTED mode due to failures detected in static node provisioning, cluster berada dalam status dilindungi. Untuk informasi selengkapnya, lihat Cara men-debug mode yang dilindungi.

FailureCode HeadNodeBootstrapFailure dengan waktu hab is waktu pembuatan FailureReason Cluster.

  • Mengapa gagal?

    Secara default, ada batas waktu 30 menit untuk menyelesaikan pembuatan cluster. Jika pembuatan cluster belum selesai dalam jangka waktu ini, pembuatan cluster gagal dengan kesalahan batas waktu. Pembuatan cluster dapat habis waktu karena alasan yang berbeda. Misalnya, kegagalan batas waktu dapat disebabkan oleh kegagalan pembuatan node kepala, masalah jaringan, skrip khusus yang membutuhkan waktu terlalu lama untuk dijalankan di node kepala, kesalahan dalam skrip kustom yang berjalan di node komputasi, atau waktu tunggu yang lama untuk penyediaan node komputasi. Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/chef-client.log file /var/log/cfn-init.log dan untuk detail kegagalan. Untuk informasi lebih lanjut tentang AWS ParallelCluster log dan cara mendapatkannya, lihat Log kunci untuk debugging danMengambil dan melestarikan log.

    Anda mungkin menemukan yang berikut di log ini.

    • Melihat Waiting for static fleet capacity provisioning mendekati akhir chef-client.log

      Ini menunjukkan bahwa waktu pembuatan cluster habis saat menunggu node statis menyala. Untuk informasi selengkapnya, lihat Melihat kesalahan dalam inisialisasi simpul komputasi.

    • Skrip node melihat OnNodeConfigured atau OnNodeStart kepala belum selesai di akhir cfn-init.log

      Ini menunjukkan bahwa skri OnNodeConfigured p OnNodeStart kustom membutuhkan waktu lama untuk dijalankan dan menyebabkan kesalahan batas waktu. Periksa skrip kustom Anda untuk masalah yang mungkin menyebabkannya berjalan untuk waktu yang lama. Jika skrip kustom Anda membutuhkan waktu yang lama untuk dijalankan, pertimbangkan untuk mengubah batas waktu tunggu dengan menambahkan DevSettings bagian ke file konfigurasi cluster Anda, seperti yang ditunjukkan pada contoh berikut:

      DevSettings: Timeouts: HeadNodeBootstrapTimeout: 2100 # default setting: 2100 seconds
    • Tidak dapat menemukan log, atau node kepala tidak berhasil dibuat

      Ada kemungkinan bahwa node kepala tidak berhasil dibuat dan log tidak dapat ditemukan. Dalam hal ini, Anda bisa mendapatkan detail kegagalan tambahan dengan memeriksa peristiwa CloudFormation tumpukan dan log konsol node kepala. Anda dapat mengambil log konsol node kepala melalui konsol Amazon EC2 atau dengan menjalankan perintah Amazon EC2 CLI berikut:

      aws ec2 get-console-output --instance-id HEAD_NODE_INSTANCE_ID --output text

FailureCode HeadNodeBootstrapFailure dengan failureReas on Gagal mem-bootstrap node kepala.

  • Mengapa gagal?

    Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan.

  • Bagaimana cara menyelesaikannya?

    Periksa /var/log/chef-client.log file /var/log/cfn-init.log dan.

FailureCode adalah ResourceCreationFailure

  • Mengapa gagal?

    Pembuatan beberapa sumber daya gagal selama proses pembuatan cluster. Kegagalan dapat terjadi karena berbagai alasan. Misalnya, kegagalan pembuatan sumber daya dapat disebabkan oleh masalah kapasitas atau kebijakan IAM yang salah konfigurasi.

  • Bagaimana cara menyelesaikannya?

    Di CloudFormation konsol, lihat tumpukan cluster untuk memeriksa detail kegagalan pembuatan sumber daya tambahan.

FailureCode adalah ClusterCreationFailure

  • Mengapa gagal?

    Penyebab langsung tidak dapat ditentukan dan penyelidikan tambahan diperlukan.

  • Bagaimana cara menyelesaikannya?

    Di CloudFormation konsol, lihat tumpukan cluster dan periksa Status Reason HeadNodeWaitCondition untuk menemukan detail kegagalan tambahan.

    Periksa /var/log/chef-client.log file /var/log/cfn-init.log dan.

Melihat WaitCondition waktu habis...dalam CloudFormation tumpukan

Untuk informasi selengkapnya, lihat FailureCode HeadNodeBootstrapFailure dengan waktu hab is waktu pembuatan FailureReason Cluster..

Melihat pembuatan Sumber daya dibatalkan di CloudFormation tumpukan

Untuk informasi selengkapnya, lihat FailureCode adalah ResourceCreationFailure.

Melihat Gagal menjalankan cfn-init...atau kesalahan lain dalam CloudFormation tumpukan

Periksa /var/log/cfn-init.log dan /var/log/chef-client.log untuk detail kegagalan tambahan.

Melihat chef-client.log berakhir dengan INFO: Menunggu penyediaan kapasitas armada statis

Ini terkait dengan batas waktu pembuatan cluster saat menunggu node statis menyala. Untuk informasi selengkapnya, lihat Melihat kesalahan dalam inisialisasi simpul komputasi.

Melihat Gagal menjalankan prainstal atau postinstall di cfn-init.log

Anda memiliki OnNodeStart skrip OnNodeConfigured atau di HeadNode bagian konfigurasi cluster. Script tidak berfungsi dengan benar. Periksa /var/log/cfn-init.log file untuk detail kesalahan skrip khusus.

Melihat AMI ini dibuat dengan xxx, tetapi mencoba digunakan dengan xxx...dalam CloudFormation tumpukan

Untuk informasi selengkapnya, lihat FailureCode adalah AmiVersionMismatch.

Melihat AMI ini tidak dipanggang oleh AWS ParallelCluster...dalam CloudFormation tumpukan

Untuk informasi selengkapnya, lihat FailureCode adalah InvalidAmi.

Melihat perintah pcluster create-cluster gagal dijalankan secara lokal

Periksa ~/.parallelcluster/pcluster-cli.log sistem file lokal Anda untuk detail kegagalan.

Dukungan Tambahan

Ikuti panduan pemecahan masalah diMemecahkan masalah penerapan cluster.

Periksa untuk melihat apakah skenario Anda tercakup dalam Masalah GitHub yang Diket ahui AWS ParallelCluster di on GitHub.