Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mencoba menjalankan pekerjaan
Bagian berikut menyediakan kemungkinan solusi pemecahan masalah jika Anda mengalami masalah saat mencoba menjalankan pekerjaan.
pekerjaan interaktif srun gagal dengan kesalahan srun: error: fwd_tree_thread: tidak dapat menemukan alamat untuk host, periksa slurm.conf < >
-
Mengapa gagal?
Anda menjalankan
srunperintah untuk mengirimkan pekerjaan, dan kemudian Anda meningkatkan ukuran antrian dengan menggunakanpcluster update-clusterperintah tanpa memulai ulang Slurm daemon setelah pembaruan selesai.Slurmmengatur Slurm daemon dalam hierarki pohon untuk mengoptimalkan komunikasi. Hirarki ini hanya diperbarui saat daemon dimulai.
Misalkan Anda menggunakan
srununtuk meluncurkan pekerjaan dan kemudian menjalankanpcluster update-clusterperintah untuk meningkatkan ukuran antrian. Node komputasi baru diluncurkan sebagai bagian dari pembaruan. Kemudian, Slurm antrikan pekerjaan Anda ke salah satu node komputasi baru. Dalam hal ini, baik Slurm daemon maupunsruntidak mendeteksi node komputasi baru.srunmengembalikan kesalahan karena tidak mendeteksi node baru. -
Bagaimana cara menyelesaikannya?
Mulai ulang Slurm daemon pada semua node komputasi, lalu gunakan
srununtuk mengirimkan pekerjaan Anda. Anda dapat menjadwalkan Slurm restart daemon dengan menjalankanscontrol rebootperintah yang memulai ulang node komputasi. Untuk informasi selengkapnya, lihat scontrol rebootdalam Slurm dokumentasi. Anda juga dapat me-restart Slurm daemon secara manual pada node komputasi dengan meminta restart layanan yang sesuai. systemd
Pekerjaan terjebak dalam status CF dengan perintah squeue
Ini mungkin masalah dengan menyalakan node dinamis. Untuk informasi selengkapnya, lihat Melihat kesalahan dalam inisialisasi simpul komputasi.
Menjalankan pekerjaan skala besar dan melihat nfsd: terlalu banyak koneksi terbuka, pertimbangkan untuk meningkatkan jumlah utas di //messages var/log
Dengan sistem file jaringan, ketika batas jaringan tercapai, waktu I/O tunggu juga meningkat. Hal ini dapat mengakibatkan soft lockup karena jaringan digunakan untuk menulis data untuk jaringan dan I/O metrik.
Dengan instance generasi ke-5, kami menggunakan driver ENA untuk mengekspos penghitung paket. Penghitung ini menghitung paket yang dibentuk oleh AWS ketika jaringan mencapai batas bandwidth instance. Anda dapat memeriksa penghitung ini untuk melihat apakah mereka lebih besar dari 0. Jika ya, maka Anda telah melampaui batas bandwidth Anda. Anda dapat melihat penghitung ini dengan menjalankanethtool -S eth0 | grep exceeded.
Melebihi batas jaringan seringkali merupakan hasil dari mendukung terlalu banyak koneksi NFS. Ini adalah salah satu hal pertama yang harus diperiksa ketika Anda mencapai atau melampaui batas jaringan.
Misalnya, output berikut menunjukkan paket yang dijatuhkan:
$ethtool -S eth0 | grep exceededbw_in_allowance_exceeded: 38750610 bw_out_allowance_exceeded: 1165693 pps_allowance_exceeded: 103 conntrack_allowance_exceeded: 0 linklocal_allowance_exceeded: 0
Untuk menghindari pesan ini, pertimbangkan untuk mengubah jenis instance node kepala ke jenis instance yang lebih berkinerja tinggi. Pertimbangkan untuk memindahkan penyimpanan data Anda ke sistem file penyimpanan bersama yang tidak diekspor sebagai berbagi NFS, seperti Amazon EFS atau Amazon FSx. Untuk informasi lebih lanjut, lihat Penyimpanan bersama dan Praktik
Menjalankan pekerjaan MPI
Mengaktifkan mode debug
Untuk mengaktifkan mode debug OpenMPI, lihat Kontrol apa yang dimiliki Open MPI yang membantu dalam debugging.
Untuk mengaktifkan mode debug IntelMPI, lihat Variabel Lingkungan Lainnya.
Melihat MPI_ERRORS_ARE_FATAL dan OPAL ERR OR di output pekerjaan
Kode kesalahan ini berasal dari lapisan MPI di aplikasi Anda. Untuk mempelajari cara mendapatkan log debug MPI dari aplikasi Anda, lihatMengaktifkan mode debug.
Kemungkinan penyebab kesalahan ini adalah bahwa aplikasi Anda telah dikompilasi untuk implementasi MPI tertentu, seperti OpenMPI, dan Anda mencoba menjalankannya dengan implementasi MPI yang berbeda, seperti IntelMPI. Pastikan Anda mengkompilasi dan menjalankan aplikasi Anda dengan implementasi MPI yang sama.
Menggunakan mpirun dengan DNS terkelola dinonaktifkan
Untuk cluster yang dibuat SlurmSettings den gan /D DisableManagedDns ns UseEc2Hostnames/dan true diset Slurm el ke, nama node tidak diselesaikan oleh DNS. Slurmdapat mem-bootstrap proses MP nodenames I ketika tidak diaktifkan dan jika pekerjaan MPI dijalankan dalam suatu Slurm konteks. Sebaiknya ikuti panduan dalam Panduan Pengguna Slurm MPI