View a markdown version of this page

Pemecahan masalah jaringan - AWS ParallelCluster

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Pemecahan masalah jaringan

Bagian ini memberikan tip pemecahan masalah ketika Anda menemukan masalah jaringan, khususnya saat berurusan dengan cluster dalam satu masalah subnet publik.

Cluster dalam masalah subnet publik tunggal

Di AWS ParallelCluster 3.16.0 dan yang lebih baru, periksa node kom /var/log/chef-client.log putasi yang gagal. Jika Anda menemukan kesalahan yang mirip dengan berikut ini, node tidak dapat mencapai DynamoDB selama bootstrap:

INFO: Retrying execution of ruby_block[retrieve compute node info], 0 attempt left ================================================================================ Error executing action `run` on resource 'ruby_block[retrieve compute node info]' ================================================================================ RuntimeError ------------ Failed to query DynamoDB for compute node info: the aws cli call did not return in time and was terminated. This usually means the compute node cannot reach DynamoDB. If the compute subnet has no internet egress (NAT/IGW), ensure a DynamoDB VPC gateway endpoint is configured and attached to the subnet's route table.

Dalam AWS ParallelCluster versi sebelum 3.16.0, node komputasi mungkin diam-diam hang selama bootstrap alih-alih gagal cepat. Per cloud-init-output.log iksa node komputasi untuk entri log seperti di bawah ini, yang menunjukkan node macet mengambil informasi dari DynamoDB:

ruby_block[retrieve compute node info] action run[2022-03-11T17:47:11+00:00] INFO: Processing ruby_block[retrieve compute node info] action run (aws-parallelcluster-slurm::init line 31)

Penyebab paling umum adalah titik akhir VPC DynamoDB yang hilang, karena AWS ParallelCluster membaca informasi simpul komputasi dari DynamoDB selama bootstrap. Untuk daftar lengkap titik akhir yang diperlukan, lihatAWS ParallelCluster dalam satu subnet tanpa akses internet.

Untuk mengatasinya, tambahkan titik akhir VPC yang hilang (biasanya DynamoDB) ke tabel rute subnet komputasi. Jika cluster telah memasuki mode dilindungi, lihat Slurm mode terlindungi cluster cara memulihkan.